论文总结与翻译:《Vocabulary expansion through optimal initialization》一、文章主要内容该论文聚焦于预训练大型语言模型(LLMs)在小规模特定领域语料微调时,难以融入新领域术语的问题,提出了一种基于KL散度的知识蒸馏方法,用于解决冻结LLMs的词汇扩展挑战,即使原始模型和扩展模型采用不同的分词方式。1. 研究背景与动机大型语言模型在编程等领域应用广泛,能提升工程师效率,但将其适配新任务或融入新内部知识时,常采用微调开源基础模型的标准方法。新领域训练数据通常远小于预训练时使用的海量数据,且若新领域编程语言符号与模型训练时的代码符号不同,模型难以熟练掌握该语言,词汇扩展成为改善微调过程的重要途径。2. 核心研究问题如何追溯性地扩展预训练模型的词汇表,并训练模型有效整合新token。如何利用新颖的师生框架初始化新组件(新嵌入),而非简单随机初始化或启发式取值(如现有嵌入的均值),通过数学化方法优化新嵌入,使其无缝融入预训练模型结构,将现有嵌入序列压缩为单个能捕捉上下文含义的嵌入。3. 研究方法基于自蒸馏的嵌入初始化:以模型自身为教师初始化新嵌入,用KL散度损
