尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

KL-based self-distillation for large language models

发布时间:2026/9/27 10:28:27

资讯中心
01
ARTICLE

KL-based self-distillation for large language models

KL-based self-distillation for large language models
论文总结与翻译:《Vocabulary expansion through optimal initialization》一、文章主要内容该论文聚焦于预训练大型语言模型(LLMs)在小规模特定领域语料微调时,难以融入新领域术语的问题,提出了一种基于KL散度的知识蒸馏方法,用于解决冻结LLMs的词汇扩展挑战,即使原始模型和扩展模型采用不同的分词方式。1. 研究背景与动机大型语言模型在编程等领域应用广泛,能提升工程师效率,但将其适配新任务或融入新内部知识时,常采用微调开源基础模型的标准方法。新领域训练数据通常远小于预训练时使用的海量数据,且若新领域编程语言符号与模型训练时的代码符号不同,模型难以熟练掌握该语言,词汇扩展成为改善微调过程的重要途径。2. 核心研究问题如何追溯性地扩展预训练模型的词汇表,并训练模型有效整合新token。如何利用新颖的师生框架初始化新组件(新嵌入),而非简单随机初始化或启发式取值(如现有嵌入的均值),通过数学化方法优化新嵌入,使其无缝融入预训练模型结构,将现有嵌入序列压缩为单个能捕捉上下文含义的嵌入。3. 研究方法基于自蒸馏的嵌入初始化:以模型自身为教师初始化新嵌入,用KL散度损
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。