尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

DOPD: Dual On-policy Distillation

发布时间:2026/9/29 8:00:45

资讯中心
01
ARTICLE

DOPD: Dual On-policy Distillation

DOPD: Dual On-policy Distillation
DOPD: Dual On-policy Distillation 论文完整总结+指定章节中英对照翻译一、论文整体核心内容总结1. 研究背景与现存痛点现有在线策略蒸馏(OPD, On-policy Distillation)使用学生模型自采样轨迹,由教师提供逐Token监督,有效缓解离线蒸馏分布偏移问题,是大模型后训练主流方案。但当引入特权信息(Privileged Information)(LLM推理分步提示、VLM视觉标注框等辅助线索)时,传统OPD存在致命缺陷:特权错觉(Privilege Illusion):师生性能差距分为两类,传统方法无法区分:可迁移能力差距:学生真正需要学习的底层能力;信息不对称差距:仅教师能获取特权输入带来的表面优势,学生无法复刻,强行蒸馏会让模型拟合捷径而非通用能力,引发熵坍缩、探索性下降、后期性能下滑。Token监督均匀化缺陷:所有Token使用完全相同的监督来源、损失权重、对齐目标;但轨迹中只有少量Token承载核心能力信息,大量低价值Token掺杂特权捷径噪声,均匀蒸馏会放大特权错觉。现有OPD三类范式(标准师生蒸馏、自蒸馏、自适应蒸馏)均未显式区分能力/信息差距,缺少动态路由机制,在师生模型尺寸差距大、多
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。