尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

Enhancing Large Language Model Reasoning via Selective Critical Token Fine-Tuning

发布时间:2026/9/25 14:32:45

资讯中心
01
ARTICLE

Enhancing Large Language Model Reasoning via Selective Critical Token Fine-Tuning

Enhancing Large Language Model Reasoning via Selective Critical Token Fine-Tuning
该文章提出了“关键令牌微调(CFT)”方法,通过仅更新对推理正确性至关重要的令牌,解决了传统监督微调(SFT)的局限性,在数学推理等任务中实现了更高的准确性、多样性和泛化能力。一、文章主要内容总结研究背景与问题传统SFT在微调大语言模型(LLMs)时,会对所有令牌进行统一惩罚,忽略了只有少数“关键令牌”决定推理正确性。这种统一监督会导致模型输出多样性降低、泛化能力受限,且在处理不完美推理轨迹时效率低下。核心方法:关键令牌微调(CFT)关键令牌识别:通过反事实扰动,替换正确推理轨迹中的每个令牌并重新生成后续内容。若所有替换都导致答案错误,则该令牌被标记为关键令牌。选择性微调:仅对关键令牌应用梯度更新,保留非关键令牌的多样性,避免令牌分布坍缩。效率优化:采用并行解码技术,在Qwen2.5-7B模型上实现了超过25倍的关键令牌标注速度提升。实验验证实验设置:在3个模型家族(Qwen、OLMo、LLaMA)的5个模型上,针对11个数学推理基准(如GSM8K、MATH、SVAMP)进行测试,并与SFT、DFT等方法对比。核心结果:CF
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。