尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy...

发布时间:2026/9/30 2:19:51

资讯中心
01
ARTICLE

Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy...

Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy...
Nested-ReFT论文总结与关键部分翻译一、文章主要内容总结本文聚焦于大语言模型(LLMs)在数学推理等复杂任务中基于强化学习的微调(ReFT)技术,针对传统ReFT计算成本高的问题,提出了名为“Nested-ReFT”的新型框架,核心内容如下:1. 研究背景与问题ReFT的优势与局限:ReFT通过行为模型生成多个思维链(CoT)完成结果,结合可验证奖励函数优化模型,在数学推理等领域提升显著,但生成多个完成结果需大量推理步骤,导致训练计算成本高昂。现有方案痛点:传统ReFT中,行为模型与目标模型架构一致(如使用前一梯度步的目标模型),生成样本的计算资源与目标模型相当,且增加CoT完成结果数量虽能降低更新偏差,却进一步加剧计算开销。2. 核心框架:Nested-ReFT核心思路:借鉴离线强化学习(Off-Policy RL)和推测解码(Speculative Decoding),将目标模型的部分层作为行为模型,通过“动态层跳过”机制生成离线完成结果,降低推理成本。层跳过机制:定义“有效层集合”:排除模型最内层和最外层(距离边界b层内)的层,仅从中间层中随机跳过一定比例(x%)的层,确保模型生成的结构一致性(内层和外层对生成质量至关
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。