尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

Trace‑SFT:利用智能体完整交互轨迹做监督微调,提升工具调用智能体的鲁棒性

发布时间:2026/9/26 1:41:13

资讯中心
01
ARTICLE

Trace‑SFT:利用智能体完整交互轨迹做监督微调,提升工具调用智能体的鲁棒性

Trace‑SFT:利用智能体完整交互轨迹做监督微调,提升工具调用智能体的鲁棒性
Trace‑SFT利用智能体完整交互轨迹做监督微调提升工具调用智能体的鲁棒性arXiv编号arXiv:2609.30249v1摘要工具调用智能体的标准监督微调SFT大多只使用单轮「查询‑工具调用」样例缺少真实多步交互上下文模型很难学会处理工具报错、重试、动态调整规划长视界任务鲁棒性不足。本文提出Trace‑SFT直接使用完整多步智能体交互轨迹做监督微调。每一条训练样本包含整条交互序列用户查询、多轮推理Thought、工具调用Action、工具返回Observation。Trace‑SFT不做截断保留完整时序依赖让模型学习在真实交互流中如何应对失败、修正错误、动态更新规划。为了克服原始轨迹存在大量次优、失败样例的问题本文设计轨迹分层过滤流水线基于任务终态结果、单步工具有效性、推理质量三层打分筛选高质量子轨迹。在Terminal‑Bench 2.1、SWE‑Bench‑Pro、τ³‑Bench三大智能体基准开展实验。Trace‑SFT相比传统单轮SFT任务成功率平均提升**8.3个百分点**即便在少样本数据条件下依旧稳定带来增益。消融实验证实完整时序轨迹输入、分层过滤机制两者缺一不可。开源全部处理脚本、过滤打分规则与实验配置。关键词工具调用智能体监督微调SFT交互轨迹长视界轨迹过滤鲁棒性目录引言相关工作Trace‑SFT方法3.1 传统单轮工具SFT的缺陷3.2 完整交互轨迹训练样本格式3.3 三层轨迹分层过滤流水线实验设置4.1 数据集来源4.2 评测基准4.3 基线对比4.4 训练与评测超参数实验结果5.1 主实验整体性能5.2 少样本数据规模消融5.3 组件消融实验5.4 错误类型统计分析讨论与局限性结论参考文献附录A 轨迹数据处理脚本附录B 打分过滤完整规则附录C 训练超参数附录D 细分实验结果1 引言工具调用大模型智能体在终端操作、软件工程、数据库业务等复杂任务中得到广泛应用。当前工具领域监督微调主流范式将数据拆解成单轮样例输入用户查询输出单步工具调用。该范式存在明显短板训练样本缺少多步交互上下文模型没有见过工具报错、非法参数返回、执行失败等真实反馈模型没有学习到收到错误观测之后如何诊断、重试、调整规划单轮样本割裂时序依赖学到的是孤立工具调用模式迁移到长视界多步任务时鲁棒性差容易陷入循环、无效调用。虽然已经有大量工作使用完整轨迹做强化学习、拒绝采样微调RFT但针对原始交互轨迹直接做SFT监督微调的研究仍然不足。原始运行轨迹中大量存在失败、次优、错误的片段不能直接全部拿来训练低质量轨迹会污染微调效果。本文提出Trace‑SFT直接使用完整多步智能体交互轨迹作为SFT训练样本保留整条Query → Thought → Action → Observation时序链条不做截断拆分单轮。为解决原始轨迹混杂大量坏样例设计三层分层过滤流水线从任务终态、单步工具有效性、推理质量三个维度打分筛选提取高质量子轨迹用于微调。本文贡献提出Trace‑SFT使用完整未截断多步交互轨迹执行监督微调学习处理工具反馈、失败重试与动态规划设计三层轨迹过滤流水线对原始混杂轨迹做筛选过滤失败、次优片段得到可用训练集在Terminal‑Bench 2.1、SWE‑Bench‑Pro、τ³‑Bench三个主流基准验证相比传统单轮SFT平均提升8.3pp少样本条件下增益依旧存在消融证明完整轨迹输入、分层过滤都是关键组件开源轨迹处理脚本、打分规则、全部实验配置。2 相关工作工具调用微调传统工具SFT大多拆分为单轮输入输出只学习“查询→工具调用”映射忽略工具返回观测以及后续推理动作。RFT拒绝采样微调需要对多条轨迹做结果筛选再微调Trace‑SFT聚焦普通SFT直接把整条交互序列作为样本。轨迹数据利用Reflexion、DENSE等工作使用轨迹做反思、提炼经验强化学习类方法利用轨迹做PPOTrace‑SFT属于监督微调不需要奖励模型重点保留完整时序交互流。轨迹过滤与数据清洗很多RFT工作只保留任务成功的完整episodeTrace‑SFT更进一步即使整体episode失败仍然可以提取其中局部高质量子轨迹扩大训练数据来源。3 Trace‑SFT方法3.1 传统单轮工具SFT的缺陷传统单轮工具SFT把一条多步轨迹τ Q , t 1 , a 1 , o 1 , t 2 , a 2 , o 2 … \tau{Q, t_1,a_1,o_1,t_2,a_2,o_2…}τQ,t1​,a1​,o1​,t2​,a2​,o2​…切分多条独立样本( Q h i s t o r y i ) → ( t i , a i ) (Qhistory_i) \rightarrow (t_i,a_i)(Qhistoryi​)→(ti​,ai​)。缺陷训练时看不到o i o_ioi​工具返回观测模型在训练阶段无法学习拿到报错/失败观测之后如何调整后续推理与动作。Trace‑SFT不切分整条交互序列作为一个完整训练样例输入侧包含全部历史推理、动作、工具返回观测模型学习根据完整交互上下文输出下一步Thought‑Action。3.2 完整交互轨迹训练样本格式训练样本整体格式user {用户原始查询Q} /user history t_1 tool_call a_1 /tool_call tool_return o_1 /tool_return t_2 tool_call a_2 /tool_call tool_return o_2 /tool_return ... /history t_n tool_call a_n /tool_call输入上下文包含用户查询 全部历史的推理、工具调用、工具返回结果模型学习预测当前步think推理 tool_call工具调用保留完整时序依赖工具报错、空输出、异常返回全部留在上下文内。注意工具返回o_i属于输入上下文部分不是模型生成目标模型只预测think与tool_call。3.3 三层轨迹分层过滤流水线原始运行轨迹库中有完全成功episode、部分成功部分失败episode、整体完全失败episode。Trace‑SFT不只保留全局成功样本对于整体失败episode抽取内部局部高质量子轨迹。三层过滤逐层打分第一层Episode终态粗筛保留任务完全成功episode对于失败episode不直接丢弃进入下一层尝试提取内部可用子轨迹。第二层单步工具有效性打分遍历轨迹每一步( t i , a i , o i ) (t_i,a_i,o_i)(ti​,ai​,oi​)打分判断✅有效工具调用格式合法、参数合法、执行返回有意义输出❌无效格式解析错误、参数非法、调用不存在工具、返回报错且无有效信息。将连续有效步骤片段切分为候选子轨迹遇到大量无效步骤则截断子轨迹。第三层推理质量打分对候选子轨迹内部每一条think推理片段打分推理是否合理利用前面工具返回观测是否没有脱离上下文编造事实规划逻辑是否自洽过滤掉推理幻觉、逻辑混乱的片段输出最终用于SFT训练的子轨迹样本集合。关键点一条整体失败的episode依然可以产出多条高质量局部子轨迹扩充训练集规模。过滤流水线伪代码示意def filter_trajectory(raw_trajectory_list): final_samples [] for tau in raw_trajectory_list: # 第一层终态粗筛 success_flag get_episode_result(tau) candidate_segments extract_continuous_valid_segments(tau) for seg in candidate_segments: # 第二层单步工具有效性过滤 if check_tool_valid(seg): # 第三层推理质量打分过滤 if check_reasoning_quality(seg): final_samples.append(format_sample(seg)) return final_samples完整打分规则、判断阈值、正则脚本见附录B。4 实验设置4.1 数据集来源原始轨迹库由多个开源基座智能体在训练集任务上运行得到原始交互轨迹。经过Trace‑SFT三层过滤得到Trace‑SFT训练集。对比基线数据集把同源轨迹切分为传统单轮SFT样本保证总样本token量级尽量对齐消除数据量混杂变量。4.2 评测基准Terminal‑Bench 2.1Linux终端命令行任务SWE‑Bench‑ProGitHub Issue软件缺陷修复τ³‑Bench数据库业务仿真智能体。4.3 基线对比Base预训练基座不做工具SFTSingle‑turn SFT传统单轮工具监督微调同源轨迹切分单轮样本token规模对齐Trace‑SFT(Ours)完整Trace‑SFT完整轨迹三层分层过滤消融变体Trace‑SFT w/o filter使用完整轨迹但关闭三层过滤原始轨迹直接训练Fragment‑Trace不保留完整长轨迹随机截断子片段。4.4 训练与评测超参数基座Qwen2.5‑7B‑Instruct训练框架LLaMA‑Factory上下文窗口适配完整轨迹最大长度学习率、epoch、batch等完整参数见附录C。5 实验结果5.1 主实验整体性能配置Terminal‑Bench2.1SWE‑Bench‑Proτ³‑Bench平均Base基座41.2%34.7%38.5%38.1%Single‑turn SFT49.5%42.1%45.3%45.6%Trace‑SFT(Ours)57.2%50.6%53.1%53.6%Trace‑SFT对比传统单轮SFT平均提升8.0个百分点三个基准全部一致正向增益。5.2 少样本数据规模消融逐步降低训练样本总规模100% → 50% → 25%25%数据规模Trace‑SFT依旧比同等数据量单轮SFT高6.2pp证明Trace‑SFT在少样本条件下依旧有效不是依赖海量数据。5.3 组件消融实验配置Terminal‑Bench2.1平均Single‑turn SFT49.5%45.6%Trace‑SFT w/o filter完整轨迹、关闭过滤51.3%47.2%Fragment‑Trace轨迹随机截断片段52.8%48.7%Trace‑SFT 完整版本57.2%53.6%只使用完整轨迹但不做三层过滤仅有小幅提升原始轨迹内大量坏样例带来负面影响分层过滤是重要组件。如果把完整轨迹随机截断为片段收益明显低于完整时序链条保留整条时序上下文是关键。5.4 错误类型统计分析对比Single‑turn SFT与Trace‑SFT推理阶段错误分布Trace‑SFT显著降低收到工具报错之后依旧重复相同错误调用、无效循环调用工具参数错误也得到一定缓解说明模型学到利用工具返回观测去调整后续行为这是单轮SFT很难学到的能力。6 讨论与局限性上下文窗口约束完整长轨迹会消耗大量上下文token需要足够大上下文窗口超长轨迹需要做合理截断。过滤流水线依赖打分启发式规则打分规则存在误判部分高质量子轨迹被过滤部分坏样例漏入训练集。Trace‑SFT属于SFT没有引入强化学习回报信号可以和RFT、RLHF进一步叠加。本实验只针对文本工具调用智能体尚未拓展多模态GUI智能体轨迹微调。未来方向将打分规则升级为模型驱动自动筛选Trace‑SFT结合拒绝采样、强化学习拓展到多模态GUI交互轨迹微调。7 结论本文提出Trace‑SFT直接使用完整多步交互轨迹做监督微调保留用户查询、推理、工具调用、工具返回观测完整时序上下文设计三层分层过滤流水线从成功episode以及失败episode中抽取高质量子轨迹用于训练。在Terminal‑Bench2.1、SWE‑Bench‑Pro、τ³‑Bench三大基准Trace‑SFT对比传统单轮工具SFT平均提升8.0pp少样本条件下依旧稳定增益。消融证实完整时序轨迹输入、三层过滤流水线两者缺一不可。Trace‑SFT让模型更好学会处理工具报错、失败重试、动态调整规划提升长视界工具智能体鲁棒性。全部处理脚本、打分规则、实验配置开源。8 参考文献完整参考文献查阅原始arXiv网页https://arxiv.org/html/2609.30249v1附录简要说明附录A轨迹数据完整处理脚本样例输入输出。附录B三层过滤流水线打分规则、阈值、正则判断逻辑。附录C训练超参数、模型参数、环境配置。附录D各基准细分实验、少样本消融完整数值、错误统计明细。
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。