尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

Reef模型权重训练实战:如何用Slime与SGLang让你的Agent模型越用越强

发布时间:2026/9/25 10:46:56

资讯中心
01
ARTICLE

Reef模型权重训练实战:如何用Slime与SGLang让你的Agent模型越用越强

Reef模型权重训练实战:如何用Slime与SGLang让你的Agent模型越用越强
Reef模型权重训练实战如何用Slime与SGLang让你的Agent模型越用越强【免费下载链接】reefContinual learning infra for self-improving agents项目地址: https://gitcode.com/gh_mirrors/reef7/reefReef 是首个面向自我进化 Agent 的开源持续学习基础设施。它把 Agent 推理、反馈、训练与版本化发布连成闭环让你可以配合 Slime 与 SGLang 训练模型权重——用户每用一次 Agent模型就多学一分真正做到越用越强。本文面向新手用最少代码带你跑通一条完整的模型权重训练链路搭建 GPU 训练环境、启动 Slime SGLang 训练栈、接入你的 Agent 上报反馈并观察模型权重热更新上线的全过程。为什么越用越强需要模型权重训练大多数 Agent 部署是静态的模型上线后能力就固定了。如果你希望 Agent 从与用户的日常交互中持续变强就有三条路径可选你的目标学习路径所需条件持续获得更贴合自身需求的模型模型权重训练可训练模型 GPU 训练栈 可用的反馈让 harness 自我进化提示词/规则/技能Harness 优化模型端点 评估器无需训练 GPU做科学发现测试时训练执行环境 正确性检查器Reef 在技术栈中补齐了关键短板推理引擎SGLang 等只会服务流量RL 训练框架Slime 等只会训练权重而 Reef 把两者都管起来还额外提供版本管理与更新期间不中断服务的能力能力推理引擎SGLang…RL 训练框架Slime…Reef承接线上流量✅❌✅训练权重❌✅✅版本管理❌❌✅更新期间持续服务❌❌✅每个学习周期分为四步Serve服务并记录交互→ Observe把反馈匹配到交互→ Grow从合格记录产出更新→ Commit评估选择后发布新版本。本文聚焦其中与模型权重训练相关的主线。一键搭建训练环境GPU 镜像配置模型权重训练需要 Ray、Slime 驱动以及 CUDA 专用构建的 torch、SGLang、Megatron手动装依赖很容易踩坑。Reef 官方做法是把整套训练栈打进一个 Docker 镜像见 docker/Dockerfile.reef 与 docker/README.md# 1. 克隆源码训练示例需要源码安装 git clone https://gitcode.com/gh_mirrors/reef7/reef cd reef git lfs install # Reef 用 Git LFS 管理权重文件必须先初始化 # 2. 构建训练镜像Slime SGLang Ray Megatron 全部预装 docker build -f docker/Dockerfile.reef -t reef . # 3. 进入容器挂载模型目录与 Reef 状态目录 docker run --gpus all --network host --ipc host --shm-size 32g -it \ -v ~/models:/root/models \ -v ~/reef-run:/var/lib/reef \ -v $PWD:/workspace/Reef \ reef bash 参数说明--network host让 Slime 驱动、SGLang 与 Reef 能在 localhost 互相发现--ipc host --shm-size 32g是训练栈共享内存的硬性要求。镜像默认锁定带有 Reef 适配器接收能力的 SGLang 版本LoRA 训练开箱即用。Slime 管训练、SGLang 管推理启动训练部署权重训练时三个角色各司其职详见 docs/user-guide/evolve-your-model.rst进程负责Ray Slime 驱动GPU、优化器、checkpointreef/train/slime_backend/Reef请求、记录、版本发布链SGLang 引擎服务当前权重并捕获训练所需的 token id 与 logprobreef/inference/sglang/每个训练示例都自带完整的serve.yaml按正确顺序拉起进程。以最小的 SAO 示例2 张 GPU、Qwen2.5-1.5B为例export REEF_TOKENreef-local reef serve -c recipes/sao/examples/imo_answerbench/serve.yaml \ --inference.model-path ~/models/Qwen2.5-1.5B-Instruct # 启动约需几分钟等健康检查通过 curl -f http://127.0.0.1:8900/healthz启动前重点检查 recipes/sao/examples/imo_answerbench/serve.yaml 中的三处配置批大小必须一致recipe 的batch-size必须等于training.config.global_batch_size否则优化器批次不完整recipe 与 loss 参数要描述同一目标Slime 驱动会在启动时校验loss 参数lr、eps-clip、use-critic等写在training.options推理后端必须能捕获训练张量权重训练需要推理时精确的 token id、loss mask 和 rollout logprobSGLang 训练后端会把它们记录在response.training中。接入你的 Agent请求 → 回执 → 反馈三步走Reef 的推理端点兼容 OpenAI 与 Anthropic 格式向/v1/chat/completions发请求时带上x-reef-scenario请求头即可新名称会自动创建 scenario。训练闭环的关键在回执receipt机制只需三步发请求模型返回答案的同时Reef 在响应头x-reef-agent-record-id里给你一张本次交互的回执上报反馈调用/reef/report把数值score、文本feedback与回执一起提交上报 schema 见 reef/core/reports/自动训练当合格反馈攒够batch_size条recipe 自动组装训练批次向 Slime 发起一次优化器步进。以 recipes/basic/ 中演示的 Python 客户端为例核心就两句拿到response.headers[x-reef-agent-record-id]再post(/reef/report, {score: 1.0, references: [receipt]})。你的 Agent 代码几乎不用改动——把原来指向模型 API 的地址换成 Reef 即可。观察模型变强版本历史与热更新反馈达标后Reef 会保存 checkpoint、把新权重热更新进 SGLang 引擎并记录新版本——后续推理直接命中新权重全程无需重启服务。查询版本链curl -sS -H Authorization: Bearer reef-local \ http://127.0.0.1:8900/reef/scenarios/你的scenario/releases出现新的training条目即代表完成了一次训练步。另外两个实用技巧LoRA 多 scenario 共享底座加上--megatron-lora-rank32等参数后一个冻结底座可同时训练多个 scenario 各自的 LoRA 适配器。每次发布只含几 MB 的适配器标准 HF PEFT 格式可用transformerspeft在 Reef 之外直接加载因此每个版本都可持久化存档候选评估门禁默认训练成功即发布也可加evaluation段先对导出 checkpoint 做评估不合格则继续用当前版本。实测效果官方示例的学习曲线SAO 示例在 IMOAnswerBench 上训练模型每解决一道题就用更新后的权重去解下一道。SAO 与基线 GRPO(DIS) 的留出集准确率对比显示SAO 稳定训练 99 步后在 AIME 与 IMOAnswerBench 上提升 2~4 分而对照基线后期明显退化TTT-Discover 示例则展示了测试时训练模型在搜索 Erdős 问题解的同时用 LoRA 持续微调自己WB 记录的训练指标如下8×64 搜索网格每格一次优化器步进Erdős 最小重叠问题的最优解随搜索步数持续改善逼近论文目标值OpenClaw-RL 展示了最贴近越用越强的场景从真实对话中学习用户偏好被接受的回复是正样本抱怨的回复是负样本训练全程 Agent 保持在线服务如何为我的场景选训练配方Recipe按任务形状对号入座recipe 实现位于 recipes/官方文档见 docs/user-guide/recipes/配方任务形状信号来源典型资源SAO校验器逐个打分的独立任务流每次尝试一个分数即来即训2 卡起步TTT-Discover对一个难题反复搜索整格 rollout 打分后一次步进2 卡 LoRAOpenClaw-RL无人上报分数的真实交互对话流量 PRM 评审7 卡含 PRM 与学生模型新手建议从 SAO 冒烟配置入手它只用 2 张 GPU、batch_size: 1一条反馈到达就能看到完整训练链路跑通之后再按 docs/user-guide/recipes/sao.rst 把批大小调回论文默认值 128 做正式训练。常见坑速查清单启动失败先查/reef/status它汇报异步训练/预载失败、当前权重版本、推理准入与 checkpoint 状态/healthz只说明 HTTP 服务活着批大小不一致是最常见的配置错误——recipe 的batch_size与 Slime 的--global-batch-size必须严格相等换模型家族要同步改结构参数Reef 只从 HF 配置推导规模与拓扑参数像--add-qkv-bias、--padded-vocab-size这类模型专属标志需手动核对如 Qwen3 无 QKV bias磁盘余量要够checkpoint 预检要求约 16 倍 HF 模型大小的空闲空间反馈到不了检查请求是否带了x-reef-scenario以及报告里的references是否真的包含响应头里的回执。写在最后Reef 把推理—反馈—训练—发布这条最难打通的链路封装成了基础设施Slime 负责在 GPU 上更新权重SGLang 负责把新权重零停机推上线Reef 负责让每一次用户交互都变成下一版模型的养料。搭好一次训练栈之后你的 Agent 就从上线即巅峰变成了越用越强。想继续深入可以从 docs/user-guide/evolve-your-model.rst 的完整训练指南或 recipes/basic/ 的记录型起步栈开始。【免费下载链接】reefContinual learning infra for self-improving agents项目地址: https://gitcode.com/gh_mirrors/reef7/reef创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。