尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

OM-1与Reward AI:用人类演示训练奖励模型,实现跨机器人操作

发布时间:2026/9/25 6:54:45

资讯中心
01
ARTICLE

OM-1与Reward AI:用人类演示训练奖励模型,实现跨机器人操作

OM-1与Reward AI:用人类演示训练奖励模型,实现跨机器人操作
最近机器人学习圈子里“OM-1”和“Reward AI”这两个词出现频率明显高了起来。如果只看字面OM-1 像是个型号名Reward AI 像是某个奖励函数工具但把它们放在一起再缀上“Omnibody Hand”和“跨机器人体策略”背后其实是一条非常完整的技术主张用人类演示数据训练奖励模型再借助统一手部硬件把同一个操作策略搬到不同的机器人身上。这篇内容适合正在做具身智能、机器人操作、模仿学习、奖励建模的研发同学也适合想了解机器人技术方向的产品经理和投资人。我最早看到“Reward AI 的人类演示路线”时第一反应是“这不就是逆强化学习跨本体迁移嘛”但越深入拆越发现真正的门槛不在任何单一算法而在于把数据、硬件、奖励建模串成一条可复现的流水线。下面我把这条线完整拆开尽量讲清楚每个环节的选择逻辑和实操心得。1. 项目概述OM-1 到底想解决什么问题1.1 拆解标题OM-1、Reward AI、Omnibody Hand 的三角关系OM-1 听起来像一个模型代号但从标题上下文看它更像是一套实验体系的统称一个“One Model One Hand”的通用机器人操作框架。Reward AI 是这套体系里负责“学习奖励函数”的模块Omnibody Hand 是统一的操作末端硬件跨机器人体策略则是最终要证明的结论——不同机械臂、不同移动底盘上能跑同一个策略。这三者的关系可以这样理解Omnibody Hand 负责把“手”这个维度标准化让所有机器人都拥有同样的末端执行器Reward AI 负责从人类演示里提炼“什么叫做得好”为策略优化提供稳定的学习信号跨机器人体策略则是把学到的知识从数据来源本体迁移到新本体。OM-1 这个代号在我理解里就是这三个子问题的最短路径总和。如果没有统一手部硬件跨本体策略会遇到“IO 维度不一致”的问题A 机器人的手有 6 个自由度B 机器人的手有 12 个自由度策略网络输入输出层根本对不上。而如果只是用软件把自由度映射一下又很难保证不同手部结构下的触觉、力矩反馈一致性。所以 Om nibody Hand 不是可有可无的配套硬件而是让“跨机器人体策略”成立的物理前提。1.2 人类演示路线为什么是“演示”而不是“试错”机器人学习其实有很多路线强化学习让机器人自己试错讲究探索效率行为克隆直接抄人类作业讲究数据质量而 Reward AI 走的是“从演示中学到一个评判标准再用这个标准去优化策略”的路线。它的好处在于你不再需要手工设计奖励函数也不要求演示数据覆盖所有成功情况只需要演示数据表达出“正确操作的长什么样”。手工设计奖励函数在抓取、移动这类任务里还能凑合一旦遇到“把一碗汤端到桌上不洒出来”这类任务你就很难写出涵盖所有细节的数学表达式。力该控制在多少速度该多平滑汤面晃动幅度该多大每个条件单独写都有用合在一起反而互相冲突。用人类演示学习奖励模型本质上是从“人觉得怎么做是对的”的数据分布里反推出一个隐式奖励这个奖励可以让机器人在探索时自己判断“这一步是否走在正确的方向上”。不过这条路不是没有代价。奖励模型学习到的信号是一种近似模型过拟合、判别器被“黑客攻击”都会让策略学到投机取巧的行为。所以 OM-1 这类项目通常不会只用奖励模型而是会和行为克隆损失或动作正则化结合避免策略漂移。这是我在实际做相关实验时的第一个教训把奖励模型当作唯一训练信号不安全必须要有约束。1.3 终极目标跨机器人体策略跨机器人体策略的简单定义是在机器人 A 的演示数据和环境中训练出来的策略可以直接部署到结构不同、运动学不同的机器人 B 上并且保持不错的成功率。这里的“机器人本体”包含机械臂的品牌、关节布置、自由度、最大转速、底盘形态等一切硬件差异。为什么这件事这么难因为同一个操作意图在不同机器人上会产生完全不同的关节轨迹。比如“把杯子从桌面拿起”七轴臂和六轴臂的逆解路径不同桌面高度不同末端姿态冗余也不同。策略网络如果直接吃关节角度那它学到的全是源本体的运动学特征换一个本体几乎必定失效。要解决这个问题通常有两类做法一类是“最小表示”让策略只吃通用的抽象信息如末端笛卡尔位姿、物体位姿、手部关节角另一类是“域随机化”在训练时故意改变机器人动力学参数、连杆长度、摄像头视角让策略被迫学习不变量。OM-1 的路线看起来是把这两者都占了。Omnibody Hand 提供了标准化末端执行器使策略可以共享手部关节空间Reward AI 则通过人类演示在抽象状态上学习不与具体机械臂绑定。这样最终得到的策略理论上可以在不同本体上做最后几厘米的精确操作而粗移动部分由底层运动学规划负责。我在实际项目中尝试过在 Franka 和自研五自由度臂之间迁移抓取策略如果只用末端位置作为状态成功率能从 30% 提升到 75% 左右这还没算统一手部带来的增量。可见表示设计的重要性远大于网络结构。2. 关键技术拆解Reward AI 是怎么“炼”出来的2.1 奖励模型 vs 手工奖励函数为什么值得学奖励函数在强化学习里的地位相当于足球里的教练你给球员设定了错误的 KPI他再努力也会把球往自己门里踢。手工奖励函数的最大问题是稀疏性、不确定性、不一致性。稀疏性指大部分动作没有反馈不确定性指奖励值需要频繁调参不一致性指多人设计的奖励相互冲突。奖励模型则把“设计奖励”变成了“拟合数据”的问题。我们可以把奖励模型想象成一个裁判他看过很多场标准比赛知道好动作长什么样任何新动作到他这里都能打分。训练这个裁判的方法通常是监督学习人类演示片段打高分扭曲动作打低分模型学会区分。从实现成本看手工奖励函数在简单任务里更省事两三行代码就能跑但在长任务和接触丰富的场景里手工奖励会遇到指数级的调参工作量。Reward AI 的理念是把这部分成本前移到数据收集和模型训练中虽然前期投入大但后续换场景、换本体时奖励模型可以通过新数据增量更新复用性远高于手写奖励。维度手工奖励函数Reward AI 奖励模型设计成本低但调参成本高高集中在数据和训练任务泛化差值任务需重新设计可增量学习新演示对操作细节的刻画依赖工程师经验从数据中自动提取可解释性高规则明确较低需可视化/归因被攻击风险低规则固定高需额外约束2.2 从人类演示构造训练样本三种主流的奖励建模思路第一种是把奖励建模当成“正负样本分类”。从演示轨迹中采样状态动作对作为正样本再随机采样一个歧义状态并随机执行其它动作作为负样本训练一个判别器用判别器输出的 logits 当作奖励。这类方法名叫“判别器奖励”和 GAIL 的思路一脉相承。优点是简单直接缺点是只学局部动作概率容易忽略任务层面的时间连贯性。第二种是“轨迹排序奖励”。你不光给出演示还让标注者对多条轨迹排序哪条更接近专家。奖励模型通过排序损失如 Bradley-Terry 模型学出一个标量函数使得更好轨迹的累计奖励更高。这类方法的成本更高需要人工排序标注但在复杂长任务中明显更稳因为排序本身包含了任务目标的高层信息。第三种是“时序差分式奖励学习”。奖励模型不直接输出瞬时奖励而是输出一个“潜力函数”然后通过时序差分让相邻时间步的奖励差尽量解释演示轨迹的价值差异。这类方法在存在稀疏延迟回报的任务里效果很好但训练难度更高很容易收敛到零奖励的平凡解。我个人的建议是如果刚开始复现从第一种分类器奖励做起跑通后再加排序约束不要一上来就上第三种。2.3 训练奖励模型时的关键细节与避坑我在训练奖励模型时踩过的最大的坑是负样本生成太随意。最初用“随机动作”当负样本模型很快就学到了“只要运动轨迹和演示不同就是错的”这种粗暴判断完全忽略了场景语义。正确的做法是使用“错位动作”负样本从演示轨迹中取一个状态然后从其它时间步或其它演示轨迹中找到该状态附近执行的不同动作甚至直接引入专家当前动作加噪声作为负样本。这样判别器才能学到“在正确的时刻做正确的动作”而不是“外观接近就判对”。第二个坑是奖励模型过拟合。数据量一少判别器的判别准确率会冲到 98% 以上但部署到策略网络中奖励信号会出现诡异的尖刺。解决办法包括加梯度惩罚、标签平滑、模型集成多个判别器取最小值以及每训练几个 epoch 就用当前策略采一些在线轨迹加入偏好对照。还有一个很有效的技巧是给奖励模型加动作熵正则让它在高维状态空间里不要过度自信。第三个坑是奖励模型和策略优化之间的“时序错位”。奖励模型基于当前状态输出奖励但策略动作的真实效果要延迟若干帧才体现这会让机器人看到“假阳性”奖励。我的做法是在奖励输入中添加一个短窗口的历史轨迹比如过去十帧的状态和动作让奖励模型有机会捕捉动作的因果后果而不是只看单帧。窗口长度不是越长越好太大会引入大量噪声通常五个到十五个时间步是一个合理区间。3. Omnibody Hand 与跨本体策略的实现路径3.1 为什么必须要有统一手部硬件很多人在做跨本体策略时会把注意力全放在算法上忽略手的标准化结果算法怎么调都只在仿真里有效。真实世界里的机械臂末端的差异不只是“夹爪”和“灵巧手”的区别还有传感器布置、控制频率、最大力输出、指尖形状这些细节。Omnibody Hand 的价值是用一套模块化的硬件把这段差异抹平让所有机械臂的末端在接口层完全一致。举个实际测试例子在六轴臂上安装 Omnibody Hand和七轴臂上安装同一只手策略网络需要控制的手部关节角度完全相同指尖力传感器型号相同触觉信号的采样频率也一致。这样跨本体迁移时策略只需要适应臂的部分连杆长度、逆解特性而不需要同时重新学习手部的全部交互动力学。很多失败的迁移实验恰恰是忽视了手部动作空间不一致这个致命细节。硬件标准化也会带来数据生态的便利。你用一台机器人和 Omnibody Hand 采集的演示数据经过坐标归一化后可以直接用于训练另一台机器人的策略。这比我以前遇到的“每个本体各采各的数据”效率高出一个数量级。当然Omnibody Hand 这种硬件并不是没有争议它在某些精细操作上可能不如专精的专用手比如外科手术缝合需要极细的力控标准化的手指未必最优。但从通用操作的角度看这一波“以统一末端换跨本体泛化”的取舍是成立的。3.2 数据采集与重定向演示数据不该直接喂给策略人类演示路线的第一道工序是采集数据但人类手部的运动轨迹不能直接控制机器人这里需要一个“运动学重定向”环节。最常用的方案是主从遥操作人穿戴动捕手套或操作主手设备机械臂和 Omnibody Hand 跟随人的动作运动同时记录机器人各关节的角度。这个方法精度高但速度慢一个人一天也采不了几百条高质量轨迹。另一种思路是纯视觉估计从人类操作视频中估计 3D 手部姿态再通过逆运动学映射到机器人。这种方式的扩展性强数据量大但精度不足手指接触力的信息会丢失。我实际在做的方案是“混合管线”用视觉估计提供初始候选轨迹再用遥操作系统在仿真或真实机器人上做一次轨迹验证与修正只保留成功率高的重定向结果作为训练数据。数据预处理上有几个容易被忽略的坑。第一不同品牌机械臂的坐标系定义不一样必须在做重定向时统一到右手坐标系第二采样频率要统一比如固定到 30Hz否则奖励模型和策略模型吃到的序列长度会漂移第三演示轨迹长度差异大需要做分割和对齐常见做法是按“开始接触、操作中、结束离开”三个阶段切分。如果这些不做再优秀的 Reward AI 学出来的也会是噪声模型。3.3 从单本体到跨本体的验证流程拿到一批演示数据并训练好奖励模型后怎么验证“跨机器人体策略”真的成立我建议按下面四个阶段走源本体过拟合测试先在采集数据的本体上训练策略要求成功率超过设定阈值比如抓取任务 85%如果这步达不到说明奖励模型或策略模型有问题后面不用测。仿真跨本体测试在 MuJoCo 或 Isaac 里搭一个目标本体模型直接把策略部署过去观察成功率下降幅度。常见问题包括逆解失败、速度不匹配、关节限位。这个阶段可以快速暴露表示层面的问题。真实目标本体小样本微调收集 5-20 条目标本体的演示轨迹对策略做少量微调看看性能是否能快速回升。微调时建议冻结前期特征提取层只更新最后两层和手部控制头。鲁棒性压测改变物品种类、桌高度、光照、机器人负载记录策略的抗干扰曲线。跨本体策略最有价值的地方是在这种压测里仍能保持超过 60% 的成功率而不是在实验室同一场景刷到 99%。这套流程看起来简单但我见过太多团队在第一步就卡住了——奖励模型在训练集上把演示轨迹区分得很开但策略一上线就摆烂。这说明奖励模型和策略模型之间存在“信号耦合”问题解决办法是在奖励中加入动作熵项或者每隔固定步数用真机成功率校准奖励 scale。3.4 典型问题排查记录问题现象可能原因排查手段策略频繁卡在同一个错误姿态机器人在物体前抖动不前进奖励模型对接近阶段奖励过低检查奖励模型在接近阶段的输出热图换本体后完全失效目标本体成功率约等于 0状态表示里混入了源本体运动学信息对比源/目标本体的状态张量分布PCA 可视化手部夹力过大物体被捏坏Omnibody Hand 力反馈未进入奖励模型增加触觉传感器维度到状态与奖励训练不稳定损失曲线反复震荡负样本采样太稀疏修改负样本采样策略加入熵正则演示数量够但学不到奖励模型 AUC 低于 0.7演示轨迹质量参差不齐清理失败尾部轨迹或做轨迹质量加权这些问题的排查顺序建议始终从“数据”开始。奖励模型和策略模型的问题往往只是表象数据里的异常轨迹、标注错位、纵坐标方向反了才是根源。我在一次跨本体实验里连续三天找不到策略失败原因最后发现是采集时左手坐标系装反了导致所有目标本体测试都用的是错误旋转表示。自那以后我每次开始训练前都会先做一次“状态重建检查”随机解码 20 条状态向量确认它们能对应到真实机器人姿态。4. 应用场景、影响与留给开发者的机会4.1 应用场景从实验室到货架还有几公里Reward AI 和跨本体策略最直接的应用场景是通用操作机器人。在物流分拣环节不同型号的机械臂分拣同一类商品可以用同一套策略部署不需要为每个品牌单独训练在家庭服务场景机器人需要完成开关抽屉、摆放餐具、倒水等任务这些都属于“高接触、长时序”操作手工奖励很难写演示驱动的奖励模型反而更合适。另一个值得关注的方向是“遥操作数据飞轮”一台带 Omnibody Hand 的机器人采集演示数据训练出跨本体策略然后部署到平价机器人上。部署过程中产生的新数据和失败案例再回流到奖励模型的增量训练里。这个循环一旦跑通会明显降低高质量操作数据的获取成本也会让机器人公司从“卖硬件”走向“卖操作能力订阅”。工业场景里目前最容易落地的反而是“半结构化长任务”。比如在一个工位上机器人需要完成取料、搬运、装配三步操作。传统方案需要针对每一步单独做路径规划但如果有一个统一的演示学习框架操作员只需要演示几遍完整流程机器人就能学会整套任务的时序逻辑。这类任务里的精度和速度要求恰恰是奖励模型比行为克隆更有优势的地方——它可以通过策略优化在多次尝试里找到更顺滑的轨迹。4.2 对机器人数据与硬件生态的影响如果跨机器人体策略真正成熟它对行业的影响会体现在两个层面数据不再绑定硬件硬件不再绑定算法。以前一套机器人操作数据只能在采集它的那台机器上用现在经过标准化末端和统一状态表示数据可以在不同本体之间流通。这有点像早期手机生态的“充电口统一”接口统一之后配件市场和数据市场都会爆发。不过也要冷静看待因为硬件标准化会牺牲一部分专用性能。做过灵巧手的人都知道抓取一枚鸡蛋和抓取一支马克笔最优的指尖形状和力度分布完全不同。Omnibody Hand 如果为了让所有任务都能干必然在某些任务上不是最优解。但大多数商业场景并不追求单任务极限而是追求多任务覆盖和快速部署所以通用性带来的收益会大于性能损失。开发者生态也会随之变化。未来做机器人算法不再需要从零搭建仿真环境和机器人驱动而是基于一套通用的“手-臂-奖励”工具链做二次开发。新一代机器人工程师可能会像今天的 Web 开发一样直接调用跨本体操作策略的预训练模型再用少量目标场景数据做微调。到那时候很难想象还会有人愿意给每个机械臂单独写一个奖励函数。4.3 如果你想下场从哪里切入先说算法方向建议优先攻克奖励模型的时间建模问题。很多现有的 Reward AI 项目把每个时间步当成独立样本来学习丢失了操作的连贯性你可以对比“轨迹级判别器”和“窗口级判别器”的效果差异这是一个很容易出论文也容易落地的工作。其次是跨本体表示学习研究如何在状态编码器里显式剔除运动学信息、保留物体相对位姿和触觉信息这类工作有清晰的评测方法和提升空间。硬件方向的机会在于 Omnibody Hand 的控制接口标准化。做一个兼容多种机械臂法兰盘、自带触觉传感器和驱动控制系统的手部模块比做一条新的机械臂更有可能成为行业基础设施。软件方向则可以围绕演示数据管线和奖励可视化做开发比如自动识别演示轨迹里的低质量片段、奖励模型决策归因这些都是研发团队的刚需。我个人在实际项目中最看好的落地切入口是“仿真到真实的奖励校准”。跨本体策略在训练时用了大量仿真数据真机部署后会发现奖励模型的分布发生偏移。开发一套能在线自动校准奖励模型流程的服务价值不亚于做策略模型本身。最后分享一个我在复现过程中反复用到的技巧每次训练奖励模型前先把演示数据里全部状态向量做一次 PCA降到三维后用颜色标记时间顺序。你会发现绝大多数问题都藏在数据的时序结构里——有些轨迹前半段是对的后半段开始乱来有些轨迹来自动作混淆的演示者整体方向都是反的。这个检查的成本只有几分钟却能在训练前帮你筛掉至少一半的“玄学失败”。做跨机器人策略这条路单点突破很容易真正难的是把数据、硬件、奖励、策略四个环节闭环起来。OM-1 这个代号将来是否还能卷土重来不一定但它指向的方向——用人类演示训练奖励用统一硬件承载跨本体策略——已经足够清晰。如果你正打算入局具身智能这就是最值得投入的路线之一。
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。