做了几年机械臂操作算法我越来越明白一件事很多表面上看起来是视觉的问题最后都卡在触觉上。你可以让模型把相机图像里的目标位置识别得很准但插头怼到USB口上的那一瞬间该用多大力、卡住了是该退回一点还是歪着蹭进去、握住鸡蛋后要不要稍微收一下力——这些和“接触”直接相关的决策纯视觉方案给不出答案。复旦和NeoteAI这次发布的N0-TWAM我觉得算是把这条路捅开了一个口子一个只有7B参数的世界模型把触觉信号正式写进了世界模型推理公式专门用来处理接触富集操作contact-rich manipulation也有团队翻译成“接触密集操作”。如果你跟我一样平时做机器人操作算法、具身智能或多模态模型这篇文章值得看完。我不打算复述一遍官方PR稿而是从一个实操者的角度把N0-TWAM要解决的问题、技术骨架、训练数据逻辑、评估方法和落地踩坑一个一个拆开讲清楚。看完你至少能回答三个问题世界模型为什么一直缺触觉、触觉到底怎么“长”到世界模型里、以及评测一个“有触觉”的模型该看哪些指标。1. 触觉缺口接触富集操作为什么卡了这么久1.1 “世界模型”到底在预测什么先对齐一个基础概念。所谓世界模型核心不是“见过多少图”而是能不能学到一个关于环境的动态转移规律给定截止到当前时刻的观测和动作预测下一步会发生什么。最朴素的形式可以写成z_t Encoder(o_{t}, a_{t}) z_{t1} WorldModel(z_t, a_t)这里o_{t}是历史观测a_t是当前动作。模型不是在做“识别”而是在做“想象”想象我这只手往前推一下物体会怎么动环境会变成什么样子。过去两年大家讨论得比较多的世界模型基本集中在视觉和文本两个模态。看视频预测下一帧看语言预测下一个token思路是通的。但到了机器人操作场景问题就暴露了视觉只能告诉你物体“看起来在什么位置”很难告诉你“接触以后力会怎么变化”。而接触恰恰是操作任务里信息密度最高的环节。缺了触觉通道的世界模型等于一个近视眼摘了眼镜还要去穿针——图像模糊只是一部分更重要的是手里完全没有那根针传来的“感觉”。1.2 接触富集操作的三个硬骨头我理解N0-TWAM选择接触富集操作作为突破口是因为这类任务把所有难啃的问题都集中到了一起。所谓接触富集就是任务成败高度依赖接触力、摩擦、滑动等物理交互的操作典型代表包括插孔装配、螺丝拧紧、折纸、线缆抓取、蛋类转移。这类任务有三个特点每一个都让纯视觉模型很头疼。第一个是摩擦和滑动极难建模。木块和橡胶块放在同样的位置手指压上去的变形和滑移完全不同。视觉可以在像素层面看到表面纹理但摩擦系数是看不出来的只有真刀真枪碰一下才知道。第二个是接触状态存在大量等价却不同性质的解。同一个目标位姿用力压着推进去和轻轻蹭进去视觉观测到的物体位置几乎一样但接触力差了好几倍。纯视觉输入天然存在多义性模型很难从图像里推断出“当前是卡死状态”还是“正常推进状态”。第三个是柔顺控制需求。接触富集操作很少需要刚性地把物体推到目标点更多时候需要顺着接触面的力反馈边感知边调整。这种控制策略依赖高频触觉信息别说纯视觉就算只用低维力传感器很多团队都做得磕磕绊绊。1.3 纯视觉方案在插孔任务里的翻车现场我拿插孔任务举个例子这也是我在真机上反复踩过的坑。假设机械臂抓着一个连接器要插进机箱背板的接口里。视觉模型可以给出接口在图像坐标系里的位置经过手眼标定换算到机器人基坐标系然后机械臂以位置模式慢慢怼过去。前两步看起来都顺利到了接触点就完蛋插头稍微偏零点几毫米或者机箱板有轻微形变插头就会卡在孔边缘。这时候纯视觉方案没有任何信息能告诉控制器“现在已经产生接触力”“接触力的方向偏向左边”所以机械臂只会继续往正前方压要么把插头压弯要么把塑胶外壳刮出毛边。而人来做这个动作手指早就感受到“顶到偏了”会自动回一点力把插头向反方向微调再绕进去。这种“以退为进”的接触策略没有触觉反馈根本无从谈起。N0-TWAM想做的就是从世界模型层面把这个能力补上让模型在想象下一帧画面的时候也把“接触感”一起想象出来。2. 从六维力到tokenN0-TWAM怎么把触觉长出来2.1 大体架构一个多模态Transformer世界模型我不掌握N0-TWAM内部每一层的细节图纸但从公开的方案逻辑和这类模型的标准做法来看它的整体骨架应该是一个多模态Transformer一个7B参数的主干网络下面接若干专用的编码器上面接两个输出头——一个动作头一个预测头。主干网络承载的是“常识”和“推理”它知道物体大概是刚体还是柔性的、知道常见插拔动作的运动学模式、知道语言指令和视觉特征怎么对应。这个常识从哪里来从大规模预训练中来。这也是7B参数选择的聪明之处尺寸足够大能承载丰富的视觉-语言先验尺寸又不会大到没法在机器人本体附近部署。输入部分至少有三条通路视觉通路相机图像编码成视觉token给模型提供空间信息。触觉通路接触力/触觉阵列信号编码成触觉token给模型提供“手感”。本体感觉通路关节角度、关节速度、力矩电流等编码成状态token让模型知道自己当前什么姿态。三条通路进主干主干不是简单拼接三堆token而是让它们在注意力层里不断交互。视觉token带来“物体长什么样、在哪儿”触觉token带来“现在手感是松是紧、力朝哪个方向”本体感觉token带来“我的手现在什么姿态”。只有三者交互模型才能回答一个关键问题在我当前这种姿态下以这个力度继续操作接下来会发生什么。2.2 触觉信号怎么变成模型能用的token触觉信号和图像、文本的性质差异很大这是N0-TWAM这类模型在工程上一个必须解决的问题。图像天然是规整的二维格子文本天然是离散的token序列而触觉信号通常是高频、带噪声、低维度但有空间分布的连续值。目前主流的触觉传感器大致分三类处理方式各有不同传感器类型典型输出处理难度适合场景六维力/力矩传感器力与力矩共6维连续值容易直接堆时间窗腕部安装通用装配阵列式触觉传感器空间分布的压力矩阵中等要当作伪图像处理夹爪指面抓取类任务关节力矩电流各关节力矩/电流序列容易但噪声大内置在电机里成本低我的经验是N0-TWAM大概率不会只依赖六维力而是会把腕部六维力作为主通道再叠加关节力矩作为辅助这样的组合在真机部署时最容易获得稳定数据。处理流程通常是这样触觉信号以1kHz甚至更高的频率采样先做时间窗口切片比如取最近100ms窗口内的力轨迹经过滤波平滑再通过一个小型的MLP或卷积编码器映射成固定维度的触觉embedding最后加上时间位置编码成为可以和视觉token一起进入Transformer的触觉token。有一个细节容易被忽略触觉采样的频率远高于视觉。视觉是30fps或60fps触觉是1000Hz如果直接把两者按帧对齐视觉变成瓶颈。更合理的做法是让触觉在两次视觉帧之间持续累积更新视觉帧到达时用一个迟滞窗口和触觉状态做融合。这个设计直接决定了模型在接触瞬间的反应速度做得不好模型会在插孔时表现出“看到已经顶住、但手感延迟半拍”的奇怪行为。2.3 世界模型推理公式触觉如何参与状态转移既然标题把“世界模型推理公式”作为核心热词这里有必要把公式亮出来。N0-TWAM的思路我理解可以归纳成下面这样z_{t1}, τ_{t1} WorldModel(z_t, a_t, h_t)其中z_t是当前潜在状态a_t是当前动作h_t是当前触觉反馈τ_{t1}是模型预测的下一时刻触觉信号。注意最后这一项。普通世界模型只预测下一帧视觉图最多再预测一下奖励。N0-TWAM把“下一时刻的触觉信号”也作为预测目标写进了训练目标。这意味着模型在训练时会被强制学会一件事拿到当前视觉、当前动作和当前手感之后推断出下一步会感到什么手感——是更滑了、更紧了、还是顶到硬物了。这个设计的精妙之处在于它把触觉从“输入特征”升级成了“模型要预测的动态量”。如果触觉只是输入模型可以偷懒完全依赖当前触觉做反应式控制不需要理解背后的物理规律。但一旦要求模型预测下一时刻的触觉它就不得不建立一个内部物理模型当前接触状态是什么、这个动作施加下去力会怎么演化、物体是会被推动还是会卡住。这一条推理公式就是N0-TWAM“让世界模型长得触觉”的真正含义。它不是简单加一路输入而是把触觉纳入了世界模型的核心推理循环。3. 数据怎么喂触觉数据的采集与对齐决定成败3.1 三种主流采集方案的取舍模型结构只是骨架触觉数据的质量和数量才是真正决定N0-TWAM效果上限的因素。目前接触富集操作的数据来源无非三类各有各的坑。第一种是遥操作采集。操作员通过力反馈主手控制机械臂完成插孔、拧螺丝、抓取等任务同时记录视觉、触觉、本体感觉和动作指令。这类数据质量高接触行为自然有真实的手感示范但采集成本极高一个熟练的操作员一天能采多少条有效轨迹是有限的。N0-TWAM这类模型如果走这条路数据规模大概会是几万到几十万条轨迹级别而非互联网那种十亿token级别。第二种是仿真环境生成。MuJoCo、Isaac Gym里可以物理仿真接触力和摩擦批量生成海量接触交互数据还能随机化物体形状、摩擦系数、位姿让模型见识更多极端情况。问题在于仿真触觉和真实触觉之间存在领域差距仿真里光滑的接触到了真机可能变得黏滞或震动。所以仿真数据适合做预训练不适合直接当最终训练数据。第三种是真实自主探索。让机械臂自己在环境里随机或者半随机地试错推一推、压一压、戳一戳记录下各种接触状态下的视觉、触觉和动作。这种方式能覆盖很多“人类操作员不会做”的危险动作对模型理解接触边界特别有价值因为失败样本里包含了大量“这里会卡住”“这里会滑”的信息。我的判断是N0-TWAM大概率采用了“仿真预训练遥操作精调部分自主探索”的组合策略。只靠仿真真机部署会翻车只靠遥操作数据多样性不够加上自主探索才能让世界模型真正见过“足够多不同的手感”。3.2 对齐是真正的脏活很多人第一次拿触觉数据训练模型都会低估对齐的工作量。我在这上面吃过不少亏这里把最容易出问题的三个点说透。第一个是时间同步。相机图像、触觉采样、运动控制指令往往走不同的通信接口哪怕都在同一台电脑上时间戳也可能差几十毫秒。接触富集操作里力变化是毫秒级的插入动作开始顶住硬物到力尖峰出现可能只有几十毫秒。如果视觉和触觉时间戳没有严格对齐模型学到的是“画面和手感错位”的规律真机上一旦出现同样的错位效果就会崩。解决办法是给触觉数据流单独做一条高精度时间戳管线不能依赖相机帧到达时刻来给触觉打标。第二个是坐标系对齐。力传感器装在夹爪或腕部力是相对于传感器的坐标系测量的而视觉坐标系在相机机器人运动指令在基坐标系。三者不统一模型必须自己学会坐标变换这既浪费参数也容易学歪。N0-TWAM这样的多模态模型如果能在输入阶段先把触觉力换算到统一的工具坐标系训练会高效很多。第三个是夹爪指面传感器的标定。阵列式触觉传感器的每个单元在不同夹持状态下基线值会有漂移特别是温度变化和机械磨损都会改变零点。标定做得不勤模型看到的数据分布和训练时不一致表现会肉眼可见地劣化。实际项目中我习惯在每次数据采集前跑一遍空夹爪的零点采集把“绝对力”变成“相对力”模型会稳很多。3.3 触觉数据的增广与标注触觉数据也有增广的空间只是方式和图像增广不太一样。图像可以随便旋转、裁剪、调亮度触觉信号不能乱转因为力的方向是有物理含义的转了方向语义就错了。合理的触觉增广包括叠加小幅高斯噪声模拟传感器抖动对摩擦系数做随机缩放模拟不同材质表面对接触力幅值做微调模拟物体重量变化在时序上做小幅拉伸或压缩模拟操作速度差异。这些增广能帮助模型在有限数据上学到更稳的接触规律。标注层面我强烈建议在训练数据里加入“接触事件标签”。所谓接触事件就是标出每个时刻的状态类型无接触、接近、轻触、受压、卡阻、滑动。事件标签不是必须的毕竟模型可以通过预测下一时刻触觉自己学习但有标签之后训练收敛速度明显加快而且评测时可以直接拿来算“接触状态预测准确率”这是N0-TWAM这类模型最有说服力的说明材料之一。4. 评估与部署怎么判断模型真的“摸”到了4.1 该用哪些任务来考它如果你要评测一个像N0-TWAM这样的接触富集世界模型任务设计很有讲究。不能只测“能不能完成任务”还要测“它是不是真正靠触觉理解完成了任务”。我建议至少覆盖以下几类任务任务考核重点为什么有区分度异形插孔接触状态识别与位姿修正要求模型感知到卡阻方向并调整螺丝旋拧力矩控制与滑牙规避考验对旋入深度的触觉预测蛋类转移抓取力控制过压会碎过松会滑直接压榨触觉精度线缆抓取柔性体接触建模线缆形变不可通过视觉直接推算布料折叠多点接触与滑动检测触觉和视觉必须协同这些任务里我特别看重异形插孔。因为插孔任务天然包含“卡住”这种强负反馈事件模型如果预测不到下一时刻会卡住就无法提前调整策略预测到了就能在视觉还没发现异常时先做柔顺退让。这是世界模型“想象触觉”能力的直接体现。4.2 核心评估指标怎么定除了任务成功率还需要几个更细的指标否则看不出模型到底强在哪。成功率当然是最直观的但纯成功率掩盖了很多信息。我会同时看三个指标接触力峰值、冗余动作次数和触觉预测误差。接触力峰值衡量的是模型对接触风险的控制能力。插孔过程里峰值力越低说明模型越早预判到了阻力变化不是等撞上才反应。冗余动作次数衡量的是纠正效率。有些模型靠反复试探能完成任务但动作来回抖很多次这在工业场景完全不可用。触觉预测误差则直接把世界模型的推理质量量化出来模型预测的下一时刻触觉和真机采到的实测值之间差多少。这个指标如果在真实数据上依然保持低误差说明“长出来的触觉”不是硬编码规则而是真的学会了物理动态。另外一定要加鲁棒性测试换传感器零点漂移、换表面材质、换光照条件看性能衰减幅度。一个只记住了特定视觉外观的模型一换材质就崩一个真正理解接触动态的模型换材质影响应该很小。4.3 真机部署时最容易踩的坑即使模型训练效果不错真机部署时依然有不少坑。我按踩坑概率排个序。第一个坑是触觉采样频率和策略推理频率不匹配。N0-TWAM是7B模型单次前向推理可能耗时几十到几百毫秒而触觉传感器每秒产生1000个样本。如果模型只能冥想触觉数据只能降采样那“高频触觉”的优势就没了。实际落地一般需要两层结构底层用轻量的反应式控制器做毫秒级触觉反馈上层N0-TWAM做次秒级的策略决策两个频率中间用缓冲队列衔接。第二个坑是显存和内存。7B模型在FP16下光权重就要14GB左右加上视觉编码器、触觉编码器和推理缓存一张24GB显卡是起步配置。真机机器人控制器不一定能带这么大的GPU常见做法是模型跑在旁边的工作站上通过实时通信接口把动作指令下发。要注意通信延迟如果通信耗时高于控制周期整个系统稳定性会明显下降。第三个坑是仿真到真机的接触参数迁移。用仿真数据预训练过的模型真机上第一次跑大概率会“手感偏理想化”仿真摩擦模型太干净真机接触总有微小振动。我的经验是先在真机用小批量数据做触觉适配微调只更新触觉编码器后几层和最后预测头效果比全量微调更稳也不容易灾难性遗忘原有能力。第四个坑是传感器漂移。真机跑半小时后力矩电流的零点可能偏移六维力的温漂也逐渐累积。模型在训练时如果没做过零点扰动增广部署时就要写一个自动零点校准逻辑否则评价指标会越跑越失真。5. 一些自己的看法7B的取舍和接下来的期待5.1 7B参数为什么是一个聪明的折中模型尺度选择这件事圈子里一直有两种极端一种觉得越大越好直接上几十B甚至上百B参数另一种觉得机器人场景必须够小最好跑在嵌入式设备上。N0-TWAM选7B我觉得是现阶段接触富集操作最合理的折中。7B以上的模型确实在视觉-语言常识上更强但训练成本和推理延迟都会显著增加。机器人操作任务需要闭环控制等不起大模型慢慢思考。而7B以下模型的复杂泛化能力又不够接触富集操作不是简单的模式匹配它需要融合多模态信息进行推理模型太小了根本背不下来那些复杂接触转移规律。所以7B不是拍脑袋定的它是“能在一张GPU卡上微调推理”和“有足够容量建模接触动态”的交集。对于要落地的团队来说这个尺寸意味着可以复现、可以部署、可以持续迭代而不是只能看PR稿羡慕。5.2 我更想看到的三个扩展方向N0-TWAM目前主要聚焦在接触富集操作但世界模型一旦长出了触觉会连锁打开好几个方向。第一个是更强的错误纠错能力。现在大多数操作策略是开环执行加末端修正真正理解接触动态的模型可以在动作执行之前就通过“想象”预判会遇到什么阻力提前调整策略而不是等出了错再去修复。把“预测触觉”和“规划动作”结合起来是接触富集操作走向闭环的关键一步。第二个是更便宜的触觉硬件适配。N0-TWAM如果只能配合高端六维力传感器工作影响力会受限。我期待它的架构能支持多种低成本触觉输入比如普通夹爪的电流反馈、自制的压阻式阵列让更多实验室和中小团队能用上。第三个是和强化学习、扩散策略的融合。世界模型的一个经典用法是当作“想象环境”来训练策略减少真机采样。有触觉的世界模型意味着强化学习智能体可以在完全虚拟的接触交互中训练学会怎么插孔、怎么拧螺丝再迁移到真实机器人上。这会大幅降低接触富集操作策略的训练成本也是我认为最值得期待的应用方式。做接触富集操作这几年我最深的一点体会是机器人缺的不是更贵的相机而是那种“手上长了眼睛”的感知。N0-TWAM选择在世界模型这个层面把触觉和视觉做成一体方向我相当认同。如果让我给想复现这个思路的团队提一个最实用的建议那就是别急着上模型架构先花两个月把触觉数据的采集、同步和标定管线做扎实——数据管线扎实了后面的模型工作会顺利一半以上。