尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

HuRo:将人类视频转化为机器人数据,实现可扩展的 VLA 预训练

发布时间:2026/9/25 20:11:27

资讯中心
01
ARTICLE

HuRo:将人类视频转化为机器人数据,实现可扩展的 VLA 预训练

HuRo:将人类视频转化为机器人数据,实现可扩展的 VLA 预训练
26年8月来自韩国rlwrld.ai公司和延世大学的论文“HuRo: Robotizing Human Videos for Scalable VLA Pretraining”。本文研究如何将人类操作视频转换成机器人训练数据。它的重要贡献是建立并验证了一条大规模数据生产路线;实验支持其预训练价值,但尚不能说明生成的数据具有可靠的物理可执行性。一、论文概述机器人训练面临一个现实问题:真实机器人示范昂贵,人类操作视频却很丰富。但人类与机器人在外观、身体结构、关节和动作空间上存在差异,不能直接把人类视频当作机器人示范。HuRo 的做法是对视频进行“机器人化”:画面转换:擦除人的手臂,再叠加渲染的机器人。动作转换:恢复人手的三维运动,映射为机器人的手腕与手指运动。语言标注:生成描述操作内容的指令。最终得到“图像—语言—机器人状态—动作”配对数据,用于视觉—语言—动作模型(VLA)预训练,再用少量真实机器人示范微调。作者整合五个人类视频数据源,构建了约 63 万条片段、1.422 亿帧、1,317 小时的数据集。如图 1 所示面向现实世界操作任务的 HuRo 预训练概览。利用“视觉机器人叠加”(visual robot overlay)和“动作重定向”(motion retargeting)技术,将海量人类活动视频转化为机器人操作片段。由此生成的片段包含语言指令、机器人状态及动作数据,可用于 VLA 策略的预训练。在经过下游微调后,基于更大规模 HuRo 子集预训练的策略在现实世界操作任务中展现出了更优的性能。二、主要想法:同时对齐“看到的身体”和“要执行的动作”论文认为,仅从人类视频中学习视觉知识,或者只提取动作而保留人类画面,都没有充分解决人机差异。其方法可以概括为:人类视频 → 恢
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。