教机器人干活,光“刷课时”可不够!灵初这次较真数据质量
允中 发自 凹非寺 量子位 | 公众号 QbitAI
看这组对照视频:一边是人手操作,一边是机械手操作。乍一看,像是人先做了一遍,机器人再照着学。但顺序恰好反了——机械手那段才是真实记录,人手那段则是AI根据它生成出来的。
为了让机器人学人,为什么反而要从机器人的动作开始?这看起来有点绕,却指向了一个很实际的问题:人类每天都在干活,这些经验,到底怎样才能交给机器人?
就在上周,Figure发布Helix 2.5,使用人类行为数据集Index进行预训练,在完成三类家务任务的适配后,将机器人带进30个未采集过数据的家庭进行测试。
灵初智能这次进一步追问: 人类数据进了模型,不等于人的操作经验就能被机器人直接使用。这中间,还缺什么?
在十万小时级数据积累的基础上,灵初智能的 模型Psi-R2.5 继续改进数据质量与人机数据对齐方法,并进一步推进具体任务适配。它关注的不只是让机器人看过更多操作,还包括怎样把这些操作变成有效的训练材料,以及面对新任务时,怎样更容易地教会它。
教机器人学人,这次先倒着来
人和机器人,都能拿起一瓶可乐。但两段“拿可乐”的视频放在一起,就能教机器人照着做吗?
这里面仍然存在一些“老生常谈”的问题:人手和机械手不仅长得不一样,关节结构、接触物体时的摩擦条件也不同。再加上人手姿态估计的误差,一个人可以顺利完成的动作,转换成机器人的关节运动后,未必还能成功。
所以,给机器人看懂“这是在拿可乐”,和提供一份“可以这样拿起可乐”的动作数据,是两回事。
灵初把人和机器人执行类似任务、主要在任务含义上对应的数据,称为“弱配对数据”。它更希望获得的,是另一种对应关系:除了人和机器人本体不同,两边的场景基本一致,动作时序逐帧对应,而且机器人一侧的动作能够在真机上直接回放成功,这就是“ 强配对数据 ”。
强配对数据强调对齐,不只是要求人和机器人“都做了同一件事”,而是“ 人的这段操作,对应着机器人这段可执行的动作 ”。
让人和机器人各做一遍,很难保证场景和动作时序逐帧对应。直接照搬人的轨迹也未必成功,因为两者的关节结构、摩擦条件并不一样。
今年4月,灵初已经尝试让Psi-R2与世界模型Psi-W0配合,通过轨迹推演和强化学习,将人类操作转换成可执行的机器人数据。问题是,这套流程涉及多个模型协同和策略优化,生产数据的过程比较重。
灵初巧妙地换了一个方向:为什么一定要从人类操作出发,再费力生成一段能够成功的机器人动作?
反过来,真实机器人操作的图像和动作,本来就是可用的。以它们为起点,生成匹配的人类数据,不就可以获得一份新的对照样本?
按照这条思路,灵初 逆向使用Psi-W0 ,从真实机器人数据出发,生成对应的人手操作数据,再将这些高质量配对数据用于训练端到端转换器。这个转换器的输入是 人类操作数据 ,输出则是匹配的 机器人图像和动作 。
△只需用手机在日常场景中录制一段人手操作视频,即可通过模型转换为对应的机器人数据。
这里需要区分一下,转换器不是负责决定机器人下一步做什么的策略模型,而是一个 带动作输出的视频编辑模型 。它要做的,也不只是把画面中的人手换成机械手,而是 同时得到机器人可以使用的动作数据 。
灵初设置了两种验证方式:一种是直接在机器人上回放转换后的轨迹,看能否完成相同任务;另一种是把转换后的数据用于后训练,再看训练出的模型能否完成相关任务。
判断标准不再只是“生成的视频像不像”,而是 数据能不能支持实际操作 。据灵初介绍,转换后的数据已在上述两类测试中得到验证。不过,部分特别复杂的任务仍未直接完成,数据转换并不等于所有任务都已经解决。
沿着这条思路,Psi-R2.5也重新梳理了数据本身的质量。灵初减少同一任务的重复堆积,增加任务多样性,并通过自动标注管线,把任务拆解到更细的原子动作,再进行标注和审核。
视频,也能当机器人的prompt
如果一段人类操作,已经能转换成机器人更容易使用的参考,那么它或许也可以有另一种用途:不只是进入训练集,也可以成为当前任务的提示。
这也意味着不必把所有要求都写成一大段指令,而是给机器人一个例子——“照着这个来”。
这是灵初在Psi-R2.5中进一步探索的上下文学习,也就是 In-Context Learning ,简称ICL。在其展示的任务中,机器人不需要更新模型参数,而是 根据当前上下文提供的线索,推断该做什么、该如何做 。
这里有一个关键变化:新示范不一定要再走一遍训练流程,才能影响机器人的行为。它也可以作为当前任务的参考,交给已经训练好的模型使用。
难点仍然在于,示范来自人,执行者却是机器人。灵初的思路,是利用前面的强配对数据模型,将人类示范转换成对应的机器人数据,再更好地作为提示输入模型。
同一种数据转换能力,由此有了两个用途: 一是准备训练材料,二是帮助机器人理解眼前的示范 。
这也与Psi-R2.5的双层架构相衔接。它的上层模型负责拆解长程任务,把一段较长的指令分成子任务;下层模型则结合子任务和当前观测,输出具体操作轨迹。一个负责拆清楚要做什么,一个负责落实到动作。
当然,这里的不用重新训练,不等于模型此前没有训练过,也不等于随手拍一段视频,就能让机器人完成任何工作。目前灵初展示的是特定任务中的ICL能力,更多实现细节尚待公布。
但它提供了一个值得继续观察的方向:人的示范,不一定只能是离线训练时使用的材料,也可能成为实际使用机器人时的一种交互方式。
99%成功率,不止靠预训练
在灵初看来,真实部署面对的物品种类、规格和作业节拍,往往带有很强的定制化要求。短期内,不能指望基础模型完全不做适配,就直接进入所有客户现场;后训练仍然是必要的一环。
灵初在最新的Tech blog中明确指出,预训练并不是让后训练立刻消失。从部署角度来看,现阶段训练基础模型的意义应该是 让后训练需要的数据更少,从而降低适配与部署的成本 。
手机盒装配,就是一个具体例子。这个任务涉及多个步骤,对操作精细度也有较高要求。据灵初介绍,通过结合人工参与与强化学习的后训练框架,经过几轮迭代, 任务成功率达到约99%,耗时1-2个工作日 。
预训练积累的本事,在这里派上了用场:机器人不用从零学起,只需补充少量任务数据,再通过人工参与和强化学习,把容易出错的地方练好。
到了客户现场,训练也没有结束。机器人在哪里失败,相关数据就被收集回来,用于下一轮改进。团队表示,这套方案已经用于实际客户现场,处理作业中遇到的复杂情况。
这与前面的示范引导并不矛盾。示范提供一种表达新任务的方式,后训练则继续处理具体操作中的难点。两者不是要求机器人每次都从零开始,而是在已有能力上,减少适应新需求的额外投入。
Psi-R2.5正把预训练积累的能力用到具体工作中。用好人类经验,让客户少花时间、少花成本就能把机器人用起来,是灵初持续改进基础模型的目标。
Tech blog:https://cypypccpy.github.io/tech-blog.github.io/ https://cypypccpy.github.io/scaling-pair-data.github.io
Jev vs Decitron:同为决策AI,为什么不是一回事? 2026-09-23
刷视频也能教会机器人干活!1200亿tokens人类动作预训练,误差按幂律下降 2026-09-23
GPT-6 Astra开进机器人身体!清华联手无问芯穹等开源RPent 2026-09-21
OpenAI刚曝光循环架构,这家公司更早将其用于世界模型 2026-09-10
相关阅读
上海AI实验室造出首个「通才」机器人大脑:看懂世界+空间推理+精准操控全拿下
可实现多模态大模型(MLLM)对物理实体的直接操控,使机器人能像人类一样“看到-思考-行动”
Nature封面:机器人乒乓球干翻人类职业选手
2025年的冬天,上海凭什么被称为“世界具身智能第一战场”?
人形机器人放无人机,还能上天入海!有点过于赛博了吧
港股鞋王千百度,一夜完成AI数据公司转型
2000+真实场景搬进仿真!一个导航模型零样本“通吃”四种机器人本体
热门文章
从“会回答”到“会办事”,vivo如何解AI手机这道题?
刚刚,Claude Code大重构!内部3万Agent管理技术免费开放
刚刚,唐杰发布智谱RSI首个成果
央企做了个通用Agent,直接杀进IDC实测前三!
AGI最难一战,竟在医院!中国AI登上Science,医生不怕失业还催着上线
量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1