AI 日报hiw3c.com

今年最难的机器人Demo,“机器人含量”为0

量子位 www.qbitai.com 网页快照

今年最难的机器人Demo,“机器人含量”为0

henry 发自 凹非寺 量子位 | 公众号 QbitAI

今年5月,英伟达机器人负责人Jim Fan在一场公开演讲中宣告:VLA、遥操已死。

刚刚,自变量发布全新灵巧操作系统 TwinDex 。在 后训练阶段真机遥操数据为0 的情况下,机器人连续完成了化学实验场景中,旋拧瓶盖、注射器推注等多项精细操作。

要知道,以往想让机器人学会这类精细操作,还真少不了真机遥操数据来“手把手”教学。

但TwinDex这次,直接把这部分数据需求给砍没了,取而代之的是区区几百条 无本体数据 ,机器人含量几乎为0~

遥操,可能真的危险了

整个实验包含 24个子动作 ,跨越 三种工具 ,涉及多次双手协调与工具切换,每一步都要求毫米级定位与稳定力控。

而拆开来看,TwinDEX这三根手指,实际上集中展示了几类过去灵巧操作里最难啃的能力。

在打开工具箱时,机器人需要让左右两根食指同时对准两个狭窄卡扣,准确插入后向下拨开,再用食指和拇指捏住提手,把箱盖打开。

食指和中指固定筒身,拇指对准推杆向前发力,既要保证位置不跑,又要精确控制推注方向和力度。

随着具身智能逐步走进实验室、工厂和家庭,这类小容差、高精度、强接触的操作,也会越来越接近机器人的基本功。

比如在扫帚和簸箕任务中,三根手指围绕手柄形成包络,让不同手指共同承担支撑和控制。

在拧开瓶盖时,TwinDEX用食指和拇指捏住瓶盖,再靠手指自身的侧摆完成旋转,几乎不用大幅转动手腕。

而在翻书中,机器人的拇指则先把最上层书本搓出来,再完成捏取、双手交接、放置和翻页。

以往在处理这类动作时,大家往往会下意识想到结构更复杂的五指灵巧手,以及庞大的真机遥操作数据。

但上面的Demo恰恰说明了一件事: 很多过去被认为需要五指完成的精细操作,三根手指其实已经够用了。

而在机器人真正上手干活之前,它还有另一重身份, 一套与执行端匹配的可穿戴无本体数据采集系统。

相比很多在数据采集和机器人执行阶段使用两套不同硬件的方案,TwinDEX直接采用了 数采与执行同构 的设计。

说人话就是,这三根手指不光负责干活, 采数据也用的是同一套结构 ,也就是所谓的 “所采即所得” 。

采集员在采集端做出的动作,可以更直接地映射到机器人执行端,中间不用再跨一套完全不同的硬件去做复杂的数据迁移。

也正因为如此,前面那些对指尖位置和力度都要求极高的精细操作,才能更稳定地被机器人做出来。

与此同时,相比直接遥操一台笨重的机器人,采集员可以更自然、更快速地完成动作,数据也更好采,也更省钱。

在 采集效率 方面。TwinDEX单位时间能够产出的有效轨迹,约为传统真机遥操的 5.3倍 。

同样一个采集员、同样一段时间,TwinDEX能够更快地攒出一批真正可用于训练的数据。

随着数据量增加,无本体数据和真机遥操作数据训练出的策略,会以相同的速率持续提升,并最终收敛到接近的表现。

换句话说,在这组实验中,训练模型时,无本体数据近乎可以100%替代真机遥操作数据。

更关键的是,它在提高采集效率的同时,也尽可能减少了这些数据真正迁移到机器人身上时的精度损失。

TwinDEX:让具身数据提前对齐

它更像是一套由 数据采集硬件、机器人末端执行器、数据处理管线和模型训练流程 共同组成的灵巧操作系统。

TwinDEX真正关键的地方,是从只依赖无本体数据完成后训练、去掉真机遥操作数据这个目标出发,再反过来设计整套系统。

从灵巧手的构型、采集设备的运动方式,到视觉观测、时间同步、数据处理,再到最终的模型训练,实际上都在围绕同一个问题展开:

从实际Demo里的功能分工来看,拇指和食指承担了大量对掌、捏取、旋拧和精细操作,第三根手指则能够进一步提供包络、支撑和稳定。

TwinDEX既没有选择UMI一类常见的两指夹爪,也没有照着人手一路堆到五指,而是在 灵巧性、稳定性和工程复杂度 之间取了一个折中。

但与此同时,增加的还有更多关节、驱动器、传感器,以及随之而来的标定、控制和维护成本。

因此,在经过基础抓取、原地旋拧、工具使用和掌内操作等元操作测试,并与多种候选构型对比后,自变量最终发现:

三指九自由度,就是目前的甜蜜点,它可以用相对可控的复杂度,覆盖当前大多数任务真正需要的灵巧能力。

这里的一致性,是指TwinDEX的数据采集端和最终执行端 运动方式 、 接触方式 、 视觉观测 、 采集精度 和 时间同步 上,都尽可能保持一致。

过去,很多无本体数据虽然好采,但真正迁移到机器人身上时,往往会遇到一个问题: 采集端和执行端并不是同一套本体 。

人的手怎么动、采集设备怎么记录,到了真正的机器人上,不一定能原样复现,中间通常都会存在运动学差异和精度损失。

所以,这类数据虽然容易Scaling,却很难直接拿来训练目标机器人。很多时候,最后还是得再补一批真机遥操数据,完成本体对齐和后训练。

它没有等数据采完之后,再想办法让数据去适配机器人,而是在硬件设计阶段,就让采集端和执行端尽可能同构。

也就是说,不再等数据采完之后,再想办法让它适配机器人,而是在设计采集设备和灵巧手时,就先把两边尽可能对齐。

这样一来,无本体数据迁移到机器人身上时的损耗就能被尽可能压低,也就减少了额外补充真机遥操数据的需求。

也正因为如此,在这次实验覆盖的任务里,TwinDEX才能在 不新增目标机器人真机遥操示范 的情况下,直接用几百条无本体数据完成后训练,并做出前面那些精细操作。

相比隔着控制器遥操机器人,这种方式也更接近人的自然操作:手可以直接接触物体,获得真实的力反馈,不需要额外适应空间映射和通信延迟。

更重要的是,数据采集不再和机器人数量一一绑定。多名操作员可以在不同地点同时采集,再把数据统一汇总到同一套处理和训练管线中。

在采集过程中,系统会同步记录视觉、关节状态、手腕位姿等多模态信息,再通过标定、时间同步和标准化处理,把来自不同操作员、不同地点的数据整理到统一的训练空间里。

因此,自变量也在模型架构和训练流程里做了相应设计,让模型能够容忍一定范围内的采集误差,并最终把这些数据学习成机器人可以闭环执行的策略。

灵巧性决定它能采什么、做什么;一致性决定采来的无本体数据能不能顺利迁移到机器人身上;而可扩展性,则决定这套采集方式能不能真正Scaling。

数据金字塔的塔尖正在被磨平

所以,TwinDEX真正值得关注的,不只是“数据采得更快”,它进一步证明了一件事: 最接近机器人动作的高质量数据,未必只能由真实机器人生产。

与此同时,机器人要部署、维护,人也要学习遥操,机器人数量一旦成为数据产能的上限,想真正Scaling就变得非常困难。

出于此,整个具身社区这两年都在探索UMI、手套/外骨骼、Ego第一视角等新的数据采集策略。

采集方式越自由,数据越容易Scaling;可采集端离真实机器人越远,后续的映射和迁移难度也越大。

尤其是人手与机器人在结构、自由度和接触方式上的差异,会不断引入动作重定向和精度损失。

而TwinDEX这次做的,就是在 可扩展性 和 数据保留的物理信息丰富程度 之间找到了一个新的甜蜜点。

它没有彻底放弃机器人本体带来的约束,而是把机器人真正需要的动作结构,提前“复制”到了数据采集端。

因此,在已经展示的任务中,只需要几百条无本体数据,就完成了过去后训练阶段通常需要真机遥操数据承担的一部分对齐工作。

当然,客观来说,在具身数据recipe还远没有收敛的今天,考虑到任务覆盖和数据多样性的需求,我们还不能直接宣布“遥操已死”。

如果无本体数据在后训练阶段,能够逐渐获得接近真机数据的训练价值,那么接下来真正值得探索的,就是一条属于无本体数据的 Scaling Law 。

只不过,在把无本体数据规模做大、真正验证这条Scaling Law之前,自变量已经率先在当前这个时间节点给出了自己的答案:

GitHub最热架构图Agent,开发者故事看哭了 2026-09-01

A社化身A割!Claude官宣永久提额25%,结果到手反而少17% 2026-09-01

相关阅读

哈工大系闯出人形机器人黑马:成立不到一年,全栈开源3m/s原型机,小米商汤都投了

基于数万次真机评测,RoboChallenge首份年度报告发布

从舞台秀到真干活,北京卫视春晚演绎机器人走向日常好用

上海AI实验室造出首个「通才」机器人大脑:看懂世界+空间推理+精准操控全拿下

可实现多模态大模型(MLLM)对物理实体的直接操控,使机器人能像人类一样“看到-思考-行动”

具身空间数据技术的路线之争:合成重建VS全端生成

国产世界模型登顶全球第一!断层领先谷歌英伟达,3D准确度近满分

热门文章

Claude开始接管物理世界!能用机械臂阻拦5000万美元打款了

智谱 GLM-5.3-Flash上线,商汤大装置提供国产算力支持

《时代》周刊全球AI 100放榜,精准捕获稚晖君最“想低调”的幕后老板

e生涯斩获浙江一等奖,同蚂蚁、浙大一道晋级数据要素国赛

去年归国的徐梦迪,成了清华姚班班主任

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1