AI 日报hiw3c.com

Xspark AI 丁文伯:触觉替代不了视觉,但机器人需要一套自己的“脊髓” |物理AI 50人

雷峰网·AI 科技评论 www.leiphone.com 网页快照

Xspark AI 丁文伯:触觉替代不了视觉,但机器人需要一套自己的“脊髓” |物理AI 50人

具身智能进入“触觉时代”,丁文伯提出“脊髓”架构补全机器人物理交互短板。 作者:李秋悦 编辑:吴彤

丁文伯很难被一个词准确“定位”。通信博士、材料学博士后、机器触觉学者,这些标签都对,但都只能解释他的部分经历。

2025年,丁文伯又多了一个身份——Xspark AI(无界智航)联合创始人、首席科学家。一个做了多年传感器研究的清华教授出来创业,没有把公司定义成一家“传感器公司”。 相反,他认为造出更好的传感器,并不会自动得到一个更聪明的机器人,机器人触觉可能需要一套自己的模型。

过去两年,具身智能最主流的技术路径仍然延续大模型的Scaling逻辑,即更多视频、更多机器人轨迹、更大的VLA(视觉-语言-动作模型),让机器人沿着“看见—理解—行动”的链条不断提高泛化能力。丁文伯并不反对这条路线,他甚至认为“VLA是一个蛮solid的逻辑,像早期Transformer、diffusion policy一样,一定会在具身智能(历史)长河里留下浓墨重彩的一笔”。

在丁文伯看来,视觉其实已经解决了机器人感知世界“99%”的问题,触觉没有必要和视觉竞争。它更像是在视觉失效或者不够确定的时候,补上接触发生之后的信息。杯子有没有开始滑动,手指是不是捏得太紧,机械臂有没有撞到人,一个灵巧动作应该继续用力还是立刻修正。 机器人一旦真正进入物理世界,问题就不只是“有没有看见”,还包括接触之后能不能及时感知、修正和避险。

最直接的办法,是把触觉作为一种新的模态塞进现有模型。但丁文伯对此并不完全满意,他认为从第一性原理看,触觉的信息量远没有视觉丰富,却对反馈效率有更高要求。把它直接和整个视觉模型融合,要么产生大量冗余,要么少量关键触觉信息反而被视觉淹没。

触觉智能未必需要拥有视觉大模型那样丰富的语义理解能力,相反,它可能应该更轻、更快、更靠近身体。人快要摔倒时,并不会先识别“我正在摔倒”、分析原因,再决定伸手,而是身体先完成反射。 丁文伯因此喜欢用人的“脊髓”来类比触觉智能:它处理的信息可以没有那么丰富,但要足够低延迟,能够在滑动、碰撞、失衡等发生的一瞬间做出反应。

首先是硬件。不同触觉传感器之间的一致性依然很差,即使同一批次生产的设备,性能也可能存在明显差异。模型因此很难像视觉模型一样,在不同硬件之间直接迁移。

其次是数据。触觉没有互联网时代天然积累下来的海量图片和视频,同一个动作换一个人、一个传感器甚至一个机器人,数据分布都可能发生变化。

再往后还有更基础的问题:触觉到底应该如何Representation和Embedding?不同传感器采集出来的力、温度、剪切、振动,最终有没有可能被转换成某种与具体硬件无关的共同表征?丁文伯把接下来两三年甚至五年的问题概括为三个“跨”——跨传感器、跨模态、跨本体。

所以丁文伯并没有声称,一套成熟的“触觉大模型”已经有了答案。他承认,目前更现实的仍然是一条折中路线:短期先把某一种多模态触觉传感器做好,再和现有模型融合;预训练阶段聚焦通用能力构建,触觉信息的引入与融合则放在灵巧操作的后训练和动作修正阶段。至于长期,他才倾向于认为,触觉最终会形成自己的模型和逻辑。

Xspark AI提出的“慢脑 VLM—快脑 VTLA+TWAM—脊髓 VTA”三层架构,可以看作前者判断现阶段的一种工程表达。在这套架构里,视觉语言模型构成“慢脑”,负责语义理解、高层认知和任务规划;触觉首先进入“快脑”,与视觉、语言和动作一起参与长程任务和灵巧操作;再往下一层,触觉成为“脊髓”的核心信息,在碰撞、滑落、安全等场景下完成更快的局部反应。同一种触觉,因此同时承担两种角色:在快脑里帮助机器人“做得更好”,在脊髓里保证机器人“来得及反应”。

视觉仍然会是机器人理解世界最重要的信息来源,VLA也仍然是主流路线。真正没有被定义清楚的是: 触觉究竟只是现有视觉模型增加的一种输入,还是因为它对接触、运动和实时反馈的特殊要求,最终会生长出一套不同于视觉智能的模型和计算逻辑。

丁文伯现在做的,就是试图找到这个答案。以下是左林右狸与丁文伯的对话(在不改变原意的基础上做了部分编辑):

左林右狸:最后为什么没有成为一个典型的材料科学家,而是往传感器和信息处理方向走?

左林右狸:你之前提到说触觉未来可能需要自己的模型。触觉原生智能和视觉、语言的原生智能,根本区别在哪里?

左林右狸:你们提出了“慢脑 VLM—快脑 VTLA+TWAM—脊髓 VTA”三层协同架构,分别负责高层认知、物理执行及安全兜底。这个灵感是来自生物神经系统,还是自动驾驶里面的一套分层架构,感知、决策、控制?

关于丁文伯,左林右狸还准备了另一篇《我所知道的丁文伯》。相比这篇对话聚焦触觉智能,另一篇更关心他一路走来的那些偶然与转折:2010年,他如何错过汤晓鸥的一次选拔,后来回看仍觉得是个“很stupid”的决定;赴美访学期间,又如何在一个圣诞节偶然重逢王中林团队的高中师兄;以及在不同阶段,哪些老师、同学和合作者真正改变了他的研究选择与人生走向。

我们欢迎所有能为左林右狸提供新观点新角度新信息的群友,加入我们的实名制社群,与左林右狸一路同行。管理员微信号: leiphonelinli ,备注公司-职位-称呼通过更快。

Xspark AI 丁文伯:触觉替代不了视觉,但机器人需要一套自己的“脊髓” |物理AI 50人

从Demo到1000万次真实作业,万勋发布NOVA2.0柔性具身大脑

王兴兴上市后首次公开演讲:机器人真正爆发要等两个「80%时刻」丨WRC 2026