AI 日报hiw3c.com

华为大模型双子星联手创业,要找物理世界的Scaling Law

量子位 www.qbitai.com 网页快照

华为大模型双子星联手创业,要找物理世界的Scaling Law

程浅 发自 凹非寺 量子位 | 公众号 QbitAI

Physical AI创业公司 息壤开物 宣布,公司已经连续完成数亿元种子轮及天使轮融资。

由敦鸿资产领投,华控基金、三花控股、银杏谷资本、泽然资本、本坚基金、天使基石、标朴投资等知名机构跟投,估值达5亿美金。

即先从海量视频、机器人轨迹和真实交互中预训练一个物理基础模型,再让它进入不同本体和任务。

除了看重李寅、张含望及团队本身,为什么资本愿意在模型尚未完成预训练时,便下注这个非共识答案?

在息壤的定义里,大语言模型(LLM)代表的是AI 1.0时代,主要学习那些已经被人类抽象为语言、代码和公式的知识。

原来这个世界是连续变化的、可以被行动改变的,而且每一次行动的背面,还存在其他无数种可能……

这种混沌且连续演化的复杂性,是仅仅在 离散Token序列 中进行概率预测的LLM所无法忍受的。

所谓表征,是让“某种形式”代替某个对象,使一个系统能够对它进行识别、比较、推理或行动。

一个人眉头蹙起却嘴角上扬,这是无语、苦笑、讥讽,还是忍痛?不知道,物理世界只提供像素、声音、位置和受力变化。

在这无限多的变化和变化的组合之中,或许只有一个信号值得把握。而模型只能从亿万次观察、行动与反馈中自己找到答案。

这就是LPM,Large Physics Model,“大物理模型”将要完成的任务。

尽管VLA已经证明,视觉和语言信息可以被进一步映射为机器人动作,但在实际部署中,大量模型仍然要针对特定本体和任务进行增训。

如果机器人要进一步进入家庭和公共服务场景,模型就需要具备通用能力,在进入新环境时保留已经学到的物理知识。

据披露,息壤模型在World Arena 2.0 Track 1中,Trajectory Accuracy单项排名第一,Physical Adherence单项排名第二。

其中,Trajectory Accuracy主要考察模型预测的物体运动轨迹是否准确,Physical Adherence则关注模型生成的未来状态是否符合基本物理规律——均与LPM希望解决的问题具有直接联系。

这一观察与LPM的核心假设有关:如果物理智能同样存在Scaling路径,那么模型能力应当能够随着训练规模扩大而持续增长。

据息壤介绍, 随着数据规模与训练规模增加,模型性能已经出现初步提升趋势,团队认为值得继续做下去。

要拉长这条技术曲线,找物理世界的Scaling Law,凭借好的想法和积极信号还并不足够。

基模侧,她曾带400人团队,依托百万小时视频数据集,在万卡算力集群上耗时2个月训出了一个8B视频大模型。

产业侧,她负责国内多地具身智能创新中心的落地,还交付了包括智驾、矿山、金融、医疗、气象在内的30个行业的200多家客户,每年带来数亿营收。

随着训练规模扩大,数据管线、算力调度和集群稳定性都会成为工程约束,任何一个环节的差错都可能影响整个训练周期,带来高昂的算力空转消耗。

但模型一旦走进产业,评判标准马上就变了, 工作是否稳定、成本能否控制、能力能否快速复制……

因为从过往的产业落地经验来看,机器人每进入一个新场景都需要重新采集数据并定制模型,具身智能很难实现规模化落地。

相较于李寅的工程化与产业落地能力,即将出任息壤联合创始人和首席科学家的张含望则更多在理论侧深耕。

张含望教授,前华为多模态首席科学家,南洋理工大学计算与数据科学学院教授、人工智能校长讲席教授。

他长期研究因果机器学习、多模态理解和模型泛化,累计发表论文228篇,被全球引用超4.2万、H-index达81,是“causality(因果性)”这个方向上的华人学者NO.1。

还曾入选IEEE评选的“全球AI领域十大最值得关注的学者”,获得过新加坡总统科技奖青年科学家奖。

如果模型只记住训练数据中的物体外观和机器人姿态,那么更换材质、光照或本体之后,原有能力就可能失效。

Physical AI需要更稳定的表征系统,使模型成功识别不同场景背后的共同结构。

可以说,李寅与张含望二人不同的能力点,分别代表了 华为大模型体系中工程产业侧与算法研究侧。

李寅更接近基础模型如何训练、组织和部署的问题;张含望更关注模型稳定认知和迁移能力的形成。

但到了Physical AI阶段,机器最终要进入真实世界时,这两条路径就要开始融合、必须融合了。

如此二人的搭档使息壤既不同于单纯研究算法的实验室,也不同于围绕机器人本体承接项目的交付公司。

团队既有参与过上一轮LLM基础模型训练的成熟负责人,也有来自多模态、世界模型和3D交互方向的年轻研究者。

Model团队负责统一生成模型与物理表征;Data团队建立多来源数据管线,并处理仿真与真实数据;System Infra团队则支撑大规模稳定训练和后续推理优化。

团队履历只能解释“why”的问题,决定基模能否从理念真正落地的,仍然是“how”。

以收拾桌面为例,机器人需要先识别物体,再判断抓取顺序,规划移动路径,并根据每次动作之后的环境变化不断调整策略。

假设机器人在每个时刻有(b)种选择,完成任务需要连续决策(H)步,可能的行动路径就会增长到b^H。

如果每一步有10种选择,连续决策20步,理论上的路径数量将会爆炸增长到 一个无法想象的数量级。

按照张含望对这条技术路线的理解, 宇宙本身就可以被看作一个持续展开的巨大自回归过程。

在马尔可夫框架中,如果当前状态已经包含决策所需的充分信息,那么此前漫长的历史便可以被压缩进“当下”。 下一时刻的状态,主要由当前状态与当前动作决定。

贝尔曼递归则在此基础上进一步处理“未来”:一个长期任务的价值,可以被拆解为当前动作带来的即时收益,以及进入下一状态后仍能够获得的未来价值。

在这样的理论框架下,过去不必被逐帧保存,未来也不必被一次穷举,模型只需要在当前状态下选择动作,再根据新的状态继续推演。

棋手不会在落子前穷举世界上所有可能的棋局,而是判断当前局面,选择一步,再根据新的局面继续推演。

这也是息壤所强调的第一性原理,回到物理决策的 最基本结构 ,状态、动作、下一状态,以及行动产生的价值。

在更为具体的架构上, 息壤的LPM以Unified AR Transformer作为骨干 ,让自回归模型将复杂过程拆解为连续的条件预测。

Diffusion则作为可选模块存在,当系统需要把未来状态渲染成连续视频时,Diffusion完成视觉生成。

基于这套理论框架,息壤将LPM拆分为六个相互配合的底层能力底座:统一Token、统一模型架构、强化学习算法、数据体系、评测体系和工程基础设施。

统一Token 负责把视觉、动作、触觉和力觉等异构信息转换为模型能够共同处理的表征;

不同来源的数据被转换为统一表征,模型生成动作并预测后果,动作进入仿真或真实环境接受检验,奖励与评测系统把结果转化为反馈,成功和失败的经验再重新进入训练。

按照息壤的规划,第一阶段数据将来自互联网物理视频、Ego第一视角数据、UMI示教、仿真与合成数据,以及公开机器人轨迹和真机反馈。

L1是领域模型,进入工业制造等具体领域后,模型还要学习行业中的对象、流程和约束。

其训练成果XIRRA v0.1计划于今年晚些时候亮相,届时,判断物理模型价值的标准或将更新。

而物理世界是否真的存在一个符合Scaling Law的基础模型,也可以拭目以待了。

“土自长息无限,故可以塞洪水也”,息壤可自行生长、不断增殖,最终成为承托浩大工程的神土。

所有采集数据以及在真实部署中的成功或失败的反馈,重新流入训练,成为模型继续生长的土壤,生生不息。

揭示万物的道理、促成天下的事务,而由此统摄天地间的一切规律——如果说,物理世界真的存在自己的LPM,大抵如此。

— 完 — 量子位 QbitAI · 头条号签约 关注我们,第一时间获知前沿科技动态

别人忙着卷Code,Kimi抽身反打浏览器插件:网页操作一秒变Skill 2026-09-25

呃…小扎「自研Manus」刚成Meta太子,就塌房了 2026-09-25

Meta靠自研Manus翻身!股价一夜暴涨11%,登顶苹果商店,增速反超ChatGPT 2026-09-24

开源Top2!实测阶跃Step 5 Preview,真有点猛啊… 2026-09-21

热门文章

AGI最难一战,竟在医院!中国AI登上Science,医生不怕失业还催着上线

AI离“理解万物”还有多远?先拿癌细胞和行星轨道试试水

白天务农晚上码农,这个斐济农民跨越一万公里来拼多多取经

27B模型分分钟交付网页,Qwen 3.8还是太能了

具身智能技术路线尚未定型,基础设施却先收敛

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1