AI 日报hiw3c.com

通用能力不打折,空间具身智能断层领先!ZDTaichu5.0-9B国产开源,跻身全球多模态第一梯队

量子位 www.qbitai.com 网页快照

通用能力不打折,空间具身智能断层领先!ZDTaichu5.0-9B国产开源,跻身全球多模态第一梯队

鹭羽 发自 凹非寺 量子位 | 公众号 QbitAI

紫东太初最新开源的通用多模态大模型 ZDTaichu5.0-9B ,直接把10B以下通用模型空间具身的天花板又往上顶了一大截。

过去的多模态模型,已经能把一张图片理解得头头是道,但一旦走进真实物理世界,空间理解与行动能力往往就跟不上;而一些模型为了补足空间能力,又不得不以牺牲通用能力为代价。

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

如果让人来做,应当是个非常简单的过程: 拉开抽屉→放进去→再关闭 。但具身不一样,一连串的动作背后都是相当细致的空间判断。

每一步都要承接住上一步带来的变化,动作才能看起来顺,这对模型能力的考验是极为苛刻的,而ZDTaichu5.0-9B已经能完成 复杂的空间理解和高层任务规划 。

与此同时,对于这个只有9B大小的模型,其图文理解、文字识别、数学推理和代码能力也依旧稳居 第一梯队 。

空间具身+多模态双领先

从视频目标定位到三视角推理,空间判断稳准狠

这个 空间感知任务 对于机器人来说,是后续执行任务的大前提。指错了,后面的抓取动作再准确,执行的也是另一个任务。

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

画面中,台面挤满杯子、收纳容器和各种杂物,干扰项较多。模型得同时读懂银色这个关键属性、盒子这个对象,以及从左到右第二个这层空间排列关系。

从对比演示中看,ZDTaichu5.0-9B给出的 归一化坐标 (237,226)最为精准,落在目标标注区域内。

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

输入的是同一房间的三个视角。模型需要设想自己移动到绿框窗帘所在的位置,面向蓝框沙发,再判断红框柜子相对自己的方位。

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

当我们把三个例子放在一起看,它们分别对应目标选择、参照系转换和交互条件判断,都在机器人执行真实物理任务中扮演关键要素。

在所列的10B档位开闭源模型中,ZDTaichu5.0-9B几乎是 断层领先 。

比如差距较大的MindCube-tiny,ZDTaichu5.0-9B的得分是78.27分,Gemma4 8B-E4B、Gemini 3 Pro和Grok 4分别是48.8462、70.87和63.56。

整个榜单把 空间感知、三维推理、多视角变换、具身交互 都囊括在内了,可谓是面面俱到,足见ZDTaichu5.0-9B已彻底看懂物理场景该怎么操作。

双线突破,通用能力不降级

图解理解基准AI2D达到 91.48分 ,仅次于Gemini 3 Pro,高于其它所有对照模型。

WeMath为75.9分,同样领先;MathVista Mini为84.5分、OCRBench为85.5分,表现颇具竞争力。

除此之外,ZDTaichu5.0-9B在 Agent与文本任务 上也依旧表现突出,尤其是代码成绩。

这些能力具体怎么组合起来用, 科研Agent 的阻尼振子求解demo给出了直观展示。

该问题要求Agent组织解析求解与Python/SciPy数值计算,并对照两种结果,最后生成相空间图、位移与速度曲线,以及分析报告。

ZDTaichu5.0-9B在整个过程中也丝毫没有掉链子,在问题理解、代码执行、结果核对和图表输出四个阶段子任务上都完美实现连续衔接,最后输出非常完整。

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

要同时兼顾 空间具身能力与通用能力 两条线,背后要解决的有很多,例如数据如何组织,以及复杂判断时算力怎么分配。

9B多模态大模型的空间具身能力,是怎样练成的?

全栈数据生产管线:把通用能力、Agent能力以及空间具身能力全部练进模型

紫东太初先是围绕这一需求,组织了一套 经过全流程验证 、 可复用 、 可迁移 的数据工程链路。

原始素材进入管线后,先通过 感知哈希 与 URL 去重,再过滤低清晰度、图文不相关等较差的样本,随后进行内容重写解析和视频抽帧描述,最终打包组织成可训练的图文与时序输入。

开源SFT指令、真实业务问答、空间具身案例,以及Agent工具调用轨迹,都被组织成多轮对话、多图和视频序列。

其中针对 具身样本 ,管线还会检查图像、问题、对象关系和操作约束是否一致。还是以开头的美工刀收纳举例,如果图中抽屉关着,模型就不能直接要求夹爪往里放东西。

带步骤的思维链 也要经过拒绝采样、格式和一致性校验。这样进入训练的,才是有视觉依据、能解释操作顺序的任务样本。

团队为数据建立 能力域-难度-质量标签三维自动标签系统 ,为模型筛选高信息量样本。

值得注意的是,评测数据不会直接作为训练样本,标签也只是用于提供能力分类与样本筛选的参照。

GRPO 则把答案是否正确、空间坐标是否命中、输出格式是否合规,都通通转化成可自动校验的奖励信号,让模型沿着具体反馈继续改进。

未来即使是企业自己的车间录像、实验操作记录和仿真素材,也都可以通过这条路径转化成训练样本。

内置自适应循环推理:把算力用在真正难的判断上

比如有些画面中目标清楚、关系简单;有些任务则要整合多个视角,还要判断遮挡和操作前提。

ZDTaichu5.0-9B为此引入了 内置自适应循环推理 ,让模型根据预测的不确定性,决定当前Token是否需要再算几轮。

具体来说,模型先完成一次标准前向计算,得到Token预测分布和隐层状态。 熵门控 随后评估预测的不确定程度,分布越分散,意味着模型对输出的把握越小。

确定性较高时,模型直接输出;遇到 高不确定性节点 ,就在内部重复执行部分层块计算,迭代调整隐层表征,为当前判断 增加计算深度 。

ZDTaichu5.0-9B配套了 三重稳定化工程设计 ,以致于模型能够让算力合理倾斜:

1、阻尼更新: 控制每轮修正幅度,避免特征漂移; 2、双重停止判据: 同时监测输出分布的KL散度和隐状态残差,判断结果是否趋于稳定; 3、轨迹读出与状态回滚: 保留迭代中间轨迹,并从中选择风险最低的表征结果。

有趣的是,这套按任务需要调节推理投入的思路,在最近大火的 GPT-6 Astra 上也有所体现。

OpenAI官方文档显示,Astra新增支持调节推理投入,并允许在对话过程中为困难任务提高推理投入,反之降低常规任务投入。

ZDTaichu5.0-9B 展现出高度对齐的技术前瞻性,也是在 开源模型 中率先落地这一机制。

内外循环协同:把单步空间判断接成连续任务

模型的 内部循环 仅仅是围绕当前输入改善感知与推理, 外部任务循环 还要接收新观测和执行反馈,更新任务进展。

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

模型首先在工具辅助下识别目标区域,组织接近、抓取、抬起、移动、放下和退出;新的观察结果继续影响后续操作,最终确认奶酪盒留在碗内。

所以在实体系统中,对模型的要求非常之高,模型不仅要承担语义理解、空间判断和高层规划,还要保证外部系统正确执行控制任务。

好在 内外两套循环 实现了这一点,让每次行动都能成为下一轮判断的新条件,显著提升长程任务的成功率。

从实验台到搬运现场,无需重新造轮子

对于横在图文模型面前的三座大山,包括 对象认不准、方位难转换、进度跟不住 ,均逐一破解。

ZDTaichu5.0-9B不止把权重开放了,连同整套经过工业级验证的数据生产管线详细方案也一并打开,企业就能用自己的数据和机器人继续训练,迭代出更个性化的空间多模态模型。

从榜单评测走到实体任务验证 ,ZDTaichu5.0-9B也把空间理解能力带入了科研自动化和智能制造的具体流程。

两支试管经过抓取、双臂交接和入架,位置与姿态不断变化。模型需要持续区分样品身份,判断哪支已经入架、哪支仍待处理,并据此安排下一步操作。

样品身份、空间位置和任务进度由此被关联起来,为自动化科学实验平台提供上层任务编排与状态记录能力。

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

面向机台上料的工件转移演示,则呈现了机器人从料架抓取工件、转向搬运,再放置到工作台的完整过程。

将目标识别、搬运衔接和放置检查串成连续流程,为 制造场景 提供可进一步适配的高层规划基础。

视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg

对于开发者,ZDTaichu5.0-9B已经交出了一份 早期验证答卷 ,后续完全可以基于它继续往前推,推得快还很准。

而对紫东太初,这次发布意味着通用多模态能力进一步向空间理解与具身任务规划延伸,其产业价值也将在更多具体任务中接受检验:

换一批工件、调整一次对象位置、增加一个操作前提,模型还能否认准对象、更新状态,并组织正确的下一步……

ZDTaichu5.0-9B用开源模型、数据管线、技术路径和实体案例重新开了个好头,作为基座,势必会让更多通用多模态模型跨越物理门槛。

紫东太初ZDTaichu5.0-9B是一次从0.001到1的突破,是从数字理解迈向物理具身智能的关键落地。

Blog链接: https://taichu-ai.github.io/ZDTaichu5.0-9B GitHub链接: https://github.com/Taichu-AI/ZDTaichu5.0-9B HuggingFace链接: https://huggingface.co/TaichuAI/ZDTaichu5.0-9B ModelScope链接: https://www.modelscope.cn/models/TaichuAI/ZDTaichu5.0-9B

今年外滩最特别Agent:能干活,能陪聊,还会朋友圈拉黑你 2026-09-13

现场围观金融AI决赛,大厂挑人的逻辑我悟了 2026-09-08

金融AI的年度大考交卷了:2万名选手、30+家机构、百亿级数据开源 2026-09-04

世界生成模型来了3D头部玩家,可进入生产管线的场景级生成时代来临! 2026-09-03

相关阅读

打破跨模态干扰,快手东北大学联合提出统一多模态框架,横扫多模态检索基准

512张GPU炼出10万亿参数巨模型!5个月后达摩院模型再升级,今年双十一已经用上了

多模态CoT思维链架构来了,现已开源|来自厦大&腾讯优图

32专家MoE大模型免费商用!性能全面对标Llama3,单token推理消耗仅5.28%

首个小学生AIGC课程来了!大模型使用从娃娃抓起

GPT-4o mini排名雪崩,大模型竞技场规则更新,奥特曼刷分小技巧无效了

热门文章

全球首个3D原生城市世界模型ABot-Earth 0.7发布,构建AI理解真实世界的入口

打造10万卡国产算力集群推出JoyAI世界模型,京东发布物理AI建设最新成果

AGI时代的第一个生图模型,ChatGPT Images 2.5上线

ECCV上,顶尖学者们开始研究如何让AI做生意了

这个新开源的世界模型只有1.3B,单卡就能实时跑!

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1