AI 日报hiw3c.com

6天烧光2000多万,拿下开源第一!小米史无前例「炼丹直播」收官

量子位 www.qbitai.com 网页快照

6天烧光2000多万,拿下开源第一!小米史无前例「炼丹直播」收官

如今,MiMo-V2.6的Pro和Flash双双跑完30个训练Step,最终账单定格在350万美元(约合人民币2344万元)。

MiMo-V2.6-Pro,1.02万亿参数,420亿激活,在Artificial Analysis Intelligence Index上拿到46分,位列开源第一。

并且在多数Agent评测中,Pro的成绩已经逼近Claude Opus 5和GPT-5.6 Sol。

罗福莉将其称为 「迄今为止任何开源模型团队所进行的规模最大的单次强化学习训练之一」 。

还没完,更猛的还在后面,这位曾参与DeepSeek-R1研发的小米MiMo负责人直言:

在我看来,它背后的研究创新和工程挑战,超过了我曾参与其中的DeepSeek-R1。

MiMo-V2.6-Pro跑完30个Step,用时5天3小时,花掉约260万美元;

每个Step包含1568个Prompt,每道题让模型尝试16条不同路线,一轮就会产生超过2.5万条Rollout。

按技术报告单步2.7B~3.7B training tokens计算,Pro全程累计处理约81B~111B Tokens,相当于塞满超过8万个百万Token上下文窗口。

30个Step结束后, Flash的平均通过率相对提升25%,Pro相对提升12% 。

DeepSWE v1.1专门考察Coding Agent能不能在真实开源代码库中持续工作,OpenAI和Anthropic也已将其列为前沿模型发布时的重点评测项。

MiMo-V2.6的表现侧面说明,这轮RL不是在训练集上原地刷分,只跑30个Step,模型不仅持续变强,还把能力迁移到了没见过的软件工程任务上,样本效率和样本外泛化一定程度上经住了检验。

尤其是Flash,30个Step跑完花费仅为Pro的约三分之一,相对提升反而更大,堪称这次训练的「性价比选手」。

在Artificial Analysis Intelligence Index中,MiMo-V2.6-Pro拿到46分,成功登上全球开源王座。

例如AutomationBench上,Pro拿到53.1分,超过Claude Opus 5的50.3分和GPT-5.6 Sol的45.8分。

再结合其他评测来看,MiMo-V2.6-Pro在全球模型市场中的位置已经相当清晰:

MiMo-V2.6继续沿用V2.5的API定价,Pro输入/输出每百万Token约3元/6元,Flash约1元/2元。

横向一比更夸张,在同等智能水平下,Pro完成任务的成本仅为国际前沿模型的1/20至1/60。

按照Artificial Analysis的测算,MiMo-V2.6-Pro完成一项Intelligence Index任务,平均成本只有0.13美元(约合人民币0.9元)。

也就是说,小米第一次把45分以上前沿模型的单任务成本,打进了0.1美元量级(约合人民币0.67元)。

巧的是,同日发布的闭源模型Grok 4.7,在这项指数上同样拿到46分,但据Artificial Analysis实测,其xHigh版本完成一项任务平均需要3.74美元,约为MiMo-V2.6-Pro的29倍。

同步上线的MiMo-V2.6-UltraSpeed模式,最高速度还能达到约900 TPS。

Pro和Flash模型权重、完整技术报告、7000多个RL任务环境、端到端RL训练框架,以及可以自由组合的mini-harnesses,全部开放。

此外还有一个MiMo-V2.6-Distill-Qwen-9B,这是一个以Qwen3.5-9B为底座,使用MiMo生成的77.4B Token数据完成监督微调的模型。

最夸张的是,他们在最终RL训练启动不到一周后,就交出了模型、技术报告、7000多个RL环境和完整训练框架。

开源模型与闭源前沿之间的差距,又被大幅缩小了,而且这一次出手的还不是大家熟悉的中国玩家。

模型刚训完,小米内部就把MiMo-V2.6-Pro扔进了一个极其刁钻的科研场景,让它设计新型MOF材料。

MOF,金属有机框架,2025年诺贝尔化学奖刚颁给了这个领域。通俗点说就是在分子尺度上搭建一种「多孔笼子」,可以精确地抓住特定的分子。

小米前沿材料团队用它来对付PFAS,这是一类全氟取代的有机物,PFAS进了水和土壤之后几乎不降解,被称为「永久性污染物」。

MiMo-V2.6-Pro接到这个课题之后,先检索梳理了相关文献和专利,提出设计假设,然后自己核查方案的新颖性。

「大胆猜想」之后,MiMo便开始「小心求证」,它自动搭建好了模拟环境,并调用开源计算工具,计算它设计出来的MOF跟PFAS之间的结合强度。

它的思路是,在MOF内壁引入带正电的基团来吸引PFAS带负电的「头部」,同时嫁接更大、更扁平的芳香基团来容纳PFAS的含氟「尾巴」。

最终,模型跑出了两个候选结构,A50用的是芘基连接件,B50用的是三氟甲基联苯连接件,都是UiO-67型锆基框架。

模拟结果显示,A50和B50对PFAS的吸附性能是对照材料C50(联苯连接件)的一百万到一千万倍。

对此,北京大学材料科学与工程学院特聘研究员窦金虎教授评价说,MiMo-V2.6-Pro在这个项目上的表现,相当于一个训练有素的博士研究员。

小米方面披露,该系列已应用于公司内部新材料研发工作,整个研发周期从一个月压缩到了2到3天,效率提升十倍。

MiMo-V2.6这一代的能力,已经从「Vibe Coding」扩展到了「Vibe World」。

MiMo模型的能力边界,从写代码延伸到了更多场景,例如Blender 3D建模、视频创作、音乐生成,涉及各种不同的模态。

为了全面展示这些能力,小米团队用MiMo搭建了一个MiMo展览馆,里面的图像、视频、声音、3D模型等各种元素,全都是用MiMo生成的。

进入这座展览馆,映入眼帘的是一架钢琴,点击之后,钢琴就会开始自动演奏,演奏的音乐也是由MiMo创作,并且琴键也会匹配声音节奏进行运动。

在套娃页面里可以再次进入这个「电脑」,这时再点击浏览器,就会发现MiMo团队留下的彩蛋。

走出卧室,就能看到墙上挂的画,这是MiMo在模仿梵高的《罗纳河上的星夜》,画对面的房间里,藏了一座城堡。

整个环境的3D建模和动画,也都由MiMo完成,水面波光粼粼地反射着城堡和摩天轮的倒影,天空中还有烟花不断绽放。

代码、图像、视频、3D、音乐,这些过去需要分别找不同工具的事,MiMo-V2.6一个模型就能理解和生成。

甚至在具身仿真环境里,MiMo还能通过视觉反馈闭环控制Franka Panda机械臂,做物体抓取和颜色分拣。

能力涨了、价格不变、速度还更快了,MiMo-V2.6-Pro站在了「智能-成本」的帕累托前沿上,打破了「智能、成本、速度」这组不可能三角。

除了模型本体,配合模型一起上线的还有MiMo Desktop桌面客户端,支持多个Agent协同工作。

我们试着用MiMo Desktop制作了一个「3D中式宇宙」,呈现出中式元素构成的虚拟世界。

MiMo先是设计了一个整体思路,然后把不同类型组件的构造任务分派给多个子Agent去完成。

可以看到,模型能够充分读懂prompt里的佛塔、悬空寺、宫阙水乡、各类中式建筑构件等大量东方元素,也可以理解「极其宏大、令人屏息的体素宇宙」的核心诉求,明白需要构建开阔大世界。

技术层面,MiMo也能够识别多视角查看、第一视角漫游、光效运动逻辑这类交互类要求。

总之,面对这份要素繁杂的需求,MiMo成功渲染了宏大梦幻的东方仙境,还原出了壮丽磅礴的体素古代中国。

从设计新材料到生成虚拟世界,从3D建模到控制机械臂……MiMo-V2.6展示了一个模型在不同领域、不同模态之间自如切换的通用性。

为了让这场超大规模RL顺利跑完,小米既要防模型「抄答案」,又得应付显卡爆显存、评分器失联、MoE专家负载崩塌等一连串意外。

最核心的当然还是MiMo-V2.6采用的后训练方法,小米把这次RL Scaling拆成了三个方向。

生成、执行、评分和训练可以同时推进,做完的任务直接进入下一环,不必等待整批任务全部结束。

这样一来,数万个Agent能够持续进入不同任务现场,边干活、边试错、边为模型积累经验,整条训练流水线也不会被少数慢任务拖住。

这次训练把代码、通用Agent、视觉和网络安全任务混进同一次RL Run,模型既要修代码、操作工具,也要设计网页、复现漏洞。

如果模型只在一种工作台里训练,很容易记住特定操作套路,因此小米设计了多种可以自由组合的mini-harnesses,让模型学到能迁移到其他Agent框架中的能力。

实验中,即便换成训练时没有见过的Codex、Claude Code和mini-swe-agent,模型的平均通过率也从约50%涨到了66%。

在MiMo-V2.6-Pro的训练成本中,训练模型占43.5%,生成Rollout占43.8%,剩下12.7%都花在了Grader上。

也就是说, 这场价值260万美元的Pro训练,光给模型「判作业」,就花掉了约33万美元 。

假设两条代码轨迹最后都通过了测试,一条只改了3行,准确解决问题,另一条改了几百行,还塞进大量兼容分支、异常吞噬和无关配置。

另一套则让评分Agent同时查看同一道题的多条成功与失败轨迹,再给通过测试的方案排出高低。

结果模型不只会把题做对,还开始学会用更短的路径、更少的Token,把事情做得更干净。

模型先生成多条路线,再由评分器找出其中更好的办法,最后把差异重新变成模型的学习信号。

有的模型会安装更新版本的软件包,直接查看里面已经修好的代码;有的会下载上游源码、克隆最新版仓库;还有的干脆搜索原始Issue、PR和历史Commit,照着人类开发者公开的答案修改。

为了堵住这些路,小米先清理训练环境中的补丁、构建日志、缓存和多余Git历史,再切断网络,防止模型去外面搜现成答案。

团队又专门派出一个Hack Agent,主动攻击训练环境,寻找可能泄漏答案的缓存、文件和工具漏洞。

Hack Agent找到一条,团队就堵一条,堵完之后再让它继续找,直到现有环境里再也找不到可利用的答案,才正式投入训练。

即便如此,团队仍在RL过程中持续审查轨迹,一旦发现新的作弊方式,就把对应奖励清零并继续修补环境。

最终,两款模型被确认存在Reward Hacking的轨迹,比例都被控制在2%以下 。

GPU显存双比特错误、Cyber任务集群Kubernetes故障、评分器网络失联、显存不足,以及长轨迹撑爆CPU内存。

其中一次Pro训练中,MoE专家并行中,某个EP rank收到的Token负载超过平均值的30倍,直接把GPU显存顶爆。

团队继续排查发现, RL会让负责分配Token的MoE Router不断漂移 。

训练到第20步时,专家负载峰值已经从平均值的6倍涨到16倍,「冷专家」比例也从0.5%升至22%。

更微妙的是,把Router恢复到RL开始前的参数后,专家负载马上恢复正常,模型能力却没有下降。

调度系统只传轻量信息,Token、图像和路由数据等「大件」进入分布式存储,再由真正需要它们的训练节点读取 。

各种长度不同、速度不同的任务,则交给Sample Mixer动态调度,避免简单任务早早跑完,复杂任务永远赶不上训练批次。

当RL扩大到数千张GPU、数万个并行Agent和数十亿Token一步时,单纯「多买显卡」已经不够了。训练场、Agent工作台、评分系统、数据管道,以及防作弊机制,都得跟着一起扩大。

如果RL是通向模型自我改进(RSI)的路,那这条路在规模放大之后,会自己长出新的障碍。

模型学会抄答案,是它在「自我改进」的过程中找到了捷径,而不是真的变强;Router漂移导致专家坍缩,是模型的内部结构在高强度RL下开始失稳……

每一个障碍,都不是简单调参数能解决的,它们是RL走向更大规模时必须面对的结构性问题。

DeepSeek-R1走过一次这条路,MiMo-V2.6在规模和复杂度上又往前推了一步,也就意味着它撞上的问题更深。

但这些问题最终被一个一个啃了下来,Reward Hacking有Hack Agent对抗,Router漂移有冻结策略兜底,Grader成本控制在训练总成本的12.7%,说明大规模RL这条路是走得通的。

开源地址: https://huggingface.co/collections/XiaomiMiMo/mimo-v26 博客: https://mimo.xiaomi.com/mimo-v2-6 技术报告: https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/MiMo_V2_6_technical_report.pdf

国产RSI模型交卷!Flash模型靠它反打旗舰 2026-09-17

啊啊啊GPT-6 Astra这么不安全!这次马斯克都瘫坐了 2026-09-21

ECCV上,顶尖学者们开始研究如何让AI做生意了 2026-09-10

相关阅读

人刚毕业,在小米造狗没有KPI,雷军奖励100万美金

小米再追投,这家国产激光雷达公司D轮融资已超3.7亿美元

小米打通智驾和具身大模型,然后开源了

小伙儿被小米11 Ultra征服了!强迫症狂喜,原神玩家欢呼,摄影爱好者感动

120Hz屏幕+120W快充+120倍变焦,两分钟看完小米10周年三款超大杯新品!

吉利汽车研发一把手加盟顺为资本,小米汽车已组建300人团队

热门文章

从“会回答”到“会办事”,vivo如何解AI手机这道题?

刚刚,唐杰发布智谱RSI首个成果

刚刚,Claude Code大重构!内部3万Agent管理技术免费开放

协同办公进入Agent时代,飞书+豆包工作跑在了最前面

央企做了个通用Agent,直接杀进IDC实测前三!

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1