罗福莉沉寂半年官宣小米强化学习!直播新模型训练过程,一小时烧3万美元
梦晨 发自 凹非寺 量子位 | 公众号 QbitAI
点进去一看,这哪是训练现场啊,这就是烧钱现场,一眨眼就是10美刀,一分钟就是4000多元人民币出去了。
当然烧钱的速度可能不是均匀的,从pro模型开始训练算起36小时,两款模型已经花了超过108万美元, 平均每小时3万美元 。
在这个页面上,训练花了多少钱、跑了多少步、奖励曲线涨没涨、哪个节点的显卡出了故障,全部公开可查。
见过开放权重、开放训练代码和开放训练数据的,开放训练过程的还真是没见过,围观群众纷纷大呼过瘾。
Pro的dynsam/avg@n从第1步的约0.565提升至0.614,Flash则从约0.514提升至0.603;最新公开的DeepSWE v1.1离线评测中,Pro和Flash分别达到 62.24和60.77 。(对比DeepSeek-Flash v1.1是74.2%)
Flash从更低的起点快速追近,Pro目前只保持小幅领先。不过Pro训练完一个Step更慢,所以最新的评分还没出来。
小米公开如何Scaling强化学习
传统的预训练scaling很容易理解: 更多数据 × 更多参数 × 更多算力 → 更强模型
MiMo-V2.6系列每个训练Step大约会处理 20亿Token ,配置为 1568个Prompt × 每个Prompt 16条Rollout 。
也就是说,同一道题并不是只让模型回答一次,而是让它尝试多条不同的解题和行动轨迹,再从这些尝试中获得强化学习信号。
1568×16意味着一轮就可能产生超过2.5万条Rollout。而对于Agent任务来说,一条Rollout又远不只是“一问一答”:模型可能要经历几十轮思考、工具调用、环境反馈和再次行动,因此最终一个Step的Token数可以达到数十亿级别。
更重要的是,整个系统采用了 Fully Async,也就是完全异步的执行方式 。
传统意义上可以把一次RL训练想象成一条整齐的流水线:先把所有样本生成完,再统一评分,然后训练模型,最后开始下一轮。
在MiMo的系统里,不同任务可以同时处于不同阶段:有的Agent还在环境中执行任务,有的已经完成、等待判分,有的正在计算Reward,还有新的任务正在进入系统。生成、执行、评分和训练不再严格排队,而是组成了一套持续运转的异步流水线。
环境的Scaling
第二个扩展方向是 Environments and Harnesses,也就是训练环境和执行框架的扩展 。
MiMo-V2.6做的是Multi-task Agentic RL:代码、通用任务、视觉、Chat等不同类型的任务,可以被混合到同一次RL Run中训练,而且这些任务还可以运行在不同的Harness里。
例如一个编程Agent的Harness可能允许模型打开终端、修改代码、执行测试、阅读报错,然后继续修改;另一个视觉Agent面对的则可能是一套完全不同的工具、环境反馈和成功条件。
因此,MiMo想扩展的除了“题目数量”,还有 模型能够进入多少种环境、使用多少种工具、解决多少种类型的问题 。
这也是为什么直播页面会专门展示Batch Composition:这一栏实际上是在告诉外界,每一个训练Step中,模型正在从什么样的任务和环境里获取经验。
评分的Scaling
第三个Scaling方向则更容易被忽略: Grader Compute,也就是给打分本身增加算力。
代码任务还可以运行Test Case:100个测试通过了多少个,就可以形成相对客观的反馈。
但面对更开放的Agent任务,仅仅判断“最终成功还是失败”往往远远不够, 负责判断模型做得好不好的评分者,同样开始消耗越来越多计算资源。
而这里还有一个更加关键的问题 Credit Assignment,也就是信用分配。
假设一个Agent为了完成任务连续执行了40步:搜索资料、打开网页、阅读信息、编写代码、运行测试、发现错误、修改代码,最终成功完成任务。
如果系统最后只告诉模型一句“成功,Reward=1”,这个学习信号其实非常粗糙。
因为模型并不知道:前面的40步中,究竟哪些动作真正帮助了成功?哪些步骤其实毫无必要?哪一次修改扭转了整个任务?又有哪些动作虽然最后没有导致失败,却实际上是不好的选择?
MiMo在这次训练中特别提到了 Agentic In-group Credit Assignment 。目前还没有公布具体算法,但结合“同一个Prompt生成16条Rollout”的训练方式,可以理解其基本目标:利用同组多条Agent轨迹及其结果,获得比简单的最终成败更加细致的强化学习信号。
同一组任务尝试,哪些行为应该获得更多鼓励、哪些应该减少鼓励,以及如何把这种判断转成训练信号。
扩展计算量,让模型产生更多经验;扩展环境和Harness,让模型获得更加多样的经验;更多评分计算量,则负责从这些海量经验中提取更加准确的学习信号。
当预训练的Scaling已经发展多年之后,能否把模型与环境交互、产生经验、评价经验再到学习经验的整个RL循环,也变成一台可以持续扩大规模的机器?
参考链接 [1] https://mimo.xiaomi.com/rl [2] https://x.com/_LuoFuli/status/2100296686719610932
智谱提前剧透下一代GLM:完全自训练方法公开了 2026-09-14
具身ICL来了创业玩家!上下文成Scaling新赛道 2026-09-06
Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线 2026-09-02
OpenAI买几万台Mac搞强化训练!英伟达的活被苹果抢了 2026-08-31
相关阅读
红米K50电竞版评测:王者荣耀深度玩家可以买
人刚毕业,在小米造狗没有KPI,雷军奖励100万美金
预算2500双11想换手机?盘了23款产品后我来告诉你答案
小米智能驾驶方案被曝光:5毫米波雷达+1摄像头,L2级自动驾驶
小伙手术后行动不便,花几百块改了一套智能家居
一块屏幕如何变透明?小米吹爆的透明电视你可能早就见过!
热门文章
全球首个3D原生城市世界模型ABot-Earth 0.7发布,构建AI理解真实世界的入口
AGI时代的第一个生图模型,ChatGPT Images 2.5上线
ECCV上,顶尖学者们开始研究如何让AI做生意了
这个新开源的世界模型只有1.3B,单卡就能实时跑!
Kimi突发K2.8:性能逼近K3,百万上下文全员开放
量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1