AI 日报hiw3c.com

开源Top2!实测阶跃Step 5 Preview,真有点猛啊…

量子位 www.qbitai.com 网页快照

开源Top2!实测阶跃Step 5 Preview,真有点猛啊…

Jay 发自 凹非寺 量子位 | 公众号 QbitAI

昨天, 阶跃星辰 毫无预兆地端出了最新一代旗舰基座模型——Step 5 Preview。

Agent能力大幅提升,在Artificial Analysis的最新评测中,Step 5 Preview取得44分,直接冲到全球开源Top 2。

AA榜单中, Step 5 Preview位于Intelligence Index与单任务成本权衡的「帕累托前沿」 。

榜单上你追我赶,今天刷掉一个,明天又冒出来一个。真到要用的时候,模型到底行不行,完全是另外一码事。

所以API一接上,我直接给Step 5 Preview上强度,让它操作Blender,给我建一个后室出来。

第二个任务,我让它照着1999年的《LEGO Racers》,直接搓一个乐高赛车游戏。

也可能主要还是因为我车技菜,经常一脚油门直接创路障上,有时候甚至连人机都跑不过。

先做了个霓虹跑酷小游戏。有意思的是,我专门用了和阶跃上一代官网Demo类似的Prompt。

道路两旁加了高楼,视觉层次更完整,Game Over之后整个边框还会跟着变红,很多Prompt里没写的小细节,它自己补上了。

第一轮经常有些小细节不到位,离Astra那种「我咧个,这是AI做的?」的瘫软程度,肯定还有差距。

明明前面两代还都是Flash,怎么到Step 5 Preview,Agent能力突然猛了这么多?

所以,Step 5 Preview当然也在Scaling,但它没有把「越大越好」当成唯一目标。

92层的Transformer ,在控制激活规模的同时,让信息经过更多层连续变换。

复杂任务里,经常会有大量multi-hop依赖,前面搜到的信息,要经过很多步之后才能真正派上用场。

几十轮工具调用之后,上下文能轻松滚到上百万Token。如果每一层都把前面所有内容重新扫一遍,计算量很快就会爆炸。

Sparse MoE、Hybrid Sparse、Sparse GQA……本质上都是在解决上下文的问题。

所以Step 5 Preview在硬件上也下了不少功夫,通过底层算子和数据访问优化,让理论上的Sparse尽量真正变成实际吞吐。

有了这套软硬件基座,后面要做的事就比较清晰了,围绕Agent训一遍模型,让它能连续干活。

最终,通过Long-horizon RL、Context Compaction等方法, 团队让Step 5 Preview在几十轮工具调用之后,还能记得自己到底要干嘛 。

踩在「性能×成本」的甜蜜点上 ,把有限的计算预算尽量花在真正影响Agent能力的地方。

从Step 3.5 Flash,到Step 3.7 Flash,再到今天的Step 5 Preview,路线其实没怎么变——

新的模型、新的技术路线不断把能力边界往前推,曾经足以建立巨大壁垒的领先优势,很多时候几个月就会被追平。

截至2026年3月,Anthropic、xAI、Google和OpenAI四家公司最顶尖的模型, 在Arena上的差距已经压缩到了25个Elo以内 。

一方面,Frontier的门槛越来越高;另一方面,Frontier内部又越来越拥挤。

单纯追逐某一个Benchmark、某一次榜单第一,已经很难定义一家模型公司的长期位置。

Astra同样如此,Coding其实没提升多少,但把Computer use的心智站住了。

说实话,这才是AI行业最有意思的地方,要是真靠Scaling解决一切,跟制造业有啥区别啊。

更强的推理、更长的Context、更低的延迟、更少的激活、更强的多模态、更好的Agent能力……

刚刚,Claude Code大重构!内部3万Agent管理技术免费开放 2026-09-18

梁文锋CFO到位!投过智谱MiniMax 2026-09-15

奥特曼被骗!A社一脚油门冲刺IPO,募资叫板SpaceX 2026-09-14

银行Agent上岗:4200万小微经营者可用,信贷、票据、财税一把梭 2026-09-12

热门文章

首届蚂蚁灵波具身大模型挑战赛正式启动

端侧AI从「能跑」到「会进化」,元空智能跑进惠普预装

从“会回答”到“会办事”,vivo如何解AI手机这道题?

刚刚,唐杰发布智谱RSI首个成果

协同办公进入Agent时代,飞书+豆包工作跑在了最前面

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1