AI算力之争不靠堆卡!浪潮信息捅破智算「能力天花板」,还瓦解了「产能焦虑」
但算力「够不够用」这个问题,已经不再能单靠堆卡来解决,它开始分化出越来越多的层面。
前沿模型的参数规模、上下文长度、推理深度在同时变大,Agent可能连续运行几个小时甚至几天。
另一个问题是 智能规模 ,这个问题更直击灵魂——你的算力能以多低的成本生产多少智能?
Token需求在爆发,但推理负载是多元的,Prefill和Decode的计算特征不同,堆同一种算力已经覆盖不了这些差异。
智能上限和智能规模,两个问题各自独立,又相互关联,只解决其中一个,无法突破全部的算力瓶颈。
刚刚的AICC(人工智能计算大会)2026上,IDC发布了 《2026年中国人工智能计算力发展评估报告》 ,把这两个方向拆开讲了一遍。
「一分为二」的算力缺口
过去,人们使用大模型时,算力调用更像是「脉冲式」的,用户问一个问题,系统返回一个答案,只调用一次算力。
但在Agent接管任务之后,情况变了。一个人类意图可能触发几十次、几百次连续推理;多个Agent组成协作网络之后,系统连续运转的时长,还能进一步增加到几个小时甚至好几天。
原本一次次短暂发生的算力请求,开始变成持续不断的计算负载,并 进一步给基础设施带来新的压力 。
第一个是任务执行次数,IDC报告显示,到2030年,全球每年的AI推理任务将增长4000万亿次;
第二个是单任务Token消耗量,过去一次简单问答只消耗几十个Token,现在一次多轮任务决策要消耗几十万个;
第三个是多智能体协同的「放大系数」,一个用户操作会被拆解成多条Agent指令,Agent之间传递上下文、汇总结果又拉长了整条任务链路,进一步放大了前两项的增长。
IDC数据显示,从今年到2030年,全球Token消耗量的复合增长率将达到4822.6%,Agent吃掉的Token正在急剧膨胀。
IDC报告显示,全球AI算力需求满足率从2024年的79%一路下滑,2027年预计跌至71%,即便此后上游半导体供应链压力有所缓解,到2030年也只能恢复到77%左右。
百分比的波动看起来不大,但需求基数在急速膨胀,到2030年,算力缺口的绝对值将达到3809亿美元,扩大到2024年的将近十倍。
过去,弥补这种缺口的方式主要是靠「大力出奇迹」,也就是通过集群规模的扩展,堆叠更多的算力。
Prefill阶段是高并行、高计算密度的任务,Decode阶段要逐Token串行处理、更吃内存带宽,Attention需要频繁访问不断增长的KV Cache,MoE包含稀疏计算和大规模路由调度,多模态模型还有独立的Encoder模块……
Agent任务中,首轮对话的上下文可能只有一两万个Token,经过上百轮对话后会扩展到三四十万个,系统瓶颈在计算、显存、带宽和通信之间不断转移。
所以, 单纯堆料非但带不来线性的容量增长,反而会造成资源配比失衡 ,让一部分算力长期闲置,另一部分却持续过载。
前沿模型的参数规模、上下文长度、推理深度在同时变大;一台机器装不装得下、跑不跑得快、长时间能不能跑稳,三个问题同时压了过来。
Token需求在爆发,但负载类型各异,不同推理阶段需要不同特征的算力,靠一种算力一招鲜吃遍天的路数,已经走不通了。
浪潮信息首席AI战略官刘军,把这两个方向概括为 Capability 和 Capacity 。
Capability AI Compute是 能力型智算 ,支撑前沿模型去碰那些过去碰不了的问题。
如今,AI已经能从靶点出发发现新的药物分子、完成筛选和设计并推进到临床试验,能求解困扰学术界几十年的NS方程和孪生素数猜想,能自主设计AI芯片并不断迭代性能……
这些任务的共同特征是推理链条长、模型规模大、对算力系统的承载能力和稳定性要求极高。
Capacity AI Compute是 容量型智算 ,让智能的供给更充足也更便宜,让更多人和企业用得起。
算力也是同一个道理,光有能力上限的突破不够,让足够多的人用得到,才能真正落到实处。
捅破「能力天花板」,瓦解「产能焦虑」
面对这两层问题,浪潮信息在AICC2026上发布了两款产品——超节点AI服务器 「元脑SD200 Ultra」 和多元算力机组 「元脑HC2000」 。
突破单节点智能上限
「装得下」是从0到1的一步,模型需要先能运行,才有讨论性能的空间,SD200 Ultra通过 「紧致扩展」 解决这个问题。
它延续了去年SD200采用的3D Hyper Mesh架构,整机内的 芯片数量从64颗增加到了128颗 ,显存和扩展存储也相应提升到了8TB和64TB。
目前全球最大的开源模型Kimi K3有2.8万亿个参数,SD200 Ultra可以单机装下并高效运行。
不仅如此,SD200 Ultra 支持在单机上部署10万亿参数的模型 ,提前为未来更先进的开源模型做好了基础设施准备。
128颗芯片要协同工作,跨芯片的数据交换每秒高达数十万次,传统方式依赖软件调用和缓冲区中转来搬运数据,延迟开销很大。
第一层是 「统一寻址」 ,通过全局统一编址、虚拟影子设备注册和跨域地址翻译,让128颗芯片的显存形成一个统一的地址空间,远端资源的访问从消息通信加数据搬移变成了地址空间内的直接访问。
第二层是 「对称直连」 ,在统一寻址的基础上,通过对称内存技术实现GPU显存直连,GPU可以像访问本地显存一样直接读写远端GPU的显存,由GPU发起通信,跳过地址转换和封包中转,通信路径大幅缩短。
最终,SD200 Ultra的All to All通信时延缩短到0.69微秒,达到国际主流超节点产品相当的水平。
以Kimi K3为例,其单步推理涉及数千个算子调用,运行时大量时间消耗在算子启动、数据搬运和同步等待上,真正用于计算的时间反而有限。
SD200 Ultra构建了 「超级算子」 技术,把推理过程中Attention、FFN、MoE等众多基础算子融合成计算与通信一体的大算子,算子数量降低到了十分之一,减少了内核启动次数和显存访问开销,隐藏了通信延迟。
通过超级算子优化,SD200 Ultra运行Kimi K3的推理性能提升了3倍以上,Token生成时延低至5.85毫秒。
有意思的是,超级算子的优化过程使用了K3来分析和重构推理流程,由模型自己改进自己的执行效率。
Agent的复杂任务可能连续运行几小时甚至几天,期间经历大量模型调用、工具调用和数据读写,任何一次计算或通信故障都有可能中断整条任务链路,导致之前所有的推理和执行功亏一篑。
SD200 Ultra采用铜互联方案,减少了光电转换环节,降低了长时间运行中因电路故障导致任务中断的风险。
让算力产生更多智能
它采用全液冷设计加上高通流供电,突破了传统风冷机柜的散热和供电瓶颈,单柜供电能力超过300千瓦,最多承载256张AI加速卡,算力密度达到传统风冷机柜的4倍。
其通信架构也升级到Directcom 2.0,计算与通信带宽1比1均衡配比,柜内聚合带宽达200Tbps,能够跨柜多平面无损扩展,All to All通信性能提升50%以上。
在这个硬件底座上,HC2000实现了 多元算力承载 ,让不同类型的芯片按推理阶段分工协作:
Prefill阶段选择大算力芯片配合成本更优的显存颗粒,匹配高并行、高计算密度的特征。
FFN计算环节选择3D RAM堆叠芯片,缩短数据搬运路径,缓存带宽可以达到数十TB每秒。
整机柜支持成熟的工业标准架构模组,适配多种算力芯片,不同芯片各自承担最适合的负载。
其中,负责把这些不同类型的算力协同起来的是 「MCIS多元算力协同推理软件栈」 。
在PD算力动态调整方面,MCIS构建了测量、分配、监控、调整的完整流程,在模型部署前通过性能仿真评估不同芯片组合和PD配比,找到适合的配置方案。
上线后,MCIS会对计算、缓存、传输各环节的实际表现进行全链路监控,识别瓶颈并与预测做对比。
在多元算力KV Cache管理方面,MCIS打通了不同类型算力之间的点对点数据直传,避免CPU中转和重复拷贝,数据传输性能提升近5倍。
MCIS还会根据KV Cache数据的冷热程度构建分级存储,结合多级流水并行聚合,使节点内磁盘I/O性能提升32倍,突破了KV Cache在大规模多元算力环境下的存储和传输瓶颈。
最终在典型的Agent任务场景中,HC2000搭配MCIS在同等投资下实现了10倍的Token产能提升。
从「提供算力」到「生产智能」
Capability和Capacity,是解决AI算力瓶颈的两个方向,但它们并不是两条分道扬镳的路线。
它们互为因果,Capability突破出来的新能力,经过算法优化和工程迭代,会以更低的成本向下渗透,变成Capacity需要规模化供给的东西;
而Capacity把智能送到更多人手中之后,产生新的应用和新的需求,这些需求又会反过来推动下一轮Capability,从而去挑战更高的天花板。
去年,全球规模最大的开源模型是DeepSeek-R1,参数量6710亿;今年这把交椅的主人变成了Kimi K3,参数量达到了2.8万亿。
但各个模型厂商,已经在用更小的参数量和更低的推理成本,把前沿模型验证过的能力向下传递。
顶部的突破不断制造新的能力,底部的工程不断把这些能力变便宜,中间的应用层则不断长出新的需求,把螺旋继续往上推。
同一家公司,面对需要探索和突破的任务,会调用前沿模型去寻找未知的答案;面对已经验证过的日常流程,则切换到更轻量的模型批量执行。
Capability负责思考和规划,Capacity负责执行和重复, 两种算力在同一个业务里并行运转 。
世界上第一台通用电子计算机ENIAC非常重要,但真正改变几十亿人工作和生活的是个人电脑和智能手机。 最先进的发电技术非常重要,但真正改变工业社会的是稳定廉价的电力进入千家万户。 AI正在经历同样的过程,前沿智能的首次突破决定了AI能做到什么,而智能的普及程度才决定它能改变什么。
知识、推理、判断、创造,这些能力过去高度依赖于人类个体,但一个科学家穷其一生能深入研究的问题是有限的,高水平的智能天生就是稀缺资源。
用刘军的话说,「生产智能」的今天,用户买算力设施,就应该像买电冰箱一样,插上电就能产Token。
手机替我跑了一整套流程!我就说了一句话,AI执行了100步 2026-09-15
AGI最难一战,竟在医院!中国AI登上Science,医生不怕失业还催着上线 2026-09-18
OpenAI年内不上市了!奥特曼支持对手Dario呼吁:AI该踩刹车了 2026-09-13
一周连发6个模型!这家公司把具身智能的闭环跑通了 2026-09-10
相关阅读
浪潮信息英伟达霸榜!MLPerf™最新榜单发布,浪潮信息包揽2021年度近半数冠军
浪潮信息直播发布业界企业级OpenClaw方案“企千虾”
零代码基础也能复刻!大模型化身AI售前助手,百页万字标书秒解读
让64张卡像一张卡!浪潮信息发布新一代AI超节点,支持四大国产开源模型同时运行
快速低成本构建应用,浪潮信息把企业大模型落地门槛打下来了
8.9ms,推理速度新纪录!1块钱百万token,浪潮信息AI服务器加速智能体产业化
热门文章
从“会回答”到“会办事”,vivo如何解AI手机这道题?
刚刚,唐杰发布智谱RSI首个成果
协同办公进入Agent时代,飞书+豆包工作跑在了最前面
刚刚,Claude Code大重构!内部3万Agent管理技术免费开放
央企做了个通用Agent,直接杀进IDC实测前三!
量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1