华为汪涛:华为要打造AI算力底座,只做好一颗芯片远远不够
乔不迟 发自 凹非寺
量子位 | 公众号 QbitAI
昇腾960DT研发进度比原计划 提前三个季度 ,单芯片算力实现倍增,960DT支持2 PFLOPS FP8、4 PFLOPS FP4,HBM容量最高288GB、带宽9.6TB/s。
对应的昇腾960超节点做到4096张NPU卡,最高8EFLOPS FP8算力、超过1PB HBM容量。
2028年昇腾970、2029年昇腾980,未来几年保持 “一年一代” 的演进节奏。
从今年开始,950、960、970、980连续几代,未来几年我们坚持一年一代,走入了快速演进的节奏。这也是国内半导体制造、封装的上下游配套全部打通之后才实现的。
围绕960,华为把NPO光互联、超节点、CANN生态和韬定律一起摆上台面,给出的答案很明确: AI算力竞争已经越来越像一场系统工程。
单芯片倍增,但华为押注的是整套系统
按照华为披露,960DT比原计划提前三个季度准备就绪,960PR版本也将继续提前。
“芯片从立项到产品化往往要三年,我们任何一次发布,都是产品已经在实验室反复测试、有准确交付时间之后才做。”
从950、960到后续的970、980,华为接下来几年计划保持一年一代快速演进的节奏。
AI大模型的训练和推理规模正在迅速扩大,单颗芯片再强,也很难独自承担万亿、十万亿参数模型的计算需求。
910C是384卡,950做到1024卡,960进一步扩到4096卡,并通过跨物理节点的统一内存编址,让多颗NPU互联起来更接近一台逻辑计算机。
汪涛提到,华为从仿真训练里看到,在同样十万卡集群下,4096卡超节点组成的集群相对传统八卡服务器组成的集群,MFU可提升2.75倍。
MFU可以简单理解为大模型真正吃到多少理论算力,集群越大,通信、同步、故障越容易把峰值性能吃掉。
只做好一颗芯片远远不够,只做一台服务器也不够,最后要交付一个高可用度的复杂系统才有价值。
一个大规模超节点同时涉及芯片、通信、IP网络、光互联、供电、散热、软件和故障管理,单点性能强并不代表系统能长期稳定运行。
谈到华为在这一轮算力竞争中的位置,汪涛的判断很鲜明,“要做好这么大的超节点集群,需要通信技术、IP、光模块、算力、系统,华为干了30年, 每个领域都有长期大规模研发投资 。把这些能力全部聚在一个团队里,似乎 只有华为 。”
这也是昇腾960超节点值得关注的地方:当先进制程短期内仍然构成约束,华为选择继续提升单芯片,同时把竞争战线扩大到整个系统。
NPO落地,华为把30年光技术融入超节点
NPO把负责光电转换的“光引擎”往芯片附近推进,相当于“让电少跑一点,让光早点接手”,从而降低高速互联的传输损耗和功耗。
这也是为什么4096卡超节点开始需要NPO——卡越多,芯片之间的数据交换越频繁,互联能力就越容易从配角变成 决定整个系统效率的关键 。
第一个规模商用的,大家还在实验室阶段;第二个最大的带宽,36路200G集成;第三个唯一内置光源的。
CPO把光引擎和主芯片封在一起,理论上还能进一步缩短距离,但今天 可靠性、良率、成本和维护 都还没到华为认为适合大规模商用的状态。
汪涛解释得很具体:“CPO把光引擎和主芯片放一起,光引擎坏了整个主芯片就报废,可用度差,故障成本极高,对封装厂要求也高。现在NPO的TCO至少比CPO低40%以上。 当前NPO是工程、成本各方面综合最佳选择。 ”
他对CPO的态度很开放,“未来CPO如果解决了可靠性、良率问题,华为也可能转向CPO,以进一步降低高速信号传输损耗。”
昇腾960超节点用约5500个Hi-ONE,替代原本约4.8万个800G光模块,功耗降低超过550kW, 系统无故障运行时间提升一倍,系统可用度为99.8%。
器件数量大幅减少,本身就意味着更少的故障点、更低的布线复杂度和更可控的系统功耗。
华为需要的不只是把更多芯片连起来,还要确保系统规模变大以后,不被光模块、供电、散热和故障率反过来影响效率。
CANN跨过拐点,华为补上软件生态
CANN进入常态化开源社区运营,月活开发者超过5200人,外部开发者占比达到61%;
昇腾也进入PyTorch官方支持路线,开发者可以直接在PyTorch社区获得相关支持。
汪涛对此的表述反而很克制:“经过八年努力,我们今天只敢说 CANN生态跨过了拐点。 ”
华为下一步想把适配动作进一步前置,在模型进入预训练阶段时就和模型厂商协同,把昇腾适配、性能优化等工作尽可能提前完成,不是等一个模型发布后再迁移到昇腾。
很高兴看到中国涌现出一批十分优秀的大模型企业,既有头部互联网,也有大模型初创企业,他们的优异产品和强大的创新能力显著提升了中国人工智能的全球影响力。华为的使命是为这些优秀企业构建坚实的算力底座,做好他们坚强的后盾和伙伴。
汪涛表示,未来我们会看到越来越多模型基于昇腾原生训练,这样模型开源发布走向千行万业之后,就基本不需要再做适配和优化。
华为希望把更多资源放在 芯片、互联、系统和软件底座 上,为模型厂商和互联网公司 提供算力支撑 。
“盘古会继续服务华为自身产品智能化,但华为并不打算在每一层都和伙伴竞争。灵衢协议已经开放,CANN代码也持续开源,华为想把更多研发资源放在芯片、超节点和算力底座。”
汪涛随后进一步表示,所有做大模型和训练的企业,无论头部互联网公司还是创新企业,都代表着中国科技的未来,华为希望做他们的“底座、后盾”。 “我们把他们托得越高,中国AI竞争力越强。”
对应到产品形态,就是用4096卡超节点作为更大的计算单元,再由多个超节点组成十万卡、数十万卡集群。
华为披露,多超节点通过灵衢网络或RoCE继续扩展,二层Clos组网最大可到51.2万卡,结合多轨道拓扑,技术上限可支持百万卡。
汪涛说:“我们不仅提供产品,还派很多技术专家团队,支持客户做昇腾原生的预训练,遇到技术问题一起解决。”
汪涛在思量华为未来的路线,“到2030年甚至未来,我们必须做一个准备:中国最先进的制造工艺还没有取得完全突破,华为必须有一个创新路线,同时满足中国AI训练、推理、行业应用的需求。”
这也解释了华为为什么一边继续提升单芯片性能,一边把大量资源投入到超节点、光互联和系统工程。
它需要在现有工艺条件下,把性能提升的空间 继续往芯片之外延伸 ,通过封装、互联、光通信、系统架构和软件协同等多层优化, 尽可能放大整体算力效率 ,缩小与国际领先AI芯片和计算系统之间的差距。
在圆桌收尾时,汪涛补充道:“华为是一家产品公司,要做最好的产品给客户。任总常讲,每个人都要磨好自己的豆腐,各司其职, 我们的豆腐就是把算力底座做好。 ”
从昇腾960、Hi-ONE,到4096卡超节点、CANN和韬定律,这次全联接大会真正展开的并不是一颗芯片的参数升级,而是 一条更完整的AI基础设施路线:
单芯片继续迭代,光和互联把系统做大,软件让模型原生跑起来,再用持续的产品化把算力稳定交付出去。
华为想守住的,也正是这个位置—— 把中国AI需要的算力底座做厚 ,为国内模型公司的训练、推理和持续迭代提供充足、稳定的算力支撑。
千万奖池找“鲸锐”!单项奖金200万,只等一个最会用AI讲故事的你 2026-09-19
AI离“理解万物”还有多远?先拿癌细胞和行星轨道试试水 2026-09-19
AGI新战场谷歌亚马逊巨头激战,杀出个中国LimiX-2赢了又赢 2026-09-18
从“会回答”到“会办事”,vivo如何解AI手机这道题? 2026-09-17
相关阅读
十年前你在用什么手机?2010-2019十年手机变革回顾,那些与手机一同走过的青春
传麒麟820采用6nm工艺,制程再度领先对手半年
68万奖金角逐,2024华为软件精英挑战赛全球总决赛获奖名单公布!
来上海,预见城市未来
华为苏箐撕掉特斯拉的“皇帝新衣”,竟因此丢了工作
不是赛力斯需要华为,而是华为需要赛力斯
热门文章
首届蚂蚁灵波具身大模型挑战赛正式启动
AI开始改进“改进自己的方法”,RSI进入平方时代丨MetaRSI
端侧AI从「能跑」到「会进化」,元空智能跑进惠普预装
中国物理AI大突破:PhysBrain 1.5登顶全球开源榜一,空间智能与GPT-6 Astra并驾齐驱
智谱提前剧透下一代GLM:完全自训练方法公开了
量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1