AI 日报hiw3c.com

从「算得快」到「干得了活」:AI推理时代,CPU如何重塑算力版图

雷峰网·AI 科技评论 www.leiphone.com 网页快照

从「算得快」到「干得了活」:AI推理时代,CPU如何重塑算力版图

“善弈者谋势,不善弈者谋子。”这句古老的智慧,正精准地映射出当下AI产业的演进轨迹。

当行业狂热于大模型训练阶段的算力军备竞赛时,一场更为深刻的重心迁移正在悄然发生,AI已经从回答问题走向解决问题,从单纯的模型训练走向复杂的智能体推理。这种转变对底层算力架构的冲击,远比表面看起来要深远得多。

如果说训练阶段是GPU闷头计算的大兵团作战,那么推理时代则是一场需要精密调度的现代化战争。

在这场变革中,英特尔在9月22的Connection大会上给出了一个明确的判断:推理时代,CPU正从“配角”蜕变为整个系统的“控制中枢”。当AI真正开始干活,算力的定义正在被重写。

想要理解CPU的“逆袭”,核心是厘清智能体执行与传统模型训练的本质差异。模型训练是标准化、可并行的批量任务,核心目标是极致提升整体吞吐量;而智能体是典型的串行状态机,每一步任务执行都依赖上一步的输出结果,任意环节的微小延迟,都会沿着任务链路层层放大,最终影响整体智能体验。这也意味着,传统CPU一味追求平均吞吐的优化思路已然过时,稳定、可控、超低的端到端延迟,成为智能体规模化落地的核心硬性约束。

不仅如此,智能体场景的硬件负载矛盾愈发突出。高并发工具调用与高带宽AI推理任务需要在单芯片内混跑,二者对内存资源的需求相互冲突,叠加多租户场景下的安全隔离、资源独占需求,传统CPU架构的短板彻底暴露,架构革新与系统重构势在必行。

对于这一难题,英特尔并没有选择惯用的单点堆砌参数,而是 从系统层面重新划分数据中心的架构。

大会现场,英特尔数据中心集团副总裁、中国区总经理陈葆立表示,“未来的数据中心将被拆分为三类集群:负责智能体执行和任务编排的CPU集群、负责模型推理计算的GPU集群,以及承载长对话、文档等持续新增业务数据的存储集群。这三类集群之间的数据调度,全部由CPU完成。”

落到产品上,采用Intel 18A制程、最高拥有288个能效核的至强6+处理器配合智能体套件,单颗即可部署近千个智能体。

在SWE-bench测试中,其单智能体性能领先竞品15%;在云端沙箱场景下,面对10分钟内批量启动上万沙箱、单沙箱延迟200ms以内的严苛要求,至强6+支持350个沙箱并发,性能约为竞品的1.46倍。结论显而易见:在智能体场景下,性能和响应速度缺一不可。

而另一方面,CPU在三个具体环节上的价值也十分突出。首先是异构数据预处理,智能体需要抓取网页、视频、PDF等素材并做文本提取,这类任务GPU并不擅长,而至强AMX加速器让向量化和重排序分别达到基准的2倍和4倍。

其次是存储调度,从HBM到DRAM再到本地SSD,成本和延迟呈反向变化,CPU作为核心调度者,联合焱融科技基于至强6和MRDIMM的方案,在MLPerf Storage v3.0中拿下了Llama3检查点读写和3D-Unet训练两项全球第一,有效消除了存储瓶颈。

最后是KV Cache管理,面对百万Token上下文约300GB的容量,英特尔的KV Cache智能加速套件通过QAT实现无损压缩,将300GB原始数据压至200GB,并借助DSA引擎将数据搬运最高加速9.66倍。

把这一系列环节串联起来,便能得出清晰结论:步入智能体时代,GPU 承载 “智” 的核心推理运算,而 CPU 既要承担基础计算,更要扛起全局 “管” 的重任。随着业务规模扩张,这套调度管控工作的复杂度呈指数级攀升,而这恰恰是英特尔长期积淀形成的独有优势。

“我们希望当大家提到物理AI时,第一个想到的厂商是英特尔。” 雷峰网 (公众号:雷峰网) 雷峰网

英特尔副总裁兼端侧计算和物理AI事业部中国区总经理高嵩在Connection大会上这样表态。

物理AI与数字AI的核心差异在于,机器人必须与真实物理环境交互。行业里一个现实的痛点是:让机器人跳舞容易,做精密操作难。

这一现象的难点在于控制,对于机器人而言,动态环境下的实时感知与精准执行,目前仍是巨大的瓶颈。

第三代酷睿Ultra的应对方案是“大小脑融合”。依托XPU异构架构,推理决策与实时运动执行被整合在单颗SoC上。其中,CPU作为“小脑”,以4kHz的控制频率每秒完成4000次动作调整,保障关节电机精准响应;GPU承载高阶AI推理,在Pi0.5精度下推理时延仅为78毫秒,低于人类视觉200-250毫秒的平均反应时间;NPU则面向视觉感知,YOLOv12n推理仅需3.55毫秒,每秒处理约280帧,远超普通摄像头60帧的输出上限。

传统方案需要多个独立单元分工处理感知、决策和控制,不仅响应慢,还容易出现协同偏差。单芯片整合后,工程师得以将精力从底层调优转移到上层智能开发。

在成本方面,具身智能的Token消耗随用户量线性增长。某具身企业创始人透露,工程师一下午的训练就能烧掉数百美元。

对于这一难点, 英特尔的思路是通过硬件负载整合降低底层开销,将推理决策和运动控制统一到单颗SoC的异构架构上,从硬件层面压缩算力冗余和能耗,把整体拥有成本拉到可商业化的区间。

而在算法路线上,具身领域目前没有统一范式,世界模型、VLA等路线仍在并行演进。芯片架构设计周期长达两到三年,押错路线的代价极其高昂。

面对这个问题,不同于很多厂商一味强调"靠近客户需求",英特尔提供了一个更辩证的思路——不仅要倾听客户的声音,更要有自身的战略判断。"我们也希望用我们自己内部的前瞻视角、结合自身的架构优化,与最广泛的生态进行合作,找准技术落地的正确方向,这是认知智能体发展在当下需要完成的事情。"高嵩表示。

英特尔的差异化策略在于: 不盲目追随单一算法路线,而是以开放的架构和生态,支撑多种算法范式的并行验证与快速迭代。

目前,英特尔已联合科通工业、神州数码等合作伙伴推出基于第三代酷睿Ultra平台的具身智能开发套件,并携手多家伙伴面向制造、建筑、医疗、智慧城市、仓储物流、酒店等多种场景推进项目从原型走向量产,以生态的广度对冲算法路线的不确定性。

此次,英特尔也正式宣布,英特尔具身套件将于11月份在京东上线,也意味着,开发者离触手可及的机器人又近了一步。

正如开篇所言,在AI从算得快走向干得了活的今天,系统设计的重心正在向执行面迁移。

英特尔在数字AI侧的判断是:推理和智能体部署放大了CPU侧的系统工作,而x86在控制面、生态适配和基础设施软件上的存量优势,正好能接住这个需求;在物理AI侧,则用异构SoC缩短机器人的感知-决策-控制闭环,靠生态广度对冲算法路线的不确定性。

不一定完全会用到所有的算力,但提供一个最优的系统级选择,也许便是生产力提高的关键。

百度搭子与英特尔推进端云协同,本地Skill专区正式上 ...

把18A塞进主流轻薄本,英特尔「WildCat Lake」想让人 ...

MWA™霸榜全球第一后:无界动力用真实咖啡厅展现物理AI的落地之径

从「算得快」到「干得了活」:AI推理时代,CPU如何重塑算力版图

CPU加速AI普及,GPU首次加AI,Arm为何把NPU留给伙伴?

RISC-V冲入服务器CPU核心赛场,玄铁C950定义高性能标杆

独家|前Habana中国区负责人于明扬接任沐曦BD团队负责人