AI 日报hiw3c.com

DeepSeek 开源算子工具大礼包,联手华为昇腾,手撕 CUDA 绑定!

雷峰网·AI 科技评论 www.leiphone.com 网页快照

DeepSeek 开源算子工具大礼包,联手华为昇腾,手撕 CUDA 绑定!

写算子的 “手工作坊” 时代,该结束了

站在 TVM 肩膀上,

性能跑进全球第一梯队

TileLang 架构深度拆解:

为什么一套代码能跑遍所有芯片

目标后端 : 只负责定义这款硬件的指令语法、优化规则,是硬件专属部分;

执行后 端 : 只负责通用的编译、加载、启动流程,和具体硬件无关。

存储控制(数据放哪):芯片内部有三层存储。全局内存容量最大,但速度最慢;共享内存速度中等;寄存器容量最小,访问速度最快。TileLang 允许开发者在 Python 中直接用代码决定数据放在哪一层存储里,避免计算单元因为等待数据而闲置。

线程调度(任务怎么分):TileLang 通过一句代码,就能把庞大的矩阵计算像 “划分网格” 一样,精准分配给芯片里成千上万个计算核心。例如把一个巨大的计算切分成 100 份任务,在芯片上拉起 100 组计算单元(线程块),每组里面跑 128 条并发工序(线程),多路并行同时开工。

并行节奏(传输和计算怎么并发):TileLang 用一句 T.Pipelined(num_stages=3) 直接开启三级软件流水线,让数据搬运和算力计算异步并行,一边搬数据一边算数据,绝不让芯片闲着。

押注华为昇腾,

DeepSeek 最大的赌注

对比 Codex,免费的 AgnesCode 也能在底层算子优化任 ...

对比 Codex,免费的 AgnesCode 也能在底层算子优化任 ...

像素级对标?智谱、Kimi 底层参数「撞衫」背后,藏着 ...

GPT-6 Sol 降价 50% 的秘密:消失的 Terra,一场模型梯队平移

GPT-6 砍掉思考 Token,俄罗斯人砍掉通信 Token,Token 经济开始崩了?

深度解读 DeepSeek V4.1 Flash 全新架构,如何成为显存杀手

Muse爆火,dots入场:Personal Agent开始和互联网平台抢入口

实测 Qwen-3.8 与 GLM-5.3 的 Flash 版:谁能让我提前下班半小时?

从 Codex Harness 开源,看 AI 公司的护城河是什么?

全网最硬核 OpenClaw 2.0 实测:从 ToC 到 ToB 的试探,Agent 网关能重塑工作流边界吗?

对比 Codex,免费的 AgnesCode 也能在底层算子优化任务中打得有来有回