笔记本跑7000亿参数GLM!无GPU也行? SSD当显存用火爆GitHub
闻乐 发自 凹非寺 量子位 | 公众号 QbitAI
25GB笔记本硬跑744B GLM-5.2,32GB内存挑战2.8T Kimi K3——
GitHub现在最火热的大模型开源小蜂鸟 Colibrì ,纯C实现、零引擎依赖的分层推理框架,已经狂揽 32k Star 。
正常情况下,744B的总参数规模已经让普通消费级电脑望而却步,但Colibrì的办法可以说是相当简单粗暴:
模型里暂时用不到的部分,直接扔在SSD里;等推理真的需要哪个专家,再现场从硬盘把它捞出来。
于是,GLM-5.2经过int4处理后大约372GB的权重,可以在最低16GB、推荐24GB左右RAM的机器上运行,GPU甚至不是必需品。
它目前已经覆盖9个模型家族, 从GLM-5.2/5.3、DeepSeek V4 Flash、Qwen,一路支持到了975B的Inkling,以及2.8T参数的Kimi K3 。
744B模型,内存里只放9.9GB
以GLM-5.2为例。虽然整个模型足足有744B参数,但MoE并不会在生成每个token时把744B参数全部计算一遍。
它会先通过Router判断:这个token该交给哪些“专家”处理?然后只激活其中一小部分。
GLM-5.2总参数744B,但每个token实际激活的参数大约只有40B,这就留下了一个很大的操作空间:
Attention、Embedding、共享专家这些每次推理都要用到的Dense部分,大约17B参数,int4之后只占约9.9GB,直接常驻RAM。
模型开始生成token之后,Router先选出当前真正需要参与计算的专家;Colibrì再检查它们是否已经在高速内存中,没有命中的部分,才临时从SSD读取。
不把744B参数看作必须始终驻留在内存中的整体,而是将它变成一堆可以根据Router结果,在 SSD、RAM和VRAM之间动态调度的数据 。
SSD也成“显存”了
当然,如果每生成一个token都从SSD里现找专家,那电脑估计得读盘读到怀疑人生,速度恐怕也相当感人。
事实上,在Colibrì最早那台12核CPU+25GB RAM的开发机上,GLM-5.2冷缓存时确实只有大约 0.05~0.1 token/s 。
最近被调用过的专家会优先留在RAM里,如果后面的Token又点中了同一个专家,就不需要重新跑一趟SSD。
而且Colibrì还不满足于等Router点完名再行动,它甚至会提前猜下一层要找谁。
根据项目测试,相邻层之间的专家路由存在相当明显的相关性,提前一层预测专家的可预测性达到 71.6% 。
于是当前这一层还在计算的时候,Colibrì就可以在后台提前读取下一层可能需要的专家。
如果机器里正好有两块SSD,Colibrì支持放置第二份模型副本,把专家读取任务分摊到不同硬盘上,并行利用两块盘的带宽。
开发者把这套思路称为 AI memory multitiering,AI内存多层化 。
一个专家无论已经待在VRAM里,还是临时从SSD里读取,Router的选择都不会因此改变,使用的权重精度也完全相同。
所以到了128GB RAM的纯CPU桌面机,可以缓存更多专家之后,速度能达到约1.8 token/s;
如果一路堆到6张RTX 5090,让全部专家常驻高速存储层,解码速度则可以来到5.8~6.8 token/s。
快速上手
Colibrì已经提供Linux、macOS和Windows的预编译版本,不想折腾编译的话,下载对应版本解压即可;
项目已经提供预转换好的GLM-5.2 int4模型,也可以从FP8原始模型自行转换。模型放好之后,一条coli chat就能直接进入对话。
里面能实时看到Token生成速度、不同阶段耗时,以及当前有多少专家待在VRAM、RAM和磁盘。
Colibrì还专门做了一个“Brain”页面,把GLM-5.2的19456个专家全部可视化出来:
哪个专家刚刚被Router点名、当前住在哪一层存储、调用热度如何,都能直接看到。
不只是GLM-5.2,Colibrì目前支持的模型跨度很大,目前可运行九个模型。
每个模型单独一套C适配文件,但是底层IO、缓存、tokenizer等公共组件复用同一个核心。
接着DeepSeek V4 Flash是284B;GLM-5.2/5.3是744B;GLM-5.3-Flash是321B;
最大的一位是Moonshot的 Kimi K3:2.8T总参数、104B激活参数 。
这模型的权重需要大约1.6TB存储空间,但按照Colibrì给出的配置,RAM从 32GB+ 就能起跑,同样不强制要求GPU。
项目地址: https://github.com/JustVugg/colibri
AI开始研究Physical AI:FSD级团队亮出首版模型Simate-beta,空降RoboDojo 2026-09-26
陆川手搓历史现场,王珞丹熬夜抽卡,阿里全模态开始兜底生产 2026-09-22
直播预告:未来两三年,哪些工业AI场景会率先爆发? 2026-09-22
具身智能技术路线尚未定型,基础设施却先收敛 2026-09-18
热门文章
AI离“理解万物”还有多远?先拿癌细胞和行星轨道试试水
27B模型分分钟交付网页,Qwen 3.8还是太能了
“留给人类阻止AI的时间不多了”
APUS 开源国内首批Jev跨平台复现:国产模型实现秒级决策
6天烧光2000多万,拿下开源第一!小米史无前例「炼丹直播」收官
量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1