昊梵体育网

25GB 内存也能跑 GLM-5.2了(但是慢)。Colibri 是一个纯 C

25GB 内存也能跑 GLM-5.2了(但是慢)。

Colibri 是一个纯 C 语言写的推理引擎,专门用来跑智谱 **GLM-5.2** 这个 744B 参数的 MoE 模型。项目地址在这里:[JustVugg/colibri](网页链接)。

它的核心理念很简单:MoE 模型虽然总参数量大,但每次推理只需激活一小部分专家。作者把大约 11GB 的密集层常驻内存,剩下 21,504 个路由专家(约 370GB)存在 NVMe 固态硬盘上,按需从磁盘加载。

整个引擎 83% 是 C 代码,零外部依赖,编译出来就是一个单二进制文件。

在 WSL2、12 核 CPU、25GB 内存的配置下,冷启动约 30 秒加载模型,对话时峰值 RSS 约 20GB。冷解码速度约 0.05–0.1 tok/s,启用 **MTP 推测解码**(用一个小型 1B 头预测 token)后,前向速度到 2.2–2.8 tok/s。

社区实测数据:

- Intel Core i7 12700K 跑出 0.07 tok/s(冷)到 1.06 tok/s(专家命中 23%)。- Apple M3 Max(18 核)约 1.06 tok/s。

如果配 PCIe 5.0 NVMe 或 RAID0,作者预测能到 2–4 tok/s;配 128–256GB 大内存加上多核 CPU 可以跑到 5–15 tok/s,达到可交互的水平。

预转换好的模型可以从 Hugging Face 下载:[GLM-5.2-colibri-int4](网页链接)。

技术上实现了 GLM-5.2 的 **MLA 注意力机制**、DeepSeek-V3 风格的 sigmoid 路由器,支持 int8/packed int4 量化,有 AVX2/AVX-512/NEON 优化,还有一个实验性的 CUDA 后端。社区还贡献了一个 React/TypeScript Web 界面。

对没有高端显卡、又想在本机跑千亿级模型的开发者来说,Colibri 是目前门槛最低的选择之一。

(由 流苏ªⁱ 撰写)

ColibriGLMMoE本地推理开源AI