开源推理框架Colibrì在GitHub斩获超3万Star。该框架利用MoE稀疏激活特性与多层内存调度机制,直接将SSD作为模型后备存储,仅凭普通CPU和24GB内存即可运行744B参数模型,大幅降低超大模型本地运行门槛。
用普通笔记本电脑运行数千亿参数大模型,甚至无需配备独立显卡。GitHub上近期热度飙升的开源分层推理框架 Colibrì,凭借纯 C 实现、零第三方引擎依赖的特性,已斩获超过 32k Star。
该项目的核心思路非常直接:既然消费级设备的内存塞不下数百GB甚至TB级的模型权重,那就不要把它们全部载入内存。

以 744B 参数的 GLM-5.2 为例,经过 int4 量化后权重约为 372GB。在常规认知中,这类超大模型只能依赖数据中心级集群运行。但通过 Colibrì,开发者仅凭 12 核 CPU 和 25GB RAM 的普通机器便跑通了全流程。
如今,Colibrì 的适配范围已拓展至 9 个模型家族,从 DeepSeek V4 Flash、Qwen,一直覆盖到 975B 参数的 Inkling,乃至 2.8T 参数的 Kimi K3。运行 Kimi K3 虽需约 1.6TB 硬盘空间,但内存门槛同样只要 32GB 起步,彻底摆脱了对昂贵显存的强依赖。

Colibrì 之所以能跑通,关键在于现代大语言模型广泛采用的 MoE(混合专家)架构。
在生成每个 Token 时,MoE 模型并不会调用全部参数,而是通过 Router 路由网络按需激活少数“专家”。例如 GLM-5.2 虽有 744B 总参数,但单 Token 激活的专家参数仅约 40B。绝大多数未被激活的专家,完全没有必要长期霸占宝贵的高速内存。

基于此,Colibrì 将模型权重切分为两层结构:
这相当于为模型参数构建了一套即时编译(JIT)式的按需加载系统。
若每个 Token 都频繁读取磁盘,推理速度必然极低。为解决 I/O 瓶颈,Colibrì 设计了一套 AI 内存多层化(Memory Multitiering) 调度策略:

这一架构下,存储分工明确:NVMe 负责大容量保底,RAM 缓存常客专家,VRAM(若有)则接纳最高频权重。专家所处存储介质只影响生成速度,不改变数学逻辑与计算精度。
在性能表现上,低配机器冷启动时约为 0.1 Token/s;升级至 128GB RAM 纯 CPU 桌面机后可提升至 1.8 Token/s;若配合 RTX 5090 等专业显卡完全常驻显存,解码速度可达 5.8~6.8 Token/s。


Colibrì 提供了跨平台的预编译二进制文件,支持 Linux、macOS 与 Windows。系统内置了完整的 Web Dashboard,可直观呈现 Token 生成速率、分阶段延迟以及权重在 VRAM、RAM 和磁盘之间的分布情况。

此外,其“Brain”可视化界面还能实时监控数万个专家的激活状态与调用热度。

Colibrì 证明了通过精细化的分层调度,超大参数大模型的本地化推理并不一定依赖昂贵的 GPU 集群,这为消费级硬件探索前沿 AI 提供了全新思路。
免费获取企业 AI 成熟度诊断报告,发现转型机会








关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断