前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
技术/09.26 · 17:01/4 MIN/编译自 田, 晏林/0 阅读

无GPU跑7000亿参数大模型:开源框架Colibrì走红

开源推理框架Colibrì在GitHub斩获超3万Star。该框架利用MoE稀疏激活特性与多层内存调度机制,直接将SSD作为模型后备存储,仅凭普通CPU和24GB内存即可运行744B参数模型,大幅降低超大模型本地运行门槛。

用普通笔记本电脑运行数千亿参数大模型,甚至无需配备独立显卡。GitHub上近期热度飙升的开源分层推理框架 Colibrì,凭借纯 C 实现、零第三方引擎依赖的特性,已斩获超过 32k Star。

该项目的核心思路非常直接:既然消费级设备的内存塞不下数百GB甚至TB级的模型权重,那就不要把它们全部载入内存。

Colibrì项目简介

突破瓶颈:SSD成为虚拟显存

以 744B 参数的 GLM-5.2 为例,经过 int4 量化后权重约为 372GB。在常规认知中,这类超大模型只能依赖数据中心级集群运行。但通过 Colibrì,开发者仅凭 12 核 CPU 和 25GB RAM 的普通机器便跑通了全流程。

如今,Colibrì 的适配范围已拓展至 9 个模型家族,从 DeepSeek V4 Flash、Qwen,一直覆盖到 975B 参数的 Inkling,乃至 2.8T 参数的 Kimi K3。运行 Kimi K3 虽需约 1.6TB 硬盘空间,但内存门槛同样只要 32GB 起步,彻底摆脱了对昂贵显存的强依赖。

运行配置展示

核心机制:借力 MoE 稀疏激活

Colibrì 之所以能跑通,关键在于现代大语言模型广泛采用的 MoE(混合专家)架构。

在生成每个 Token 时,MoE 模型并不会调用全部参数,而是通过 Router 路由网络按需激活少数“专家”。例如 GLM-5.2 虽有 744B 总参数,但单 Token 激活的专家参数仅约 40B。绝大多数未被激活的专家,完全没有必要长期霸占宝贵的高速内存。

参数分布与内存机制

基于此,Colibrì 将模型权重切分为两层结构:

  1. 常驻层:Attention、Embedding 以及共享专家等密集计算部分(int4 后仅约 9.9GB),常驻系统 RAM。
  2. 按需调用层:占据绝对体积的 19456 个路由专家权重存入 NVMe SSD。模型推理时,由 Router 确定当前所需专家,如果高速内存未命中,再实时从 SSD 拉取。

这相当于为模型参数构建了一套即时编译(JIT)式的按需加载系统。

AI 内存多层化调度

若每个 Token 都频繁读取磁盘,推理速度必然极低。为解决 I/O 瓶颈,Colibrì 设计了一套 AI 内存多层化(Memory Multitiering) 调度策略:

  • LRU 缓存机制:近期调用的专家优先保留在 RAM 中,后续重复使用无需再读硬盘。
  • 访问频次跟踪:随着推理推进,系统自动统计高频专家,赋予其更高的内存驻留优先级。
  • 专家预取技术:测试显示,相邻网络层之间的专家路由相关度高达 71.6%。当前层在 CPU/GPU 计算的同时,系统已在后台预取下一层大概率用到的专家,让计算与磁盘 I/O 最大程度并行。
  • 多盘并发:支持在双 NVMe SSD 上存放权重副本,双盘并行读取以翻倍 I/O 带宽。

预取与计算重叠机制

这一架构下,存储分工明确:NVMe 负责大容量保底,RAM 缓存常客专家,VRAM(若有)则接纳最高频权重。专家所处存储介质只影响生成速度,不改变数学逻辑与计算精度。

在性能表现上,低配机器冷启动时约为 0.1 Token/s;升级至 128GB RAM 纯 CPU 桌面机后可提升至 1.8 Token/s;若配合 RTX 5090 等专业显卡完全常驻显存,解码速度可达 5.8~6.8 Token/s。

多层存储架构对比
性能测试基准

部署与可视化

Colibrì 提供了跨平台的预编译二进制文件,支持 Linux、macOS 与 Windows。系统内置了完整的 Web Dashboard,可直观呈现 Token 生成速率、分阶段延迟以及权重在 VRAM、RAM 和磁盘之间的分布情况。

控制面板监控

此外,其“Brain”可视化界面还能实时监控数万个专家的激活状态与调用热度。

专家激活可视化面板

Colibrì 证明了通过精细化的分层调度,超大参数大模型的本地化推理并不一定依赖昂贵的 GPU 集群,这为消费级硬件探索前沿 AI 提供了全新思路。

标签:大语言模型MoE推理开源

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

把 MuJoCo 搬上 GPU:MJWarp 迁移的四道闸门与三种不报错的错误
置顶

把 MuJoCo 搬上 GPU:MJWarp 迁移的四道闸门与三种不报错的错误

解码快 3 倍,端到端只快 1.5 倍:VLM 推测解码 DSpark 的账怎么算
置顶

解码快 3 倍,端到端只快 1.5 倍:VLM 推测解码 DSpark 的账怎么算

前途科技前途科技
服务关于快讯技术商业报告
微信咨询二维码

咨询微信

扫码添加微信咨询

前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
Transformers 直接跑 GGUF:Python 追平 llama.cpp
置顶

Transformers 直接跑 GGUF:Python 追平 llama.cpp

//

24小时热榜

Go 并发再讲清一次:关闭 channel 不等于释放资源;1.27 补上跨平台 SIMD
TOP1

Go 并发再讲清一次:关闭 channel 不等于释放资源;1.27 补上跨平台 SIMD

TikTok与阿拉巴马州就青少年成瘾指控达成至少1亿美元和解
TOP2

TikTok与阿拉巴马州就青少年成瘾指控达成至少1亿美元和解

3

斯坦福 HomeBody:让通用大模型跳过专用动作模型,直接指挥人形机器人干家务

22小时前
斯坦福 HomeBody:让通用大模型跳过专用动作模型,直接指挥人形机器人干家务
4

OpenAI Academy 升级,新增开发者与企业管理学习路径

6小时前
OpenAI Academy 升级,新增开发者与企业管理学习路径
5

OpenAI 升级 GPT-6 提示词缓存:Token 成本最高省 90%

6小时前
OpenAI 升级 GPT-6 提示词缓存:Token 成本最高省 90%
6

Airbnb深化与OpenAI合作,全面接入GPT-6 Astra加速开发

6小时前
Airbnb深化与OpenAI合作,全面接入GPT-6 Astra加速开发
7

ChatGPT广告业务拓展至东南亚及台湾地区

6小时前
ChatGPT广告业务拓展至东南亚及台湾地区
8

奥特曼联合国演讲:警惕AI失控,呼吁建立全球监管标准

6小时前
奥特曼联合国演讲:警惕AI失控,呼吁建立全球监管标准
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断