Colibri Skill:纯 C 零依赖跑 744B MoE 大模型,GitHub 25k 星的基础设施革命
Colibri 爆火背后,是一场让大模型「放下身段」的工程革命——用纯 C 写的 inference 引擎,把 VRAM/RAM/SSD 当成统一的多级存储,MoE 的 expert 权重按需从磁盘 streaming 进内存,无需 A100/H100,在一台普通开发机上就能跑 744B 参数的 GLM-5.2 或 Kimi K3(2.8T)。GitHub 8 月底已冲至约 25,500 Star,本周新增持续位居 AI/ML 分类前列,是目前最被开发者关注的基础设施类项目之一。
功能与原则
Colibri 是一个纯 C 零依赖的 MoE(Mixture-of-Experts)模型推理引擎,核心设计哲学是「AI memory multitiering」——不再把模型一股脑装进 GPU VRAM,而是将存储层、内存、显存视为同一推理层级,按需动态调度:
- Attention/Embedding 层常驻内存(需要低延迟)
- MoE Expert 权重按需从 SSD streaming(按 token 路由触发,非批量加载)
- 同套代码支持多模型(GLM-5.2、Kimi K3、DeepSeek V4 Flash、Qwen3.6、OLMoE 等)
设计原则:快慢内存不足时只降速、不降语义精度;不偷偷改模型精度或 router 语义;所有实验必须有可复现的端到端测量支撑。
认可度
| 指标 | 数据(截至 2026-08-30) |
|---|---|
| GitHub Star | 约 25,500(AINews 8 月底数据) |
| Forks | 2,794 |
| 创建时间 | 2026-07-01 |
| 本周新增 Star | 持续高位,8 月 GitHub Trending AI/ML 分类常驻 |
| License | Apache 2.0 |
| 语言 | C(纯 C,无任何外部 engine 依赖) |
链接
GitHub:https://github.com/JustVugg/colibri
原作者
- GitHub username:
JustVugg - 一句话简介:专注端侧/本地化 AI 推理基础设施开发的独立开发者/团队,Colibri 是其核心项目,定位为「可跑在前沿消费硬件上的开放推理研究平台」。
介绍
Colibri 起源于一个简单但强烈的需求:大模型太贵,普通开发者跑不动。传统方案要求整块模型权重一次性加载进显存——这意味着要么租云 GPU,要么买专业级显卡。Colibri 用 MoE 的稀疏激活特性做了一件看似不可能的事:把 744B 参数的 GLM-5.2 或 2.8T 的 Kimi K3,跑到一台只有消费级硬件的机器上。
实现方式是将模型分层处理:Attention 和 Embedding 层因为需要持续低延迟访问,必须常驻快速存储(VRAM/RAM);而 MoE 的 expert 路由是按 token 动态触发的,Colibri 实现了一套从 SSD 按需 streaming 的 expert 调度系统,VRAM/RAM/SSD 三者共同构成统一的推理内存层级。硬件不够快时,模型跑得慢但跑得对;不会因为内存不足就悄悄降精度或改变模型行为。
目前 Colibri 支持 7 个模型族:GLM-5.2(744B)、GLM-5.3-Flash(321B,支持视觉)、Inkling(975B)、Kimi K3(2.8T)、DeepSeek V4 Flash(284B)、Qwen3.6(35B-A3B)、OLMoE(7B),每个模型约等于一个 C 文件,共享同一套推理框架和 web 前端。
特点
- 纯 C 零依赖:无需任何外部推理库或 GPU 驱动,编译即跑,交叉编译方便
- AI memory multitiering:把 VRAM/RAM/SSD 当统一层级,expert streaming 按需调度,不强行压缩模型
- 多模型支持:一个代码库支持 7 个主流 MoE 模型族,换模型只需换权重文件
- 可视化大脑:提供 web dashboard,可实时观测 expert 路由热力图、每层 VRAM/RAM/disk 占用条、吞吐和 TTFT 指标
- 本地优先,隐私友好:不依赖任何云 API,模型完全本地运行,数据不离开机器
- 研究导向:所有优化必须附端到端可复现数据,实验透明,拒绝「微基准好看但实际拉胯」
使用方法
安装(Linux/macOS/Windows 均支持):
# 方式一:直接下载预编译二进制(推荐)
curl -fsSL https://justvugg.github.io/colibri/install.sh | bash
# 方式二:从源码编译
git clone https://github.com/JustVugg/colibri.git
cd colibri && make
# 下载模型权重(以 GLM-5.2 为例)
./coli download glm-5.2
# 启动交互式对话
./coli chat
# 启动 Web Dashboard
./coli web
Docker 方式(完全隔离环境):
docker run -it --rm
-v ~/.colibri:/root/.colibri
justvugg/colibri coli chat --model glm-5.2
作为库调用(Python/其他语言通过 subprocess 调用):
headroom wrap coli # 在 Colibri 外面包一层压缩层,进一步省 token
coli chat --model glm-5.2 --prompt "用中文解释什么是 Mixture of Experts"
使用场景与人群
- 本地推理开发者:不想付云 API 费、需要在笔记本或工作站上跑大模型验证 idea 的开发者
- 边缘/嵌入式场景:需要在没有 GPU 的机器上运行 AI 推理(如旧服务器、工控机、ARM 开发板)
- 模型研究者:想观察特定 expert 在特定 token 上的激活模式、做 MoE routing 分析的研究者
- 隐私敏感行业:医疗、金融等无法将数据发给云端、必须本地运行的场景
- 开源社区贡献者:Colibri 代码量小(C 文件),欢迎提交新模型支持、自定义调度策略
输入与输出案例
案例 1:消费级机器跑 744B 模型
$ ./coli chat --model glm-5.2
🐦 colibri v1.9.0 — GLM-5.2 · 744B MoE · int4 · streaming CPU
✓ ready in 32s · resident 9.9 GB
› 用一句话解释量子纠缠
◆ 量子纠缠是两个粒子之间的特殊关联,测量一个粒子的状态会瞬间决定另一个粒子的状态,无论它们相距多远。
案例 2:查看 Expert 路由热力图
在 Web Dashboard(./coli web)中,可以实时看到每个 expert 的路由命中情况。实测在 GLM-5.2(19,456 experts)上,每次推理约激活数百个 expert,冷门 expert 可能整轮都不被路由到——这正是 MoE 省算力的来源。用户可点击任意 expert 查看其 topic affinity(通过 issue #175 测得的专家专长领域)。
GitHub:https://github.com/JustVugg/colibri · Apache 2.0 协议 · C 语言,零依赖
评论区
登录后可评论。