Headroom:给 AI Agent 上下文减肥,Token 节省 60-95% 的压缩层
Headroom 是 AI 编程助手热潮下诞生的上下文压缩框架。开发者在使用 Claude Code、Cursor、Codex 等工具时,常面临 token 消耗过快、上下文窗口溢出、费用飙升等痛点——而这些问题往往不是因为 LLM 不够强,而是送进去的「废料」太多。Headroom 在用户 Agent 和 LLM 之间插入一个本地压缩层,对工具输出、日志、代码文件、RAG 检索结果等进行智能压缩,典型场景节省 60–95% token,同时保持答案准确性不下降。2026 年 6 月单周新增 Star 突破 1 万,直接登顶 GitHub Trending 飙星榜,是当前 AI Agent 工具链中最值得关注的基础设施级 Skill。
功能与原则
Headroom 定位为 AI Agent 的「上下文压缩层」(context compression layer),核心原则是:在 LLM 看到数据之前,先把冗余去掉,保持答案质量不变。
三大压缩引擎:
- SmartCrusher(JSON):对工具输出、API 响应等 JSON 数据进行统计分析,保留错误、异常和边界情况,去掉大量重复字段,压缩率 70–90%
- CodeCompressor(AST):对代码文件进行 AST 感知压缩,保留函数签名、类结构,收缩函数体,压缩率 40–70%(可选,默认关闭)
- Kompress-v2-base(文本):基于 HuggingFace 模型对普通文本进行冗余消除,压缩率 30–50%
除此之外,还提供输出 token 削减(Output token reduction)——模型回复中的「废话」也能在 proxy 层自动裁剪,因为某些场景下模型输出成本是输入的 5 倍。
认可度
- GitHub Stars:截至 2026-08-09,约 65,610(总榜级项目)
- Forks:5,007
- 6 月周榜新增:单周 +10,000+,登顶 GitHub Trending 飙星榜
- GitHub Trending W23(2026-06):位列 Top 3,超越同期 last30days-skill(+12k)和 taste-skill(+8.7k)
- Benchmark 验证:在 GSM8K 数学基准上精度保持不变(0.870),TruthfulQA 事实性测试甚至提升 +0.030;SQuAD v2 QA 97%(压缩率 19%),BFCL 工具调用 97%(压缩率 32%)
链接
GitHub 仓库:https://github.com/headroomlabs-ai/headroom
原作者
项目由 Tejas Chopra(GitHub @chopratejas)主导开发,隶属于 Headroom Labs。Tejas 同时维护了 Kompress-v2-base(一个基于 ModernBERT 的文本压缩模型,托管于 HuggingFace)。Apache 2.0 开源许可。
介绍
AI 编程助手每完成一次代码搜索,可能产生上万 token 的工具输出——而其中真正有意义的信息往往只有几百字。这是当前 AI Agent 工作流的根本矛盾:LLM 上下文窗口虽大,但 token 是钱,而且模型注意力会随上下文变长而稀释。
Headroom 从三个维度解决这个问题:
第一,上游压缩——在请求到达 LLM 前,对 prompt 中的工具输出、日志文件、RAG 检索块、代码文件进行智能压缩。ContentRouter 会自动识别内容类型,匹配最合适的压缩引擎。
第二,本地优先——所有压缩逻辑跑在本地机器上,数据不离开用户环境。CCR(Context Caching with Retrieval)模块将原始内容缓存在本地,需要时可调用 headroom_retrieve 取回,真正做到「可逆压缩」。
第三,跨 Agent 记忆——headroom learn 从失败会话中自动提取修正规则,写入项目级 CLAUDE.local.md / CLAUDE.md,多个 Agent 共享同一份上下文记忆。
特点
- 多形态交付:Library(Python/TypeScript SDK)、Proxy(零代码改造)、MCP Server、Agent Wrap(
headroom wrap claude一键包装) - 全面兼容:Claude Code、Cursor、Codex、Copilot、OpenClaw、Groq、Goose、OpenHands 等 15+ 主流 Agent
- 智能路由:ContentRouter 自动识别 JSON / 代码 / 日志 / 文本,分别走最优压缩管道
- 可逆压缩:原始内容本地缓存,模型随时可取回,零信息丢失风险
- 跨 Agent 共享记忆:多 Agent 协作场景下自动去重、共享上下文记忆池
- 输出削减:从 proxy 层裁剪模型回复中的冗长开场白和重复代码展示,直接降低 5 倍成本的输出费用
使用方法
安装(三选一):
# CLI 全局工具(推荐,uv 隔离环境)
uv tool install --python 3.13 "headroom-ai[all]"
# Python pip
pip install "headroom-ai[all]"
# TypeScript SDK(仅库,无 CLI)
npm install headroom-ai
使用模式 1:Proxy 零改造成式:
headroom proxy --port 8787
# 之后所有走 8787 端口的 LLM 请求自动被压缩
使用模式 2:包装 Agent:
headroom wrap claude # 包装 Claude Code
headroom wrap codex # 包装 Codex
headroom wrap cursor # 包装 Cursor
# 解绑:
headroom unwrap
使用模式 3:Python Library:
from headroom import compress
result = compress(messages, model="gpt-4o")
print(f"Saved {result.tokens_saved} tokens ({result.compression_ratio:.0%})")
验证压缩效果:
headroom doctor # 健康检查
headroom perf # 性能报告
headroom dashboard # 实时压缩率面板(需 proxy 模式)
使用场景与人群
- 重度 AI 编程用户:每日使用 Claude Code / Cursor / Codex 的开发者,token 账单是核心痛点
- 大型代码库场景:代码搜索、跨文件重构、大型重构任务中,工具输出 token 量巨大(一次搜索可能 17k+ tokens)
- 多 Agent 协作团队:Codex + Claude + Gemini 并用的工作流,Headroom 提供统一压缩层和共享记忆
- 关注成本优化的 AI 开发者:SRE 自动化、CI/CD 机器人等需要长时间运行 Agent 的场景
输入与输出案例
案例 1:代码搜索压缩
输入(一次完整搜索后 Agent 收到的 token):17,765 tokens
输出(Headroom 压缩后):1,408 tokens
节省:92%
原始数据:100 个搜索结果,每条含 URL、标题、摘要、代码片段和元数据
压缩后:保留相关性最高的前 N 条,去掉重复的 URL 模式、冗余摘要字段,保留实质性差异
案例 2:SRE 故障调试
输入:65,694 tokens(日志文件 + 监控数据 + 告警上下文)
输出:5,118 tokens
节省:92%
Headroom 自动识别日志中的 pass/fail 模式,保留 error/fatal 行,丢掉所有 passing 日志行,结合告警上下文重建最小可调试输入。
GitHub:https://github.com/headroomlabs-ai/headroom
评论区
登录后可评论。