Headroom:给 AI Agent 上下文减肥,Token 节省 60-95% 的压缩层

Headroom 是 AI 编程助手热潮下诞生的上下文压缩框架。开发者在使用 Claude Code、Cursor、Codex 等工具时,常面临 token 消耗过快、上下文窗口溢出、费用飙升等痛点——而这些问题往往不是因为 LLM 不够强,而是送进去的「废料」太多。Headroom 在用户 Agent 和 LLM 之间插入一个本地压缩层,对工具输出、日志、代码文件、RAG 检索结果等进行智能压缩,典型场景节省 60–95% token,同时保持答案准确性不下降。2026 年 6 月单周新增 Star 突破 1 万,直接登顶 GitHub Trending 飙星榜,是当前 AI Agent 工具链中最值得关注的基础设施级 Skill

功能与原则

Headroom 定位为 AI Agent 的「上下文压缩层」(context compression layer),核心原则是:在 LLM 看到数据之前,先把冗余去掉,保持答案质量不变

三大压缩引擎:

  • SmartCrusher(JSON):对工具输出、API 响应等 JSON 数据进行统计分析,保留错误、异常和边界情况,去掉大量重复字段,压缩率 70–90%
  • CodeCompressor(AST):对代码文件进行 AST 感知压缩,保留函数签名、类结构,收缩函数体,压缩率 40–70%(可选,默认关闭)
  • Kompress-v2-base(文本):基于 HuggingFace 模型对普通文本进行冗余消除,压缩率 30–50%

除此之外,还提供输出 token 削减(Output token reduction)——模型回复中的「废话」也能在 proxy 层自动裁剪,因为某些场景下模型输出成本是输入的 5 倍。

认可度

  • GitHub Stars:截至 2026-08-09,约 65,610(总榜级项目)
  • Forks:5,007
  • 6 月周榜新增:单周 +10,000+,登顶 GitHub Trending 飙星榜
  • GitHub Trending W23(2026-06):位列 Top 3,超越同期 last30days-skill(+12k)和 taste-skill(+8.7k)
  • Benchmark 验证:在 GSM8K 数学基准上精度保持不变(0.870),TruthfulQA 事实性测试甚至提升 +0.030;SQuAD v2 QA 97%(压缩率 19%),BFCL 工具调用 97%(压缩率 32%)

链接

GitHub 仓库:https://github.com/headroomlabs-ai/headroom

原作者

项目由 Tejas Chopra(GitHub @chopratejas)主导开发,隶属于 Headroom Labs。Tejas 同时维护了 Kompress-v2-base(一个基于 ModernBERT 的文本压缩模型,托管于 HuggingFace)。Apache 2.0 开源许可。

介绍

AI 编程助手每完成一次代码搜索,可能产生上万 token 的工具输出——而其中真正有意义的信息往往只有几百字。这是当前 AI Agent 工作流的根本矛盾:LLM 上下文窗口虽大,但 token 是钱,而且模型注意力会随上下文变长而稀释

Headroom 从三个维度解决这个问题:

第一,上游压缩——在请求到达 LLM 前,对 prompt 中的工具输出、日志文件、RAG 检索块、代码文件进行智能压缩。ContentRouter 会自动识别内容类型,匹配最合适的压缩引擎。

第二,本地优先——所有压缩逻辑跑在本地机器上,数据不离开用户环境。CCR(Context Caching with Retrieval)模块将原始内容缓存在本地,需要时可调用 headroom_retrieve 取回,真正做到「可逆压缩」。

第三,跨 Agent 记忆——headroom learn 从失败会话中自动提取修正规则,写入项目级 CLAUDE.local.md / CLAUDE.md,多个 Agent 共享同一份上下文记忆。

特点

  • 多形态交付:Library(Python/TypeScript SDK)、Proxy(零代码改造)、MCP Server、Agent Wrap(headroom wrap claude 一键包装)
  • 全面兼容:Claude Code、Cursor、Codex、Copilot、OpenClaw、Groq、Goose、OpenHands 等 15+ 主流 Agent
  • 智能路由:ContentRouter 自动识别 JSON / 代码 / 日志 / 文本,分别走最优压缩管道
  • 可逆压缩:原始内容本地缓存,模型随时可取回,零信息丢失风险
  • 跨 Agent 共享记忆:多 Agent 协作场景下自动去重、共享上下文记忆池
  • 输出削减:从 proxy 层裁剪模型回复中的冗长开场白和重复代码展示,直接降低 5 倍成本的输出费用

使用方法

安装(三选一)

# CLI 全局工具(推荐,uv 隔离环境)
uv tool install --python 3.13 "headroom-ai[all]"

# Python pip
pip install "headroom-ai[all]"

# TypeScript SDK(仅库,无 CLI)
npm install headroom-ai

使用模式 1:Proxy 零改造成式

headroom proxy --port 8787
# 之后所有走 8787 端口的 LLM 请求自动被压缩

使用模式 2:包装 Agent

headroom wrap claude   # 包装 Claude Code
headroom wrap codex    # 包装 Codex
headroom wrap cursor   # 包装 Cursor
# 解绑:
headroom unwrap

使用模式 3:Python Library

from headroom import compress

result = compress(messages, model="gpt-4o")
print(f"Saved {result.tokens_saved} tokens ({result.compression_ratio:.0%})")

验证压缩效果

headroom doctor   # 健康检查
headroom perf    # 性能报告
headroom dashboard  # 实时压缩率面板(需 proxy 模式)

使用场景与人群

  • 重度 AI 编程用户:每日使用 Claude Code / Cursor / Codex 的开发者,token 账单是核心痛点
  • 大型代码库场景:代码搜索、跨文件重构、大型重构任务中,工具输出 token 量巨大(一次搜索可能 17k+ tokens)
  • 多 Agent 协作团队:Codex + Claude + Gemini 并用的工作流,Headroom 提供统一压缩层和共享记忆
  • 关注成本优化的 AI 开发者:SRE 自动化、CI/CD 机器人等需要长时间运行 Agent 的场景

输入与输出案例

案例 1:代码搜索压缩

输入(一次完整搜索后 Agent 收到的 token):17,765 tokens
输出(Headroom 压缩后):1,408 tokens
节省:92%

原始数据:100 个搜索结果,每条含 URL、标题、摘要、代码片段和元数据
压缩后:保留相关性最高的前 N 条,去掉重复的 URL 模式、冗余摘要字段,保留实质性差异

案例 2:SRE 故障调试

输入:65,694 tokens(日志文件 + 监控数据 + 告警上下文)
输出:5,118 tokens
节省:92%

Headroom 自动识别日志中的 pass/fail 模式,保留 error/fatal 行,丢掉所有 passing 日志行,结合告警上下文重建最小可调试输入。


GitHub:https://github.com/headroomlabs-ai/headroom


GitHub: https://github.com/headroomlabs-ai/headroom

评论区

0 条评论

登录后可评论。

Skill超级捕获手 15 阅读