上下文工程:LLM 落地的下一个瓶颈,这个 7.2k 星 skill 库给出了解法
LLM 落地最被低估的瓶颈:上下文工程
2026 年了,大家都在聊模型参数、聊推理速度、聊多模态。但有一个问题正在悄悄成为 LLM 应用的天花板——上下文 engineering。
不是 prompt engineering,是 context engineering。
这两个东西差在哪?prompt engineering 教你怎么写好指令,context engineering 教你怎么管理输入给模型的所有信息:系统提示词、工具定义、检索文档、对话历史、工具输出……全都在抢模型有限注意力预算。
为什么 context window ≠ 可用上下文
很多人以为 context window 的瓶颈是 token 数量。错了。
真正的瓶颈是注意力机制。当 context 变长,模型会表现出可预测的退化模式:lost-in-the-middle(中间信息被忽略)、U 型注意力曲线(首尾信息强、中间弱)、注意力稀缺。
换句话说:能塞进去 ≠ 模型能用上。
这就是为什么同一个 AI 助手,有时候”听不懂”——不是模型不够聪明,是你喂给它的上下文太乱了。
一个 7.2k 星的 skill 合集,专治这个
muratcankoylan/Agent–Skills-for-Context-Engineering 是一个 MIT 协议开源的 Agent Skills 集合,聚焦上下文工程的核心原理,专门教 AI 代理如何在有限的注意力预算内最大化效能。
GitHub: github.com/muratcankoylan/Agent-Skills-for-Context-Engineering
Skill 分为三层:
- Foundational:context-fundamentals、context-degradation、context-compression——建立对上下文问题的系统性认知
- Architectural:multi-agent-patterns、memory-systems、tool-design、filesystem-context——构建生产级 Agent 架构
- Operational:context-optimization、evaluation、advanced-evaluation——持续运营和评估优化
亮点:LLM-as-Judge 实战代码
这个库里有个 llm-as-judge-skills 示例,是少见的生产级 TypeScript 实现,附带 19 个通过测试。覆盖:Direct Scoring、Pairwise Comparison、Rubric Generation,还有位置偏置消除。
这意味着什么?你可以用它来自动化评估你的 Agent 输出质量,不用每次都靠人工打标。
有数据支撑的硬核工作
这不是纸上谈兵。项目里有一套完整的 router benchmark,在 Cursor SDK 上跑了 4 个前沿模型(gemini-3.1-pro、composer-2、gpt-5.5、claude-opus-4-7),每个模型 50 条 prompt × 3 次重复 = 600 条数据。
结果:context-fundamentals 这个 skill 加载后 top-1 准确率从 0.255 提升到 0.489,提升近一倍。
谁需要这个?
如果你正在做:
- 多 Agent 系统(需要协调上下文分配)
- 长会话 AI 应用(需要管理对话历史)
- 生产级 Agent 评估(需要 LLM-as-Judge)
这个库值得仔细看。MIT 协议,商用无忧。
GitHub: github.com/muratcankoylan/Agent-Skills-for-Context-Engineering
GitHub: https://github.com/muratcankoylan/Agent-Skills-for-Context-Engineering
评论区
登录后可评论。