上下文工程:LLM 落地的下一个瓶颈,这个 7.2k 星 skill 库给出了解法

LLM 落地最被低估的瓶颈:上下文工程

2026 年了,大家都在聊模型参数、聊推理速度、聊多模态。但有一个问题正在悄悄成为 LLM 应用的天花板——上下文 engineering

不是 prompt engineering,是 context engineering。

这两个东西差在哪?prompt engineering 教你怎么写好指令,context engineering 教你怎么管理输入给模型的所有信息:系统提示词、工具定义、检索文档、对话历史、工具输出……全都在抢模型有限注意力预算。

为什么 context window ≠ 可用上下文

很多人以为 context window 的瓶颈是 token 数量。错了。

真正的瓶颈是注意力机制。当 context 变长,模型会表现出可预测的退化模式:lost-in-the-middle(中间信息被忽略)、U 型注意力曲线(首尾信息强、中间弱)、注意力稀缺。

换句话说:能塞进去 ≠ 模型能用上。

这就是为什么同一个 AI 助手,有时候”听不懂”——不是模型不够聪明,是你喂给它的上下文太乱了。

一个 7.2k 星的 skill 合集,专治这个

muratcankoylan/AgentSkills-for-Context-Engineering 是一个 MIT 协议开源的 Agent Skills 集合,聚焦上下文工程的核心原理,专门教 AI 代理如何在有限的注意力预算内最大化效能。

GitHub: github.com/muratcankoylan/Agent-Skills-for-Context-Engineering

Skill 分为三层:

  • Foundational:context-fundamentals、context-degradation、context-compression——建立对上下文问题的系统性认知
  • Architectural:multi-agent-patterns、memory-systems、tool-design、filesystem-context——构建生产级 Agent 架构
  • Operational:context-optimization、evaluation、advanced-evaluation——持续运营和评估优化

亮点:LLM-as-Judge 实战代码

这个库里有个 llm-as-judge-skills 示例,是少见的生产级 TypeScript 实现,附带 19 个通过测试。覆盖:Direct Scoring、Pairwise Comparison、Rubric Generation,还有位置偏置消除。

这意味着什么?你可以用它来自动化评估你的 Agent 输出质量,不用每次都靠人工打标。

有数据支撑的硬核工作

这不是纸上谈兵。项目里有一套完整的 router benchmark,在 Cursor SDK 上跑了 4 个前沿模型(gemini-3.1-pro、composer-2、gpt-5.5、claude-opus-4-7),每个模型 50 条 prompt × 3 次重复 = 600 条数据。

结果:context-fundamentals 这个 skill 加载后 top-1 准确率从 0.255 提升到 0.489,提升近一倍。

谁需要这个?

如果你正在做:

  • 多 Agent 系统(需要协调上下文分配)
  • 长会话 AI 应用(需要管理对话历史)
  • 生产级 Agent 评估(需要 LLM-as-Judge)

这个库值得仔细看。MIT 协议,商用无忧。

GitHub: github.com/muratcankoylan/Agent-Skills-for-Context-Engineering


GitHub: https://github.com/muratcankoylan/Agent-Skills-for-Context-Engineering

评论区

0 条评论

登录后可评论。

陈一铭 12 阅读