跑了几个月的长任务,才发现 AI 偷懒全怪我们 prompt 写错了
跑了几个月 Claude Code,每次发”长任务”都翻车:让它写完整方案、跑半小时,到点交一份”看着对、其实没回答问题”的废稿。
最近翻到一个叫 long-horizon-prompting 的 skill,才意识到——问题不是 AI 不够强,是我们写 prompt 的方式,根本没准备好让 AI 跑长任务。
这个 skill 是干嘛的
它专门教你怎么写长跑 Agent 的启动 prompt——不是普通的”你是一个 XX 助手”,而是一种叫 pseudo-formal task brief 的结构化任务说明书。它的设计参照了 GPT-5.6 Sol Ultra 解决 Cycle Double Cover Conjecture 那道数学题时用的 prompt(64 个 subagent 并行跑,最后真的搞出候选证明)。
它把”长任务 prompt”拆成 4 个核心块:
- Definitions with degenerate cases:先把所有关键术语定义清楚,包括”会被人钻空子的边界情况”
- Exact success predicate:一句话讲明白”返回的成果必须满足什么”
- Non-counting outcomes:列清楚哪些结果不算——部分进展、特殊情况、套娃简化都不能交差
- Enumerated failure modes:给”审查员”一张具体的失败清单,让他按图索骥去抓漏洞
这四块对应一张表,告诉你”每个块防止什么失败”。光”non-counting outcomes”一条,就把 Agent 最常见的”答非所问但看着像答案”堵死了。
为什么这个 skill 适合 Prompt 工程师
如果你是做 AI Agent、coding agent、自动化研究的,你会发现市面上 90% 的 prompt 模板都是”短任务”思维:清晰指令 + 几个例子。一旦任务跑超过 1 小时,模型在持久性压力下会自动走捷径——给出 partial answer、套娃循环、用同一种思路反复试。
long-horizon-prompting 的反直觉点在于:写长 prompt 比写短 prompt 更划算。因为长任务的失败成本是小时级计算,短任务的失败成本是几秒钟。你花 30 分钟认真写一份 brief,能省下未来 5 次翻车浪费的几个小时。
怎么用
最简方式:把 muratcankoylan/Agent-Skills-for-Context-Engineering 仓库 clone 下来,把 skills/long-horizon-prompting/SKILL.md 放到 ~/.claude/skills/ 下,下次写长任务 prompt 的时候让 Claude 读一下,按那张 brief anatomy 表帮你生成。
或者你直接照着 README 里那张”伪正式任务说明书”骨架填——光是”列出 non-counting outcomes”这一步,就能让你 80% 的长任务 prompt 质量上一档。
写在最后
调教 AI 真正的分水岭,不是让它答得更好看,而是让它在没人盯着的情况下还能交对答案。Pseudo-formal brief 不是写给 Claude 看的——是写给那个”在持久性压力下会偷懒”的自己看的。
GitHub: https://github.com/muratcankoylan/Agent-Skills-for-Context-Engineering
GitHub: https://github.com/muratcankoylan/Agent-Skills-for-Context-Engineering
评论区
登录后可评论。