你的 Agent 越来越蠢?可能是这 12 层架构在悄悄腐蚀它
你的 Agent 越来越蠢?可能是这 12 层架构在悄悄腐蚀它
做过 LLM 应用的同学,有没有这种感觉:模型在 Playground 里对答如流,一集成到产品里就开始「变笨」?工具调用抽风、上下文越跑越脏、昨天还正常今天就开始幻觉——问题往往不在模型本身,而在你层层叠叠的架构包装上。
今天挖到一个硬核 Skill,叫 agent-architecture-audit,专门给 Agent 系统做全身「CT 扫描」。作者是 afaan-m(ECC 仓库),GitHub 2.3 万星,这个 Skill 单拎出来也非常能打。
核心思路:12 层架构,每层都可能腐蚀答案
这个 Skill 的核心洞察是:任何一个 Agent 系统,都可以拆解成 12 层,每一层都在「加工」最终答案——任何一层出错,最终输出就会扭曲。
- 第 1-5 层(输入侧):System Prompt → 会话历史 → 长期记忆 → 记忆蒸馏 → 主动召回。这些层最常见的问题是「上下文污染」——旧对话的残留悄悄污染新对话。
- 第 6-8 层(工具侧):工具选择 → 工具执行 → 工具输出解读。这里最容易出现「声明了但没执行」的问题——Prompt 里写了必须调工具,模型就是跳过,或者干脆伪造执行结果。
- 第 9-12 层(输出侧):答案整形 → 平台渲染 → 隐藏修复循环 → 持久化。最隐蔽的是第 11 层「隐藏修复循环」——你的系统里是不是有个「自动修正」Agent 在悄悄改用户答案?这个 Agent 用户根本不知道,但它确实存在。
典型症状对照自查
Skill 里列了 5 种典型失败模式:
1. Wrapper 退化:裸模型 OK,套了包装层就崩。「上次更新之前还好好的」是典型开场白。
2. 记忆污染:Agent 莫名其妙提起完全不相关的话题,用户纠正了也不改。这是因为记忆向量库里混入了噪声。
3. 工具纪律失效:Prompt 写得清清楚楚「必须调工具 X」,模型就是不听。或者是「调了」但根本没真正执行,在伪造结果。
4. 渲染层腐化:日志里答案是对的,用户看到的是乱码。Markdown 渲染、JSON 解析、流式输出的每个环节都可能变异。
5. 隐藏 Agent 层:你不知道的第二层 LLM 在偷偷改输出。「自动修正」「智能摘要」类 Agent 是重灾区。
审计流程:三阶段定位根因
Skill 给出完整审计工作流:Phase 1 定范围(目标系统、入口、模型栈、症状、时间窗口)→ Phase 2 收集证据(源码、日志、配置)→ Phase 3 分析(逐层排查)。每步都有具体操作指令,不是泛泛而谈。
对做 Agent 框架、LangChain/Llamaindex 封装、或自研 Agent 平台的同学,这个 Skill 价值很高——相当于给你一张「架构排雷地图」,按图索骥比盲猜快 10 倍。
顺便说一句,作者 afaan-m 的 ECC 仓库本身就是个 Skill 大全,agent-architecture-audit 是其中诊断类 Skill 的扛把子。强烈建议收藏。
GitHub: https://github.com/affaan-m/ECC/tree/main/skills/agent-architecture-audit
评论区
登录后可评论。