LLM App Patterns:RAG+Agent+LLMOps 生产级架构全套模板
还在手写 RAG 和 Agent?这个 Skill 把业界最佳实践全打包了
如果你在搞 LLM 应用开发,一定遇到过这些问题:RAG 怎么搭召回率才高?ReAct 和 Plan-Execute 哪个更适合我的场景?上线后怎么监控 LLM 的延迟和成本?
今天挖到一个硬核 Skill——LLM App Patterns,来自 Smithery 平台(19,892 次安装),把 Dify 和 LangChain 的生产级架构全拆解成了可落地的代码模板,覆盖 RAG、Agent、Prompt IDE、LLMOps 四大块。
RAG 流水线:不是简单拼接,是系统工程
很多教程教 RAG 就是「向量数据库 + 召回 + 生成」三步走,但这个 Skill 直接把chunking 策略、embedding 选型、检索增强方法都给你列成表格了。
比如它总结了四种 Chunk 策略:Fixed Size(简单但可能断语义)、Semantic(保留段落完整性)、Recursive(多级分隔符回退)、Document Aware(尊重文档结构如标题、列表)。还给出了推荐配置:512 tokens + 50 overlap,再配合混合检索(BM25 + 向量),召回质量直接上一个台阶。
Embedding 这块也很实用——OpenAI text-embedding-3-small 便宜够用,text-embedding-3-large 适合复杂查询,本地 BGE-Large 免费且质量接近 OpenAI 小模型。
Agent 架构:选型不再靠拍脑袋
这是 Skill 里最硬核的部分。它把业界主流 Agent 模式全拆解了:
- ReAct:Reasoning + Acting,适合需要多步搜索/工具调用的任务
- Function Calling:结构化工具接入,适合工具链固定的场景,延迟最低
- Plan-and-Execute:先规划再执行,适合复杂任务拆解和迭代修正
- Multi-Agent:研究员 + 分析师 + 写手 + 评审,协作完成复杂研究任务
最实用的是那张「架构决策矩阵」:Simple RAG 适合 FAQ 类低复杂度场景,Multi-Agent 则适合研究类高复杂度任务——选型有据可依,不用每次靠感觉。
LLMOps:上线后才是真正开始
Skill 里还给了完整的监控指标体系:延迟(p50/p99)、质量(用户满意度、任务完成率、幻觉率)、成本(单次请求费用、缓存命中率)、可靠性(错误率、超时率、重试率)。配合 OpenTelemetry 分布式追踪,生产环境调试不再黑盒。
另外还有缓存策略(Redis + SHA256 key)、限流重试(指数退避)、模型兜底(GPT-4 Turbo → GPT-3.5 Turbo → Claude 3 Sonnet),这些生产级细节全给到了。
怎么用?
Skill 本质上是一个 SKILL.md 文件,直接安装到 Claude Code、Cursor、Copilot 等 AI 编程工具里就能用。它不依赖特定框架,Dify、LangChain、LlamaIndex 都可以参考。
说实话,这是我见过最完整的 LLM 应用架构参考——不是玩具级 demo,是真正能上生产的代码模式和决策指南。如果你正在设计 LLM 系统,或者想系统化提升 AI 工程能力,这个 Skill 值得收藏。
评论区
登录后可评论。