LLM应用开发套路大全!这个Skill把RAG、Agent、Prompt工程全讲透了
如果你正在做 AI 应用开发,或者想了解 LLM 应用领域的「套路」有哪些,这篇一定要收藏。
最近我在 Smithery 上发现了一个宝藏 Skill——LLM Application Patterns,安装量快破 2 万了,堪称目前最全的 LLM 应用模式百科。
这个 Skill 来自 Dify 团队和行业最佳实践的沉淀,核心价值是把 AI 应用开发中常见的问题拆成了 5 大模块来讲:RAG 流水线架构、Agent 架构设计、Prompt IDE 模式、LLMOps 监控,以及生产级工程模式。
RAG 怎么搭?不止向量检索那么简单
很多人以为 RAG 就是把文档切成块、存进向量库、检索回来。但这个 Skill 告诉你事情没那么简单。
它给出了完整的 Chunking 策略图谱:固定大小块(简单但容易断语义)、语义分块(保留段落含义)、递归分割(多级分隔符逐层尝试)、文档感知分块(尊重标题/列表结构)。推荐配置是 512 token 一块,50 token 重叠。
向量数据库的选择也给你列了一张表:Pinecone 适合生产级托管、Weaviate 支持多模态和自部署、ChromaDB 适合开发原型、pgvector 适合已有 Postgres 基础设施的场景。
检索策略更不只是纯语义搜索——它还教你做混合搜索(语义 + BM25 关键词),以及多查询检索(让 LLM 生成查询变体再合并结果),这两个技巧能显著提升召回率。
Agent 架构:不是只有 ReAct
业界聊 Agent 动不动就 ReAct,但这个 Skill 把主流架构全部摊开:
ReAct(推理+行动交替)适合多步任务;Function Calling 适合有结构化工具的场景;Plan-and-Execute(规划+执行分离)适合复杂任务——先规划再逐步执行,遇到偏差就 replan;Multi-Agent 协作适合研究类任务,多个专业 agent 协同,最后还有个 Critic 做评审。
每种架构还配了复杂度/成本矩阵,告诉你什么时候该用什么。
生产级细节:缓存、限流、兜底
这部分是我觉得最有干货的地方。
LLM 缓存策略:对 temperature=0 的确定性输出,用 SHA256 做 cache key,Redis 存 TTL 内的结果,命中率上去之后成本能降一大截。
限流与重试:用指数退避做 retry,配合 RateLimiter 控制 RPM,避免触发 API 限流。
模型兜底:Primary 用 GPT-4-Turbo,fallbacks 列表里放 GPT-3.5-Turbo 和 Claude-3-Sonnet,任何一个被限流了自动切下一个。
怎么用
在 Smithery 搜索 llm-app-patterns,或者在 Claude Code、Copilot 这些支持 Skill 的编辑器里直接安装。打开 SKILL.md,里面有完整的代码示例和决策矩阵,直接对照着自己的项目查漏补缺。
GitHub 链接:davila7/claude-code-templates(LLM 应用模式在 cli-tool/components/skills/ai-research/llm-app-patterns 目录)
这个 Skill 的价值在于它不是教你「怎么调用 API」,而是帮你建立完整的 LLM 应用工程思维。不管你是正在搭 RAG 系统,还是在设计 Agent 架构,拿它当检查清单用准没错。
评论区
登录后可评论。