LLM 工程化不全靠调模型,这个 Skill 把生产级流程讲透了
大部分人跑通一个 LLM Demo 只需要一天,但把它送进生产环境——能监控、可回滚、成本可控——才是真正考验的开始。今天介绍一个我最近反复在用的 Skill:LLM Development & Engineering,它几乎把 LLM 工程化的全部关键节点打包成了一份随时可查的操作手册。
拿到需求,第一步不是调模型
很多人拿到「做个 AI 客服」的任务,二话不说就上 RAG,其实这个 Skill 最值钱的恰恰是决策框架而不是代码。它给了一张清晰的决策树:
- 需要最新知识?→ 先问简单问答能不能搞定,不能再上 RAG
- 需要工具调用?→ 单步用 ReAct,多步用 LangGraph / CrewAI
- 模型行为需要高度稳定?→ 再考虑 PEFT/LoRA 微调,之前先用 Prompt Engineering 穷尽可能性
这个顺序搞反了,是很多项目返工的根本原因。
成本,不是最后才考虑的事
Skill 里专门有一节讲 Cost-Aware Engineering,核心观点很反直觉:不要只算「每千 token 多少钱」,要算「每个成功结果多少钱」。
它给出的一套分级策略很实用:
- Value 层:小模型跑简单任务,高频低延迟
- Balanced 层:主力生产 workload
- Premium 层:最强模型处理最难的 case,低频
加上 Cascade Routing 和 Prompt Caching,实际账单能降一大截。这些在 Demo 阶段根本不会想到,但上线后就是真金白银。
上线前的「关卡设计」
Skill 还用了不少篇幅讲 Evaluation Gate:模型升级必须过三关——离线黄金集测试、A/B 分流、灰度监控。不是可选项,是 Gate。
对应的还有一套回滚预案(Rollback Plan):升级后出问题怎么切回去,切哪个版本,都有模板可以直接套。这套思路本质上是在把模型当成有 SLA 的服务来对待,而不是一个「升级了大家都说好」的黑盒。
安全是工程问题,不是附加项
最后一块讲得最实在:Security-by-Design。Prompt Injection、数据泄漏、工具滥用不是「以后再管」,而是设计阶段就要列进 Threat Model 的东西。Skill 引用了 NIST AI RMF 框架,并要求把 Guardrails 当成生产代码来对待——有 Code Review,有测试,不是配完就完事。
怎么安装
安装只需要一行命令,在 Claude Code 里直接跑:
npx skills add https://github.com/majiayu000/claude-skill-registry --skill ai-llm
装完整个 LLM 工程化生命周期都在你手边——从选架构到上线监控,下次做 LLM 相关项目的时候,别急着调模型,先把这个 Skill 召唤出来过一遍决策树,能省不少返工。
GitHub 仓库:majiaYu000/claude-skill-registry
评论区
登录后可评论。