提示词自动路由到最便宜模型:external-model-delegation 用六层 tier 节省 LLM 成本
LLM 成本优化新思路:把提示词自动路由到最便宜的模型
你们有没有这种感觉——让 Claude 处理所有任务,就像开法拉利去买菜?能用,但也太贵了。
最近发现一个叫 external-model-delegation 的 Skill,思路很有意思:不是让一个模型干所有事,而是给每个提示词自动分配「最合适」的模型。
核心思路:六层成本路由表
这个 Skill 实现的路由逻辑非常清晰,根据任务类型自动匹配:
- QWEN(免费):grep、find、regex、shell 命令、语法查找、短摘要——本地 Ollama 直接搞定,一分钱不用
- DEEPSEEK_FLASH($0.14/M tokens):简单代码、样板代码、CRUD、测试编写、小修小补
- DEEPSEEK_PRO($0.44/M tokens):多文件特性、重构、调试、中等复杂度代码
- KIMI($0.60/M tokens):单文件 review、中等推理、commit 消息
- CODEX(按量计费):批量生成、跨文件机械修改
- CLAUDE($3-15/M tokens):架构设计、安全分析、复杂调试、系统设计、质量关键任务
翻译成人话就是:查文档用免费模型,写测试用便宜模型,让 Claude 只处理真正需要它的事。
技术实现:UserPromptSubmit Hook
实现方式是 Anthropic 的 UserPromptSubmit hook——在提示词提交给模型之前,先经过一个分类器判断任务属于哪个 tier,然后注入对应的 delegation 脚本让 Claude 执行。
每个 tier 对应一个独立的命令行工具(~/bin/ 下的可执行脚本),Claude 调用这些脚本,把结果返回给用户。整个过程对用户透明——你只管问问题,系统自动选最划算的模型。
实际价值在哪?
这个模式解决了一个真实痛点:团队里不是所有任务都需要最强模型。代码格式化、简短解释、语法检查这类轻量任务,用 GPT-4 或 Qwen3 效果差不多,但成本差了 100 倍。
更重要的是,这个 Skill 提供了完整的路由决策表和技术实现模板。你可以基于它扩展自己的路由逻辑——比如加入响应质量评估,根据结果决定是否升级到更贵的模型。
怎么安装?
一行命令搞定:
npx skills add https://github.com/alinaqi/maggy --skill external-model-delegation
需要提前配置好 DEEPSEEK_API_KEY 和 OPENAI_API_KEY 环境变量,Ollama 也要在本地运行。具体看 GitHub 仓库里的文档。
GitHub:https://github.com/alinaqi/maggy
GitHub: https://github.com/alinaqi/maggy
评论区
登录后可评论。