Claude调一次几毛钱?这个 MCP 把你的AI调用先过一遍本地模型,省下的都是利润
最近在跑 AI 项目,Claude Sonnet 调一次几毛钱、GPT-4o 调一次几块钱——云端推理的成本,比我想象中贵太多。
如果你也有这个痛点,今天这个 Skill 值得了解一下。
它是干嘛的
Local Model Suitability MCP 是一个 MCP 协议服务器,核心功能只有一个:在你每次发起云端 AI 调用之前,帮你判断这个任务能不能用本地模型搞定。
换句话说,它是你的 AI 路由决策大脑。每次你要调 Claude 或者 GPT 之前,先问它一句:”这事本地模型能办吗?”
如果答案是 LOCAL,就直接走 Ollama / LM Studio / llama.cpp,省下云端账单;如果答案是 CLOUD,才老老实实调云端 API。
怎么工作的
它提供两个关键参数让你输入任务描述和质量要求,然后返回一个判断:
- verdict:LOCAL 或 CLOUD
- confidence:HIGH / MEDIUM / LOW
- reason:判断理由
- recommended_local_models:推荐哪些本地模型能handle这个任务
- estimated_cost_saving:这次省了多少钱
举个例子,你要让模型做一段文字摘要,它会分析任务复杂度、隐私要求,然后告诉你:”任何 7B 以上本地模型都能搞定,预计省 $0.002–0.008。”
直接推荐你用 llama3.2:8b、mistral-7b 或者 phi3:medium。
实际怎么用
在 Smithery 上接入:
npx -y local-model-suitability-mcp
或者用 HTTP 远程接入(适合服务端部署):
{
"mcpServers": {
"local-model-suitability": {
"type": "http",
"url": "https://local-model-suitability-mcp-production.up.railway.app"
}
}
}
支持 LangChain / LangGraph 生态,集成成本极低。
价格怎么样
免费层每月 20 次调用,对于个人开发调试够用了。付费档分别是:
- Starter:$20 / 500 次调用
- Pro:$70 / 2000 次调用
按需购买,对于日均调用量大的开发者来说,回本很快。
什么人适合用
如果你正在用 AI 写代码、跑自动化流程,或者在做一个有成本压力的 AI 产品,这个 MCP 能帮你省不少钱。尤其是那种”其实本地模型就够用”的简单任务,没必要次次都调云端贵的模型。
另外,如果你有数据隐私要求(比如处理内部文档),它还有个硬逻辑:CONFIDENTIAL 级别强制走本地,数据永远不出机器。
作者今天刚更新了仓库,还是热乎的,有兴趣的建议先占坑试试。
GitHub:https://github.com/OjasKord/local-model-suitability-mcp
GitHub: https://github.com/OjasKord/local-model-suitability-mcp
评论区
登录后可评论。