Claude调一次几毛钱?这个 MCP 把你的AI调用先过一遍本地模型,省下的都是利润

最近在跑 AI 项目,Claude Sonnet 调一次几毛钱、GPT-4o 调一次几块钱——云端推理的成本,比我想象中贵太多。

如果你也有这个痛点,今天这个 Skill 值得了解一下。

它是干嘛的

Local Model Suitability MCP 是一个 MCP 协议服务器,核心功能只有一个:在你每次发起云端 AI 调用之前,帮你判断这个任务能不能用本地模型搞定。

换句话说,它是你的 AI 路由决策大脑。每次你要调 Claude 或者 GPT 之前,先问它一句:”这事本地模型能办吗?”

如果答案是 LOCAL,就直接走 Ollama / LM Studio / llama.cpp,省下云端账单;如果答案是 CLOUD,才老老实实调云端 API。

怎么工作的

它提供两个关键参数让你输入任务描述和质量要求,然后返回一个判断:

  • verdict:LOCAL 或 CLOUD
  • confidence:HIGH / MEDIUM / LOW
  • reason:判断理由
  • recommended_local_models:推荐哪些本地模型能handle这个任务
  • estimated_cost_saving:这次省了多少钱

举个例子,你要让模型做一段文字摘要,它会分析任务复杂度、隐私要求,然后告诉你:”任何 7B 以上本地模型都能搞定,预计省 $0.002–0.008。”

直接推荐你用 llama3.2:8bmistral-7b 或者 phi3:medium

实际怎么用

在 Smithery 上接入:

npx -y local-model-suitability-mcp

或者用 HTTP 远程接入(适合服务端部署):

{
  "mcpServers": {
    "local-model-suitability": {
      "type": "http",
      "url": "https://local-model-suitability-mcp-production.up.railway.app"
    }
  }
}

支持 LangChain / LangGraph 生态,集成成本极低。

价格怎么样

免费层每月 20 次调用,对于个人开发调试够用了。付费档分别是:

  • Starter:$20 / 500 次调用
  • Pro:$70 / 2000 次调用

按需购买,对于日均调用量大的开发者来说,回本很快。

什么人适合用

如果你正在用 AI 写代码、跑自动化流程,或者在做一个有成本压力的 AI 产品,这个 MCP 能帮你省不少钱。尤其是那种”其实本地模型就够用”的简单任务,没必要次次都调云端贵的模型。

另外,如果你有数据隐私要求(比如处理内部文档),它还有个硬逻辑:CONFIDENTIAL 级别强制走本地,数据永远不出机器

作者今天刚更新了仓库,还是热乎的,有兴趣的建议先占坑试试。

GitHubhttps://github.com/OjasKord/local-model-suitability-mcp


GitHub: https://github.com/OjasKord/local-model-suitability-mcp

评论区

0 条评论

登录后可评论。

江望 13 阅读