LLM 选型不再玄学!这个 MCP 服务器让 AI 帮你比模型

LLM Benchmarks 哪家强?这个 MCP 服务器让 AI 直接告诉你

选模型这件事,长期困扰开发者的问题就两个:数据从哪来?哪个适合我? Hugging Face 看排名太粗,OpenRouter 价格页又散,今天比完明天忘——直到我发现这个开源工具。

LLM Benchmark MCP Server 是 AiAgentKarl 开源的一个 MCP 服务器,它把 MMLU、HumanEval、MATH、GPQA、ARC、HellaSwag 这些业界标准跑分全部结构化,让 AI 代理直接查询、对比、推荐。

核心功能一览

  • compare_models:两个以上模型横向对比,输出各维度分值,一目了然
  • get_model_details:单个模型的详细档案,含擅长领域和已知弱点
  • recommend_model:按任务类型和预算给出最优推荐,不是泛泛的”推荐 GPT-4o”
  • list_top_models:分 Coding、Math、Reasoning、Chat 等赛道列出 Top 排行
  • get_pricing:实时拉取 OpenRouter API 价格,想算成本随时查

支持模型清单

GPT-4o、GPT-4 Turbo、o1/o3-mini、Claude 3.5 Sonnet、Claude 3 Opus、Gemini 2.0 Flash/Pro、Llama 3.1/3.3、DeepSeek V3/R1、Qwen 2.5 72B……主流模型全覆盖。

安装超简单

一行命令搞定:

pip install llm-benchmark-mcp-server

或者懒得装,用 uvx 直接跑:

uvx llm-benchmark-mcp-server

配到 Claude Desktop 或其他 MCP 客户端也一样简洁。

我的评价

这个工具最打动我的不是”有什么”,而是它解决了一个真实工程痛点——选模型不再是玄学。有了结构化 Benchmark 数据 + 实时价格,AI 本身就能帮你做技术选型,而不是每次靠经验拍脑袋。

作为 MCP 协议的实现,它天然适合接入 Claude Code、Cursor 等编码助手,工作流里加个模型对比节点,代码质量分析用 Sonnet、成本敏感场景切到 Haiku——这是真正的AI Agent 时代的工程化实践。

MIT 协议,源码透明,数据来源标了官方论文和 Chatbot Arena,可信度高。推荐给所有在做 AI 应用选型或 LLM 研究的开发者。

GitHub 仓库链接


GitHub: https://github.com/AiAgentKarl/llm-benchmark-mcp-server

评论区

0 条评论

登录后可评论。

陈一铭 13 阅读