LLM评测不再玄学:27个benchmark、17倍速并行、Claude Code直接跑

LLM 应用开发最头疼的一步是什么?不是调 prompt,是「怎么证明它真的变好了」。

写个评测脚本容易,但评测结果不稳定、benchmark 换一套就不认识了、不同模型没法横向比——这些问题一叠加,你根本说不清楚这次改动是进步还是退步。

今天挖到一个开源工具,专治这个。

Twinkle Eval:高性能 LLM 评测框架

这是 ai-twinkle/Eval 项目,核心能力是并行 API 调用——同一套评测任务同时发请求给多个模型端点,比串行快 17 倍。内置支持 27 个 benchmark、15 种评测方法(选择题、数学推理、函数调用、长文本理解、RAG、Text-to-SQL 全部覆盖)。

项目自带两个 Claude Code Skill(直接进版控,不需要额外安装):

  • /run-eval:建 config、下数据集、跑评测、读结果、诊断异常,一条指令搞定
  • /add-benchmark:贡献新 benchmark 的完整流程指引

怎么用?

Clone 下来直接用,不需要 pip install 额外装 Skill:

git clone https://github.com/ai-twinkle/Eval
cd Eval
# 然后在 Claude Code 里直接输入:
/run-eval 我要用 TMMLU+ 评测 localhost:8000 上的模型

Skill 会自动识别对话上下文并在需要时加载,也可以手动调斜线指令。

重点:自带诊断逻辑

评测最怕的不是分数低,而是「不知道为什么低」。Twinkle Eval 专门有一章诊断指南:

  • 先看 unparsed_rate,区分「模型真的答错」和「extractor 没抓到输出格式」
  • 列举了 box 未设 system_prompt、推理模型的 think tag、content=null 等常见坑

这个设计思路很对——评测工具的价值不只在于跑,更在于帮你读懂结果。

适合谁用?

如果你在:

  • 做 LLM 微调/压缩,需要量化对比改动的效果
  • 选型阶段,要对 Claude / GPT / Gemini 做横向评测
  • 开发 AI 应用,需要对每次发布做回归测试

Twinkle Eval 的并行能力 + Claude Code Skill 内嵌工作流,可以把「手动跑评测 → 解读结果」压缩成一条 Agent 指令。

目前实测在 MMLU、HumanEval 等主流 benchmark 上都有对齐官方数字,GitHub 持续更新中。

GitHub:https://github.com/ai-twinkle/Eval


GitHub: https://github.com/ai-twinkle/Eval

评论区

0 条评论

登录后可评论。

陈一铭 59 阅读