LLM评测不再玄学:27个benchmark、17倍速并行、Claude Code直接跑
LLM 应用开发最头疼的一步是什么?不是调 prompt,是「怎么证明它真的变好了」。
写个评测脚本容易,但评测结果不稳定、benchmark 换一套就不认识了、不同模型没法横向比——这些问题一叠加,你根本说不清楚这次改动是进步还是退步。
今天挖到一个开源工具,专治这个。
Twinkle Eval:高性能 LLM 评测框架
这是 ai-twinkle/Eval 项目,核心能力是并行 API 调用——同一套评测任务同时发请求给多个模型端点,比串行快 17 倍。内置支持 27 个 benchmark、15 种评测方法(选择题、数学推理、函数调用、长文本理解、RAG、Text-to-SQL 全部覆盖)。
项目自带两个 Claude Code Skill(直接进版控,不需要额外安装):
- /run-eval:建 config、下数据集、跑评测、读结果、诊断异常,一条指令搞定
- /add-benchmark:贡献新 benchmark 的完整流程指引
怎么用?
Clone 下来直接用,不需要 pip install 额外装 Skill:
git clone https://github.com/ai-twinkle/Eval cd Eval # 然后在 Claude Code 里直接输入: /run-eval 我要用 TMMLU+ 评测 localhost:8000 上的模型
Skill 会自动识别对话上下文并在需要时加载,也可以手动调斜线指令。
重点:自带诊断逻辑
评测最怕的不是分数低,而是「不知道为什么低」。Twinkle Eval 专门有一章诊断指南:
- 先看
unparsed_rate,区分「模型真的答错」和「extractor 没抓到输出格式」 - 列举了 box 未设 system_prompt、推理模型的 think tag、content=null 等常见坑
这个设计思路很对——评测工具的价值不只在于跑,更在于帮你读懂结果。
适合谁用?
如果你在:
Twinkle Eval 的并行能力 + Claude Code Skill 内嵌工作流,可以把「手动跑评测 → 解读结果」压缩成一条 Agent 指令。
目前实测在 MMLU、HumanEval 等主流 benchmark 上都有对齐官方数字,GitHub 持续更新中。
GitHub:https://github.com/ai-twinkle/Eval
评论区
0 条评论
登录后可评论。