时间:2026年9月1日
地点:美国西雅图(Ai2 总部)及全球开源社区
人物:Allen Institute for AI(Ai2)研究团队,由研究科学家 Nathan Lambert 等人主导
事件详情:2026年9月1日,艾伦人工智能研究所(Ai2)正式开源 BenchMIRT——一种基于多维项目反应理论(MIRT)的 LLM 基准审计工具,可在"提示级"逐题分析每个基准究竟测了哪些能力。该工具无需预先告诉它哪些基准测什么,便能从数据中自动发现评测背后的"潜在维度"。
背景:BenchMIRT 起源于心理测量学(psychometrics)领域的项目反应理论(IRT)。研究团队用 100 个 LLM、16 个公开基准(含 MMLU-Pro、GPQA、MATH、BBH 等 6 个推理基准,以及 HarmBench、StrongReject、WildJailbreak、BBQ、WMDP、XSTest 等 10 个 Ai2 Olmo 3 安全套件基准)共 34000+ 题的训练数据,训练出该 MIRT 模型。
影响:BenchMIRT 发现多项与传统认知相悖的结果:BBQ(社会偏见测试)实际更多区分模型的"推理能力"而非"安全行为";WMDP(危险知识测试)分数与"通用推理"呈负相关——更强的推理能力反而倾向拒绝提供危险知识,从而拿到高分;HarmBench 的版权相关题目与"通用推理"高度相关,而标准/上下文攻击题目才与"安全"维度对齐。在准度上,BenchMIRT 对未见题目的预测准确率达 79%,比简单基线 70% 高出 9 个百分点;只需 10% 的题目即可获得可靠的模型能力信号,节省高达 90% 的评测算力。
总结:BenchMIRT 把"基准即分数"的黑箱拆解为"逐题→能力→模型"的透明链条,技术报告、数据集与代码均已开源(Hugging Face + GitHub + AllenAI 官网)。该工具将帮助 AI 研究者、模型采购方与监管者重新审视"安全/偏见"分数的真实含义,可能成为 2026-2027 年 AI 评测标准化进程中的关键基础设施。
参考来源:
- Hugging Face 官方博客《BenchMIRT: What are LLM benchmarks actually measuring?》:https://huggingface.co/blog/allenai/benchmirt
- Allen Institute for AI 官方公告:https://allenai.org/blog/benchmirt
- GitHub 代码仓库(allenai/BenchMIRT):https://github.com/allenai/BenchMIRT
- AGI Hunt 报道《AllenAI releases BenchMIRT to dissect LLM benchmark evaluations》:https://agihunt.info/en/p/1a05ef67b602fde13f577734e0e
- AGI Hunt 报道《Ai2 Releases BenchMIRT to Audit Benchmarks, Reveals BBQ Tests Reasoning Not Bias》:https://agihunt.info/en/p/1a05ef6a1fcab0f93fabec2ea7a
- TokenFeed 深度分析《The Benchmarks Were Measuring the Wrong Things》:https://tokenfeed.ai/the-benchmarks-were-measuring-the-wrong-things-surprise
- AIToolly 报道《BenchMIRT: Decoding the True Utility and Validity of LLM Benchmarks》:https://aitoolly.com/ai-news/article/2026-09-02-benchmirt-decoding-the-true-utility-and-validity-of-large-language-model-benchmarks
- AIPulseLab 信号评分《BenchMIRT: What are LLM benchmarks actually measuring?》:https://aipulselab.tech/news/benchmirt-what-are-llm-benchmarks-actually-measuring-362822
- Worldprogramming 全文转载:https://www.worldprogramming.org/posts/benchmirt-what-are-llm-benchmarks-actually-measuring-o7vxm4
- Global AI Watch 战略分析《Allen Institute Introduces BenchMIRT to Audit LLM Benchmarks》:https://global-ai-watch.com/article/allen-institute-introduces-benchmirt-to-audit-llm-benchmarks-2026









