AA基准测试争议:Claude稳第一,GPT-6 Astra翻车?
昨天GPT-6 Astra刚测完:61分,连Muse Spark 1.3都打不过。堪称基准测试的严重事故!
今天AA基准偷偷连夜大改——加私有题、砍饱和题、权重重洗。Astra才勉强蹦到第二,Muse掉下去。改完还是稳稳输给Claude Fable 5.1,这简直让人难以信服!
防止刷分、更贴近现实?怎么这么巧,刚好卡在翻车当晚改?
说改就改、谁领先谁改权重的东西,还好意思叫独立基准?这不叫评测,这叫事后调分。
AA的垃圾基准,公信力已碎。
这个争议的核心是基准测试的独立性和公正性。如果基准测试可以随意修改,那测试结果还有什么意义?
- 测试时机可疑。GPT-6 Astra刚翻车,AA就连夜改测试,这很难不让人怀疑。
- 修改内容可疑。加私有题、砍饱和题、权重重洗,这些修改都指向一个结果:Claude稳第一。
- 测试结果可疑。改完之后,Claude还是第一,GPT-6 Astra还是第二,这太巧了。
这个争议反映了AI评测行业的深层问题:谁来评测?怎么评测?评测结果谁说了算?
如果评测机构可以随意修改测试,那评测结果就失去了公信力。用户需要的是公正、独立、透明的评测,而不是谁领先谁改权重的闹剧。
19 浏览 0 评论
0 反应











