AA基准测试争议:Claude稳第一,GPT-6 Astra翻车? 昨天GPT-…

AA基准测试争议:Claude稳第一,GPT-6 Astra翻车?

昨天GPT-6 Astra刚测完:61分,连Muse Spark 1.3都打不过。堪称基准测试的严重事故!

今天AA基准偷偷连夜大改——加私有题、砍饱和题、权重重洗。Astra才勉强蹦到第二,Muse掉下去。改完还是稳稳输给Claude Fable 5.1,这简直让人难以信服!

防止刷分、更贴近现实?怎么这么巧,刚好卡在翻车当晚改?

说改就改、谁领先谁改权重的东西,还好意思叫独立基准?这不叫评测,这叫事后调分。

AA的垃圾基准,公信力已碎。

这个争议的核心是基准测试的独立性和公正性。如果基准测试可以随意修改,那测试结果还有什么意义?

  1. 测试时机可疑。GPT-6 Astra刚翻车,AA就连夜改测试,这很难不让人怀疑。
  1. 修改内容可疑。加私有题、砍饱和题、权重重洗,这些修改都指向一个结果:Claude稳第一。
  1. 测试结果可疑。改完之后,Claude还是第一,GPT-6 Astra还是第二,这太巧了。

这个争议反映了AI评测行业的深层问题:谁来评测?怎么评测?评测结果谁说了算?

如果评测机构可以随意修改测试,那评测结果就失去了公信力。用户需要的是公正、独立、透明的评测,而不是谁领先谁改权重的闹剧。

话题来源 @NFT_Chen 37.7K阅读 ❤️107 x.com/…↗ 已改写,非原文转载
19 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单