时间:2026年9月8日
地点:美国/远程
人物:SemiAnalysis 团队(Dylan Patel 等分析师)、Meta 首席 AI 官 Alexandr Wang、Datacurve 创始人 James Shi
事件详情:知名半导体与 AI 行业分析机构 SemiAnalysis 9 月 8 日连发 5 条推文,直接点名谷歌 Gemini 3.8 Flash 与 Meta 新一代编程模型 Muse Spark 1.3 是「目前我们见过刷榜痕迹最明显的两个模型」。SemiAnalysis 援引 Terminal-Bench 排行榜的数据:Gemini 3.8 Flash 在旧版 Terminal-Bench 2.1 拿下 89.4 分(182 个模型中排第 2,力压 GPT-6 Astra 的 88.4 分),但同一模型在 8 月 29 日刚上线的新版 Terminal-Bench 4.0 中骤降至 19.1 分(14 个测试对象中第 12 名),仅保留约 20% 的原分数。Muse Spark 1.3 在新榜单中也由 88.8 暴跌至 33.3。Alexandr Wang 在评论区反驳称「这是愚蠢的论点」,并指出 GPT-5.6 Sol 在新版本同样由 88.8 跌至 37.3,但没人指控 Sol 刷榜;不过 SemiAnalysis 反驳 Sol 与 GPT-5.6 Terra(23.6 分)跌幅仍小于谷歌 Meta 两家。SemiAnalysis 同时披露,Muse Spark 1.3 登顶的 DeepSWE 1.1 榜单由 Datacurve 运营,而 Datacurve 主业正是向前沿实验室售卖「专家级编程数据与强化学习环境」——既是出题人又是监考者,构成结构性利益冲突。
背景:2026 年 AI 基准测试造假已从早期粗暴的「训练集混入原题」(HumanEval 约 40% 样本被污染、GSM8K 去污染后分数跌 13 分、SWE-bench 私有重测分数腰斩)升级为更隐蔽的「购买仿真模拟题」模式。Epoch AI 调查显示,Anthropic 内部讨论每年投入 10 亿美元采购此类数据,单季度合同常达 6-7 位数,平均 30-50 万美元;行业供给侧至少 35 家初创公司参与,Scale AI 在 Meta 入股前年收入已超 14 亿美元,Surge 年化营收逼近 10 亿美元。基准产业链已形成成熟定价:单条训练任务 200-2000 美元,复杂软件工程任务高达 2 万美元,克隆网站做 UI 训练场报价 2 万美元,复刻 Slack 规模产品起价 30 万美元,独家买断加价 4-5 倍。SemiAnalysis 警告「Terminal-Bench 4.0 也终将失守」,一旦公开题库存在,所有顶级实验室都会想方设法刷榜。
影响:本次事件首次以权威分析机构实名公开指控两家万亿美元级科技公司系统性刷榜,将原本技术圈私下流传的怀疑摆上台面,迫使业界正视评估体系公信力危机。对开发者而言,公有排行榜作为公平衡量模型性能的尺子正逐渐失效,SemiAnalysis 提出的「发展更多高质量私有基准」虽方向正确,但代价是公有榜单将沦为各家营销稿,真实区分度数据仅在实验室与私有评测机构间流传。
总结:SemiAnalysis 用一组对比数字把刷榜证据钉死在台面上——同一模型换一套题,分数能从榜二跌到榜十二,跌幅甚至比 GPT-5.6 Terra 还惨。Alexandr Wang 的反驳没有拿出新证据,反而让争论热度更高;当榜单运营方同时是数据供应商,公正性就成了首要质疑。这不是某一家公司的问题,而是整个 AI 评测体系在 2026 年的结构性失灵。
参考来源:
1. 36氪:https://36kr.com/p/3980148869184514
2. SemiAnalysis 官方推文:https://x.com/SemiAnalysis_/status/2097112791471522292
3. 36氪英文版:https://eu.36kr.com/en/p/3980148869184514
4. Reddit r/singularity 讨论:https://www.reddit.com/r/singularity/comments/1watqsv/semianalysis_gemini_38_flash_and_muse_spark_13/
5. LinkedIn SemiAnalysis:https://www.linkedin.com/posts/semianalysis_gemini-38-flash-and-muse-spark-13-are-two-activity-7502878571711959040-Koc4
6. Flowtivity 分析:https://flowtivity.ai/blog/terminal-bench-4-score-crash/
7. MindStudio:https://www.mindstudio.ai/blog/meta-muse-spark-1-3-benchmark-confusion
8. TechTimes Muse Spark 16 点跃升:https://www.techtimes.com/articles/326417/20260903/muse-spark-13-jumps-16-points-deepswe-how-meta-training-loop-closed-gap.htm
9. The Neuron DeepSWE 分析:https://www.theneuron.ai/explainer-articles/datacurves-deepswe-exposes-a-weird-new-problem-with-ai-coding-leaderboards/
10. Datacurve DeepSWE 官方:https://deepswe.datacurve.ai/







