**核心事实**:2026 年 10 月 6 日,ARC Prize 官方确认将启动对 DeepSeek 9 月 10 日发布的 V4.1 Flash 模型的 ARC-AGI(Verified)基准评估。前代 V4 Flash 0731 在该榜单上以每任务 0.02 美元的极低成本拿到 ARC-AGI-1 89.0%、ARC-AGI-2 61.4% 的成绩,是当前"成本-性能帕累托前沿"的标杆。
**新一代变化**:DeepSeek V4.1 Flash 是 V4 Flash 的多模态升级版,采用非对称模型结构,原生支持图像输入,token 规模较前代多出 29%,上下文窗口达 100 万 token。社区速度测试显示峰值推理速度可达 500 tok/s。
**分析师预期**:长期追踪 ARC-AGI 的分析师 @teortaxesTex 指出,更晚发布的 Dots3-preview 已拿下 77%,因此 V4.1 Flash 在 ARC-AGI-2 上若低于 80% 将"令人失望"。该预测基于 V4.1 在视觉解码和长上下文推理上的相对优势。
**行业意义**:若 V4.1 Flash 真能跨过 80% 大关,将与 GPT-6、Claude Opus、Reflection Beam 等顶级闭源/开源模型正面竞争,并在每任务 0.01-0.04 美元的成本区间继续刷新 AGI 评测的"性能-成本"边界,对全球开源生态格局产生重大影响。
**参考来源**:
1. ARC Prize 官方 X 公告:https://x.com/arcprize/status/2107491194007585239
2. AGI Hunt 详细分析:https://agihunt.info/en/p/1a0ef68ba35a62ae166db37f56a
3. ARC Prize 成绩总表:https://arcprize.org/results
4. DeepSeek V4.1 Flash 官方介绍:https://www.deepseek.com/en/news/deepseek-v4-1-flash/
5. 7minai ARC-AGI 报道:https://7minai.com/news/deepseek-v4-flash-arc-agi-2/
6. ARC Prize 官方榜单:https://arcprize.org/leaderboard
7. Artificial Analysis 评测:https://artificialanalysis.ai/models/deepseek-v4-1-flash
8. AI HOT 精选:https://aihot.virxact.com







