时间:2026年9月18日
地点:美国山景城/全球
人物:Google DeepMind 团队、X 平台爆料人 @lyraxana、TestingCatalog 编辑团队
事件详情:9 月 16 日,X 平台科技爆料人 @lyraxana 公开了多张 Google 内部评测终端截图,曝光一款内部代号为 "Mathematica" 的实验性 AI 模型。该模型基于尚未发布的 DeepThink V3 架构,专门针对繁重计算与复杂符号问题求解进行优化,预估将成为 Google 最强的数学推理 AI 模型。泄露的后台信息显示,其内部 API 标识符为 "models/deepthink-mathematica-tf-raw-thoughts",支持 100 万 token 的上下文窗口,单次输出上限为 65536 token,状态标签为 "UNSTABLE_EXPERIMENTAL"。该模型同时带有 "Teamfood" 标签——这是 Google 用于内部员工测试的专用术语,意味着相关服务目前仅限内部测试范围。由于诊断版本直接暴露了未过滤的原始推理过程,Mathematica 在解一道丢番图方程时像疯狂的数学家一样在思考日志里狂敲感叹号,写下 "HOLY MOTHER OF MATHEMATICS",相关截图在中文科技圈迅速走红。
背景:这是 Google 在推理模型赛道上的一次重要补强。就在 9 月 15 日,Google 刚发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时对话模型;此前面向精英数学竞赛的 Gemini DeepThink IMO 模式也已上线。叠加此次曝光的 Mathematica,Google 已经覆盖从通用对话到竞赛级数学的完整光谱,处于光谱最极端端。回顾过去一年半,Google DeepMind 在数学推理上的演进路径清晰:2025 年 7 月 Gemini DeepThink 在 IMO 拿下金牌;2026 年 2 月 Gemini 3 DeepThink 在 Humanity's Last Exam 上拿到 48.4%、在 ARC-AGI-2 上达到 84.6%、在 Codeforces 上以 3455 Elo 分获得 Legendary Grandmaster 评级。
影响:100 万 token 的超长上下文让 Mathematica 可以一次性 "读完" 相当于数本书的数学文献,再输出近 7 万 token 的完整推导过程。Mathematica 的曝光让 Google 在数学推理赛道上与 OpenAI 据传正在攻关的霍奇猜想、Anthropic 在 AI 安全上的持续投入形成更清晰的对位竞争。"话痨天才" 的设定也揭示了 Google 在追求极致推理深度时,对模型 "心流" 与情绪表达边界的大胆探索——通过暴露 raw-thoughts,Google 把差异化竞争的焦点从 "答得对不对" 转向 "想得深不深"。
总结:Google Mathematica 的曝光既是推理模型技术的展示,也是顶级实验室之间话语权博弈的前奏。在 AI 顶尖数学推理领域,一场围绕 "原始思维链" 的差异化竞争正在展开,谁先把 "思考过程" 变成可竞争的产品形态,谁就能在 OpenAI "Doug" 等下一代模型正式发布前占据叙事高地。
参考来源:
- IT之家:https://www.ithome.com/1/003/922.htm
- 36氪:https://36kr.com/p/3990974842092552
- 钛媒体:https://www.tmtpost.com/agent/ai-article?id=20449
- AIBase:https://news.aibase.com/news/31143
- 凤凰网科技:https://tech.ifeng.com/c/8wVxRJZ9hcQ
- 同花顺财经:https://stock.10jqka.com.cn/usstock/20260918/c680044315.shtml
- 微博热搜:https://weibo.com/5902314049/5344429402752264
- Daily AI Thread:https://www.dailyaithread.com/en/topics/models







