前OpenAI研究员离职:训练数据将吸金超千亿

时间:2026年7月30日 地点:旧金山/美国 人物:Andrew Ho(前OpenAI研究员,新公司创始人) 事件详情: 2026年7月30日,仅在OpenAI工作8个月的前研究员Andrew Ho宣布离职并创办新公司,专注生产用于大模型训练的高质量强化学习(RL)数据集。他在X上发布的长文中明确表示,大语言模型的「泛化能力极差」,即使在编程这一被投入数千亿美元资金的领域,模型仍表现出「spiky」(尖刺状)的不稳定能力——他自己仍需手动清理由模型生成的PR。Ho认为,绝大多数具有经济价值的工作场景都未被现有数据集覆盖,光靠scaling已经无法解决问题,未来几年AI实验室将不得不在「精准定向的数据采买」上投入超过1000亿美元。Ho的首批产品瞄准长链路科学推理和日常实验流程,目标是把GPT-5.6 Sol在GeneBench-Pro基准上的通过率从约30%提升到90%以上;公司未来将扩展到化学、材料科学、医疗和白领办公。 背景: 这一立场与剑桥研究员Adam Hunt以及众多OpenAI前员工近期发表的反思形成共振:模型在coding/math等单点突飞猛进,但在语言表达、通用逻辑等维度反而出现退步;「scaling就够了」的AGI假设正在被越来越多的内部人士证伪。Ho的预言并非孤立——Menlo Ventures合伙人Deedy此前发布的全景图显示,28家AI训练数据公司合计年收入已达约85亿美元、总估值接近1000亿美元;Scale AI预计2026年销售额接近40亿美元,Mercor在9个月内从年化5亿增至20亿美元,Handshake在12个月内增长100倍至11亿美元。训练数据已悄然成为继算力、模型之后的AI产业第三大赛道。 影响: - 数据公司估值与融资节奏将再次被点燃,Mercor、Scale AI、Surge AI、Handshake等头部玩家将率先吸纳OpenAI/Anthropic等实验室外溢的定向数据订单 - Scaling假设退潮将迫使Meta、Google、xAI等自研实验室重估训练预算结构,更多资金将从「更大集群」转向「更高质量数据」 - 生物、化学、医疗等高价值垂直领域将出现大量「数据集+评测基准」打包创业公司,复刻Menlo Ventures 1000亿估值赛道逻辑 - 资本市场对前沿实验室万亿美元估值产生怀疑——Ho在同一组推文中指出,1万亿估值需要年化1000-2000亿美元收入配合80%毛利率+20倍市盈率,而Qwen、Kimi等开源追赶者正在让领跑者被迫持续加码下一代训练,形成「利润被自身研发反噬」的囚徒困境 总结: 当「更大模型」不再是AGI的充分条件,AI产业的钱和人才正在向「数据」流动。Andrew Ho这一千亿预言与Deedy发布的1000亿数据赛道全景图相互印证,叠加剑桥、Hunt等独立研究者的「scaling撞墙」观察,标志AI产业正式从「拼参数」阶段迈入「拼数据」阶段。对国内厂商而言,自建数据壁垒(生物信息、具身、行业know-how)将成为下一轮竞争分水岭。 参考来源: - https://the-decoder.com/ex-openai-researcher-bets-100-billion-will-flow-into-training-data-because-scaling-alone-wont-cut-it/ - https://x.com/andrewho03/status/2082615798011744270 - https://x.com/andrewho03/status/2082786931419812338 - https://x.com/RealAdamHunt/status/2082034423344853168 - https://openai.com/index/introducing-genebench-pro/ - https://news.qq.com/rain/a/20260727A089YL00 - https://www.php.cn/faq/2877315.html - https://www.woshipm.com/share/6437483.html - https://the-decoder.com/alibabas-qwen-takes-on-kimi-k3-with-open-weight-qwen-3-8-says-model-is-second-only-to-fable-5/