字节被曝训练10万亿参数大模型 张一鸣反对蒸馏

时间:2026年8月7日 地点:中国北京(字节跳动总部)/ 中国杭州(阿里巴巴总部)/ 北京月之暗面 人物:字节跳动;字节跳动 Seed Foundation 负责人项亮;字节跳动大语言模型预训练数据负责人沈科;字节跳动创始人张一鸣;字节跳动 CEO 梁汝波;月之暗面;阿里巴巴 事件详情: 据英国《金融时报》援引知情人士报道,字节跳动正在预训练一款参数量高达 10 万亿的 AI 模型,规模约为月之暗面 Kimi K3 的三倍,超过外界对 Anthropic Mythos 5 模型约 8 万亿参数的预估。该模型仍处于早期阶段,进行为期 3 到 6 个月的预训练,之后才会进入微调与发布阶段,具体模型尺寸将在后期阶段确定。该项目由 Seed Foundation 负责人项亮主导,与大语言模型预训练数据负责人沈科合作。在两周前的 Seed 全员会上,张一鸣向团队明确表态:即使不蒸馏意味着短期内技术落后,也不愿走捷径。字节跳动 CEO 梁汝波在 8 月 6 日的全员会上承认豆包在 AI Coding 方面并不算突出,并以 Claude Code 为例。 背景: 模型蒸馏(Model Distillation)通过让小模型学习大模型输出来压缩能力,可在短期内以更低成本获得接近教师模型的指标,但本质上仍是复制而非创新,难以实现真正的超越。在国内大模型竞争白热化、算力与数据成本持续攀升的背景下,「是否走蒸馏路线」已成路线分歧的焦点。同期,Anthropic Mythos 5 因安全顾虑被暂时禁用,Fable 5 也因安全问题被美国政府勒令停服,海外前沿模型频繁「暴雷」为国内厂商打开罕见的窗口期。月之暗面 Kimi K3、阿里 Qwen 3.8 Max 等近期在多项基准上表现抢眼,字节跳动被视为国内最激进押注超大规模模型的公司。 影响: - 字节 10 万亿参数模型一旦如期推进,将刷新国内已发布模型规模纪录,使中国大模型首次在参数维度具备与海外顶尖模型正面竞争的基础。 - 张一鸣公开反对蒸馏并接受短期技术落后,可能在国内头部厂商间形成示范效应,推动阿里、月之暗面、智谱等重新评估技术路线,长期或重塑国内大模型竞争格局。 - 字节把 Coding 提到战略高度,叠加豆包 B 端化与飞书并入,火山引擎、飞书、豆包三端资源整合形成的「算力+数据+Coding」组合,将成为后续 6-12 个月观察其商业化突破的重要窗口。 - 10 万亿参数对算力、电力和高速网络的消耗巨大,将进一步抬升国内 AI 算力基建与电力供给的紧张度,并带动上游光模块、液冷、智算中心相关产业链的需求。 总结: 字节跳动以 10 万亿参数这一「巨无霸」级别的训练规模和明确拒绝模型蒸馏的姿态,把国内大模型竞争推向新的拐点。张一鸣强调 Coding 与长期投入、梁汝波坦承豆包短板,体现出字节在产品与训练两端同时调整的决心。在海外前沿模型因安全原因受限、国内 Kimi K3 与 Qwen 3.8 Max 强势崛起的窗口期,字节正尝试以「参数规模+不抄近路」重新定义下一阶段的竞争筹码,最终能否兑现还有待 3-6 个月预训练结果与商业化表现来检验。 参考来源: - https://zhidx.com/p/583239.html - https://so.html5.qq.com/page/real/search_news?docid=70000021_1846a76196464852 - https://so.html5.qq.com/page/real/search_news?docid=70000021_7016a75726310352 - https://new.qq.com/rain/a/20260807A04VHM00 - https://new.qq.com/rain/a/20260808A02XOG00 - http://www.aidianping.com/