时间:2026年9月6日Wired英文首发,9月7日腾讯新闻、QbitAI等中文媒体跟进,9月10日持续在全球AI研究社区引发讨论。
地点:俄罗斯莫斯科(Mostik总部),瑞士日内瓦(首席科学家Stanislav Smirnov任教的日内瓦大学)。
人物:Stanislav Smirnov(首席科学家,日内瓦大学教授,2010年菲尔兹奖得主);Sasha Malysheva(CEO,"桥梁"方法的主要开发者);Mostik 15人团队,其中12位博士;投资方包括General Catalyst。
事件详情:俄罗斯初创公司Mostik(俄语意为"小桥")开发出一种让两个AI模型不再通过自然语言互相交流、直接交换隐藏状态的全新方案。Mostik团队训练一座"桥梁"模块,负责在两个冻结模型的隐藏状态之间做翻译——发送方不需要微调,接收方也不需要微调,"桥"是整个系统中唯一需要训练的部分。在公开演示中,团队连接两个中国开源权重模型:智谱GLM-5.2(7530亿参数)作为发送方读取问题并完成内部计算,但不再写出任何文字;其隐藏状态通过"桥"传给Qwen-3.5(40亿参数,可在移动设备上运行),由后者逐字写出答案。Mostik公布的数据显示,"桥接"之后Qwen-3.5补上了自身与GLM-5.2之间约50%的性能差距,整体准确率提升约25%,在更高难度任务上小模型成绩最高达到原来的两倍;整套混合系统的推理成本降至完整GLM-5.2独立运行的1/20。Mostik用类似方法在ARC-AGI 3基准上一度冲至榜首,但因相关比赛仍在进行中暂未披露技术细节。
背景:当前主流的多智能体系统依赖"文字接力"——模型A把内部计算压缩成一段token输出,模型B再读回并重新建立内部表示。Mostik指出,这种文字中介机制浪费巨大:模型每生成一个token,输出约17比特,但内部状态高达2MB,相当于"在千维空间思考,却只能通过钥匙孔说话"。不同模型的架构、训练数据、参数规模和内部坐标系各不相同,如何找到两套隐藏空间之间的数学共同基础,本身就是开放难题。
影响:若"桥梁"方案被独立复现并广泛使用,可能重塑多模型协作架构:前沿大模型与生物、物理等专用领域模型高效配对,而不必依赖单一巨型模型包打天下。Mostik正在探索两条延伸路径——一是把"桥"放进蒸馏训练,让学生模型在相同训练预算下更接近教师;二是开发"专业化外挂"小模块,让小模型获得新能力而无需重训整个系统。"桥"的中间通道也为AI可解释性研究提供了新观察点,可通过对照发送、翻译、接收三方状态做干预实验,验证模型行为的因果关系。
总结:菲尔兹奖得主Smirnov领衔的俄罗斯数学家团队Mostik用一座可训练的"桥"让大模型直接共享隐藏状态,绕开文字中介的成本损耗,把推理成本压缩至完整大模型的1/20,性能差距缩小50%,并在ARC-AGI 3上一度登顶。在OpenAI、Anthropic的巨型闭源路线之外,这家公司提供了一种由"模型间通信效率"驱动的新范式。
参考来源:
1. https://www.qbitai.com/2026/09/485108.html - 量子位《菲尔兹奖得主入局大模型!4B手机Qwen+云端GLM刷爆ARC-AGI 3》
2. https://news.qq.com/rain/a/20260907A0APOC00 - 腾讯新闻《菲尔兹奖得主入局大模型!4B手机Qwen+云端GLM刷爆ARC-AGI 3》
3. https://news.qq.com/rain/a/20260906A0BJTO00 - 腾讯新闻《1位菲尔兹奖得主+12位博士,这些俄罗斯数学家训出了顶级AI》
4. https://chinaainews.org/news/fields-medalist-joins-ai-startup-4b-qwen-cloud-glm-achieves-high-score-on-arc-agi-3 - China AI News英文报道
5. https://www.x-techcon.com/article/182835.html - 科技区角《昨晚,硅谷经历了AI诸神之战》
6. https://agihunt.info/p/1a075e25d38f4be4018f326db0c - AGI Hunt《俄罗斯初创 Mostik 让大模型直连隐藏状态,成本降至 1/20》
7. https://huggingnews.com/ai/mostik-latent-bridge-hits-20x-speed-boost-and-arc-agi-leaderboard-win-39857902 - HuggingNews英文报道
8. https://engtechnica.com/?p=72004 - ENGtechnica英文报道









