时间:2026年7月26日
地点:美国旧金山
人物:YC W26成员Induction Labs联合创始人
事件详情:Induction Labs于2026年7月23日发布Photon-1想象模型(imagination model),这是一种全新的基础模型架构。Photon-1采用稀疏106B-A5B(激活5B)的MoE Transformer结构,训练数据为18年时长的电脑屏幕录像,共计5.75亿帧画面、5520亿个token。关键创新在于训练数据没有任何动作标签。模型仅通过观察人类如何操作电脑、屏幕状态如何从一个画面变化到另一个画面,自主学会了预测下一帧。Photon-1在内部计算机使用基准测试中,超越了谷歌最新一代轻量级模型Gemini 3.1 Flash-Lite,而预训练算力仅为Gemini 3.1 Flash-Lite的三十分之一,部署成本仅为其三分之一。微调后的Photon-1还能模拟台球物理碰撞、下国际象棋,比经过同类微调的通用大模型表现更佳。
背景:当前主流计算机使用模型几乎都采用"人类示范+行为克隆"训练范式,需要人工标注每个时间点的鼠标点击和键盘输入。这一范式存在双重瓶颈:一是需要人类先做一遍,二是需要标注员再标注一遍。Induction Labs提出的想象模型架构绕过了这一困境:Photon-1采用next-latent-token-prediction目标,将每帧压缩为960个离散token(8维向量,每维5种取值),并采用差分潜空间编码器(differential latent encoder)描述帧间差异而非帧内容,从而实现每帧仅2.2KB、超过100倍压缩率。模型从未标注的18年屏幕录像中习得"人在做什么"的概念,而非每个鼠标点击的标签。
影响:
- 训练范式从"标签驱动"向"观察学习"转变,模型在无需动作标注的情况下学到隐式策略(implicit policy)
- 算力效率取得数量级突破,Photon-1用3万GPU小时即击败使用30倍算力训练的Gemini 3.1 Flash-Lite
- 模型具备跨任务泛化能力:可模拟台球物理、下国际象棋、操作ChatGPT,覆盖世界模型三大功能——模拟器、规划器与渲染器
- 4人科技公司YC项目落地,验证了新模型架构在大模型时代的"小而精"路径
- 推动下游Agent研发范式革新,使模仿学习的数据采集成本大幅下降
总结:Photon-1是Induction Labs对AI训练范式的一次颠覆。它用4人YC团队的微薄算力击败了谷歌投入30倍算力的产品级模型,核心秘诀是从人类键盘鼠标动作的标签依赖,转向对屏幕录像长时观察的隐式策略学习。这印证了生成式AI从"教什么学什么"走向"观察世界自我领悟"的新趋势。在世界模型赛道上,Photon-1以远超Gemini 3.1的算力效率证明:观察学习的潜力可能远超行为克隆。
参考来源:
- https://www.inductionlabs.com/news/scaling-video-pretraining
- https://www.marktechpost.com/2026/07/26/induction-labs-photon-1-simulates-desktops-plays-checkers-and-models-billiard-physics-from-one-pretraining-run/
- https://huggingface.co/InductionAILabs/photon-1
- https://arxiv.org/abs/2607.09024
- https://www.tmtpost.com/agent/ai-article?id=19350









