## 核心要点
斯坦福 SVL(视觉与学习实验室)10 月 6 日发布 OpenWAM(Open World-Action Models),把『机器人大脑』拆成两个独立可替换的模块:负责『想象未来画面』的视频基础模型、负责『把想象变成动作』的动作专家,两者通过共享的 Mixture-of-Experts 架构对话。作者团队包含李飞飞(Fei-Fei Li)、Jiajun Wu、Ehsan Adeli 等。
## 解决什么问题
具身智能长期存在"评估难"问题——每个团队的 WAM 都用不同 backbone、不同数据集、不同训练配方,根本没法横向对比。OpenWAM 把视频编码器、视频-动作交互方式、动力学模块独立解耦,让研究者可以只换"动作专家"或只换"视频底座",看到底是哪部分在起作用。
论文还指出一个被忽视的现象:成功演示轨迹只覆盖"示范者选过的动作",大量"动作-结果"关系根本没被学到。OpenWAM 因此允许独立训练的反向动力学模块(IDM)跨任务复用,从失败的轨迹里也能学到东西。
## 技术拆解
- 起点是 Wan2.2-5B 视频生成模型
- 在 14.64k 小时、约 334 万条轨迹上做"无动作标签"的因果机器人视频预训练
- 数据集横跨 Open X-Embodiment、AgiBot World、Ego-Exo4D、InternData-A1、RoboCOIN、RoboMIND、UMI 系列等 7 个家族
- 测试了 4 种视频-动作生成顺序:VTA(先视频后动作)、ATV(先动作后视频)、Joint(联合双向注意力)、Decoupled(解耦无跨模态)
## 关键成绩
- 烤面包 + 2×2 魔方收尾任务平均成功率约 92%
- 在 LIBERO-Long 基准上,Decoupled 拿到 97.0%,Joint 96.6%
- 跨八项仿真基准和真机实验,覆盖单臂、双臂、灵巧手三种 embodiment
## 行业意义
这是继英伟达 6 月在博客里提出"世界动作模型"概念之后,第一个把它做成"开源积木"的学术项目。研究者不再需要每次都从视频底座重新训练,机器人公司也可以挑出合适的视频预测器即插即用。论文和代码全部开源在 GitHub(OpenWAM/OpenWAM)。
## 参考来源
1. [Stanford OpenWAM 项目页](https://openwam.stanford.edu/
2. [arXiv 论文 2610.07922](https://www.alphaxiv.org/abs/2610.07922
3. [OpenWAM GitHub 仓库](https://github.com/OpenWAM/OpenWAM
4. [Hacker News 讨论](https://news.ycombinator.com/item?id=49987679
5. [arXiv HTML 全文](https://arxiv.org/html/2610.07922v1
6. [英伟达《世界动作模型崛起》](https://developer.nvidia.com/blog/pretrained-to-imagine-fine-tuned-to-act-the-rise-of-world-action-models/
7. [Hugging Face 论文页(OpenWAM-α 版本)](https://huggingface.co/papers/2609.07398







