2026年10月5日(论文首发) / HN热议于2026年10月6日
地点
Q Research Lab 官方发布 / Hacker News 等全球AI研究社区
人物
- Samip Dahal(Q Research Lab,论文第一作者)
- Bishwas Mandal(共同作者)
- Serdar Gülbahar(共同作者)
- Akshay Vegesna(共同作者)
事件详情
Q Research Lab 发布新论文《Dust: Pretraining Transformers Without Backpropagation》,提出首个能与反向传播在Transformer预训练中竞争的零阶优化方法。论文用每个token作为虚拟种群成员,在一次前向传播中并行评估数千个虚拟样本,从而高效估计梯度。在大规模种群下,Dust 在多个设置中甚至超过反向传播。
背景
反向传播自深度学习时代以来一直是训练神经网络的主导算法,Transformer 训练硬件与优化器也围绕其演化。零阶优化方法长期被认为难以扩展到大型网络。Q Labs 在 EGGROLL 等现有零阶优化方法的基础上,对权重空间进化策略效率低下的痛点进行重新设计,提出在激活空间做扰动的新范式。
影响
Dust 在 100k 到 20M tokens 的预算范围内测试,反向传播调优后用作基准。在 1M tokens 下,Dust 用 256-1000 个 draws 即可低于反向传播的 loss;扩展到 10M 与 20M tokens 后,与反向传播的差距随种群规模继续收窄。研究团队估计,Dust 比基于权重空间的 EGGROLL 进化策略高效约 10³ 到 10⁴ 倍;更大的模型在 Dust 下种群效率反而更高,243M 参数模型在大多数种群规模下优于其 120 倍小的小模型。论文已开源代码(https://qlabs.sh/research/dust)。
总结
Dust 论文的发布,意味着"零阶优化无法扩展到大型模型"的长期假设被打破——在算力充裕的训练预算下,搜索式 credit assignment 可以达到甚至超过梯度训练。虽然 Dust 尚未宣称要在所有场景替代反向传播,但这一结果为未来硬件与算法设计打开了新的思路,或将在算力驱动的大模型训练中扮演越来越重要的角色。
参考来源
1. https://news.ycombinator.com/item?id=49970871
2. https://qlabs.sh/research/dust
3. https://hn.today/s/dust-pretraining-transformers-without-backpropagation
4. https://gokawiil.com/article/351729
5. https://contentbuffer.com/news/dust-method-matches-backprop-efficiency-transformer-training-2ac688ca
6. https://zeli.app/story/49970871
7. https://news.linxi.com.au/news/dust-algorithm-offers-a-search-based-alternative-to-backpropagation-for-transformer-training







