热门AI工具推荐

焚书AI多模型聚合平台
AI多模型聚合平台( Claude 系列、GPT 系列)支持聊天、搜索、图片、视频、音乐等多种功能;聚合了 Claude 系列(如 Sonnet 5、Opus 5 等)、Gemini 系列、GPT 系列、DeepSeek(搜索模式默认调用 DeepSeek V4 Pro)以及通义千问、Kimi 等数十款国内外主流模型。
AI编程订阅服务,支持多款国产主流编程模型自由切换。
Seedance 2.0AI视频生成
具备卓越的物理真实性和角色一致性,可生成电影级视频内容。
方舟 Agent PlanAI智能体订阅
火山引擎推出的全场景AI智能体订阅服务,通过一个订阅整合5大主流模型和10+AI工具
SpeedAIAI内容检测降重
AI内容检测与降重工具,能有效帮助用户通过论文AI率检测
秒哒AI工具
不懂代码也能开发应用?百度秒哒:无需编程,快速搭建小程序与网站
有戏AIAI漫剧生成工具
全流程AI短剧创作工具,实现从剧本到成片的自动化生产,让“一人即剧组”成为现实。
沁言学术智能科研平台
一站式文献管理与科研写作工具,支持边写作边搜索文献,高效阅读,文献管理,

Dust论文:免反向传播训练Transformer模型

2026年10月5日(论文首发) / HN热议于2026年10月6日 地点 Q Research Lab 官方发布 / Hacker News 等全球AI研究社区 人物 - Samip Dahal(Q Research Lab,论文第一作者) - Bishwas Mandal(共同作者) - Serdar Gülbahar(共同作者) - Akshay Vegesna(共同作者) 事件详情 Q Research Lab 发布新论文《Dust: Pretraining Transformers Without Backpropagation》,提出首个能与反向传播在Transformer预训练中竞争的零阶优化方法。论文用每个token作为虚拟种群成员,在一次前向传播中并行评估数千个虚拟样本,从而高效估计梯度。在大规模种群下,Dust 在多个设置中甚至超过反向传播。 背景 反向传播自深度学习时代以来一直是训练神经网络的主导算法,Transformer 训练硬件与优化器也围绕其演化。零阶优化方法长期被认为难以扩展到大型网络。Q Labs 在 EGGROLL 等现有零阶优化方法的基础上,对权重空间进化策略效率低下的痛点进行重新设计,提出在激活空间做扰动的新范式。 影响 Dust 在 100k 到 20M tokens 的预算范围内测试,反向传播调优后用作基准。在 1M tokens 下,Dust 用 256-1000 个 draws 即可低于反向传播的 loss;扩展到 10M 与 20M tokens 后,与反向传播的差距随种群规模继续收窄。研究团队估计,Dust 比基于权重空间的 EGGROLL 进化策略高效约 10³ 到 10⁴ 倍;更大的模型在 Dust 下种群效率反而更高,243M 参数模型在大多数种群规模下优于其 120 倍小的小模型。论文已开源代码(https://qlabs.sh/research/dust)。 总结 Dust 论文的发布,意味着"零阶优化无法扩展到大型模型"的长期假设被打破——在算力充裕的训练预算下,搜索式 credit assignment 可以达到甚至超过梯度训练。虽然 Dust 尚未宣称要在所有场景替代反向传播,但这一结果为未来硬件与算法设计打开了新的思路,或将在算力驱动的大模型训练中扮演越来越重要的角色。 参考来源 1. https://news.ycombinator.com/item?id=49970871 2. https://qlabs.sh/research/dust 3. https://hn.today/s/dust-pretraining-transformers-without-backpropagation 4. https://gokawiil.com/article/351729 5. https://contentbuffer.com/news/dust-method-matches-backprop-efficiency-transformer-training-2ac688ca 6. https://zeli.app/story/49970871 7. https://news.linxi.com.au/news/dust-algorithm-offers-a-search-based-alternative-to-backpropagation-for-transformer-training