一条 两千多赞的预告把今晚的 AI 前沿又推前了一步:我们搞定了不用反向传播预训练 transformers——用 zeroth-order 优化,不需要 backprop,"optimization 研究里许多核心假设完全错了"。
为什么这条值得单独立帖说。因为反向传播是深度学习四十年的基石——任何神经网络的训练都靠梯度下降传到每一层权重:前向算损失、反向算梯度、按梯度调权重。不需要梯度的预训练意味着这条训练基础上的某些假设被推翻了。
它短期影响是哪里:ZOO(zeroth-order optimization)只评估函数不计算梯度,对不能直接算梯度的硬件特别友好——黑盒芯片、模拟电路、某些神经形态芯片都难算梯度;不需要梯度,预训练就能在这些设备上跑。这对边缘推理、低功耗、长记忆推理这一类的下一步都可能是新地基。
把它放进今晚一直在讲的算力侧效率突破的坐标系看:DSec 把沙箱基础设施做到每秒 5000 次新建;KDA 让 agent 自己改内核提速 2.96 倍;OpenAI 一边烧钱一边把收入翻倍;今天的 zeroth-order 预训练,是另一个方向上的突破——训练方法学本身。
三件事拼在一起:运行时、模型本身、训练方法都在变,AI 这条线不是一条赛道,是同时在变的几条。
留一格清楚的边界:这是一篇"paper out soon"的预告,原文未发,所以暂时不能验证 zeroth-order 预训练是否真能在规模上匹敌 backprop——历史上有过几次不用梯度做类似事情的结果,规模一上来就被打回;优化研究里的核心假设是不是真的错了,看完整论文再下结论更稳。
给最近在盯前沿的人一句落地的:今天先不看论文,先看一件事——如果 zeroth-order 预训练是真的,今天所有以反向传播为假设做的训练优化、研究、芯片设计、推理路径都要重审。换句话说,它的价值不在于它能马上替代谁,而在于它打开了一扇本来锁着的门。
新方法还在路上,比结论更重要的是它在问新问题;真做 AI 路线图的人,今天可以问自己一句:我现在的方案假设了反向传播吗?如果是——这是一种假设,假设可以被推翻,问题才是真实的进步。














