判断模型这条路,连扩散模型都能走了。Google 的 gemma 官方账号放了个玩法:把 DiffusionGemma 变成 Jev 式的判断模型。
做法比听上去还省。往画布里放一份响应模板,vLLM 只用一个去噪步骤,就能把置信分数和概率分布抽出来,是与否、选择题、评分题三类都吃。生成内容的那种来回迭代全被砍掉,一步到位给答案加概率。
我最惊讶的是"一步"。自回归模型判断要一个词一个词吐,扩散模型这边单次去噪就出分布,路径短了一大截。判断任务本来就只要结论不要过程,这类活落在这两种架构上的性价比差,可能比生成任务上的差距还大。
这一周的判断层消息已经排成串了:多模态开源的、访谈里聊架构的,现在连画图的模型都被拉来当裁判。裁判这个位置正在被各家的存量模型轮着坐,谁的推理便宜谁上。
配上"Fast, efficient, ready to scale"那句,下一步就看有没有人真拿 DiffusionGemma 接进 agent 流程跑工具调用任务,纸面模板和生产判断之间还隔着一段路。
话题来源 @googlegemma
114.7K阅读 ❤️1874 x.com/…↗ 已改写,非原文转载
24 浏览 0 评论
0 反应













