huggingface.co/spaces/FineEnv…
Claude Code、Codex、Hermes、Pi、OpenCode 这些骨架,如今能直接当训练场用,骨架一行不改,训练代码也不改,开源模型和任务集随便换,全开源。
成绩先摆。同一个模型同一套权重,在 Mini-SWE-Agent 下跑出六成二,在 Claude Code 下只有三成三。差距正在于训练那头通常得把骨架重实现一遍,于是多数模型练在一副谁也没发布的架子上。
办法是代理,不是重写。骨架以为自己在连模型接口,其实连的是一个捕获代理。它认得编码 agent 常用的四种格式,OpenAI 的聊天补全与响应、Anthropic 的消息、Gemini 的那套,都收。它转给 vLLM,把采样到的词元编号与对数概率原样记下,再交出序列供 TRL 训练。骨架就此变成了环境,今天有十副骨架从这儿过,一副没改。
奖励这一手也摆开。给"用更少工具调用解题"加一点小奖励,已经解得出来的那些任务上,模型的调用次数少了三成一副,四副骨架都如此,Codex 那副少了一半。
四组对照照录。拿 LFM2.5-2.6B 来练,只在一副骨架里练,主要是那副变好,从三成四到五成八;四副一起练,四副全变好,从四成二到五成四;换成监督微调(SFT),拿三千一百八十九条轨迹喂,停在四成七半,两轮强化学习都比它高。捕获代理在 OpenEnv,训练器在 TRL,任务、监督数据、训练代码和七个练好的模型全放出,上面那个链接是完整指南。
"骨架就是环境,奖励由你定"这半句是全场重心。前面把模型变成 agent 那四件讲的是骨架长什么样,这条讲的是骨架还能当什么用。跟前面把你自己从瓶颈上移开呼应,那条把决定挪进系统,这条把系统本身挪进训练,两头都在往前挪一层。
奖励塑形改出来的那个数我单独记着,调用少三成一副,可骨架从没要求过这件事,这说明约束的自由度在训练者手里,不在骨架手里。
我留的疑问有三处。四种格式之外的骨架怎么接没说;捕获代理的开销占多少没给数;更大模型那批何时上线也没交代。
这周拿自己常用的那副骨架对上号,先跑单副那组,看它练完是不是只在自家变好。
话题来源 @ClementDelangue
97.7K阅读 ❤️1656 x.com/…↗ 已改写,非原文转载
22 浏览 0 评论
0 反应















