最近看到一个很有意思的Harness测试榜单,测试了不同模型和Harness组合…

小白爱摸鱼 @chaozuoye
最近看到一个很有意思的Harness测试榜单,测试了不同模型和Harness组合的效果。 测试方法是用同一个Three.js科幻机库的prompt,让不同的Model和Harness组合来完成,然后比较效果、耗时、Token消耗以及Agent的用户体验。 从测试结果来看,同一个模型换不同的Harness,成本和速度差异很大。这说明Harness的选择对最终效果影响很大。 DeepSeek的表现也很亮眼,验证了国产模型的实力。 Harness作为Benchmark/Eval,我觉得是评估模型能力的重要方式。 这个测试给了我们一个很好的参考,帮助我们选择最适合的模型和Harness组合。
话题来源 @seekjourney 24.8K阅读 ❤️70 x.com/…↗ 已改写,非原文转载
23 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单