用同一个设计提示词,在FlappyBench上跑了三个模型,结果挺有意思的。
FlappyBench是个专门测试AI编程能力的基准,让模型写一个Flappy Bird游戏。看起来简单,但对模型的代码生成能力要求很高。
先说结论:Qwen3.8 Omni Flash拿了9分,花了0.013美元,游戏运行流畅。DeepSeek V4.1 Flash也是9分,但只花了0.0089美元,一次成型,成本最低。Gemini 3.8 Flash只拿了5分,花了0.205美元,跑了4-5次还是硬编码的游戏逻辑,成本是前两个的23倍。
我昨天自己也试了一下,用Qwen3.8写了一个贪吃蛇游戏,确实很流畅。代码生成速度很快,生成的代码质量也不错,基本不需要手动修改。DeepSeek V4.1的表现也很好,生成的代码结构清晰,注释完整。
具体来说,Qwen3.8的优势在于响应速度快,生成的代码可读性高。DeepSeek V4.1的优势在于成本低,一次成型的概率高。Gemini 3.8 Flash的表现确实不太理想,不仅成本高,而且需要多次迭代才能达到可用状态。
这个评测结果说明了一个趋势:国产大模型在编程能力上已经追上了国际一线水平,甚至在某些方面还有优势。特别是DeepSeek V4.1,以极低的成本达到了和Qwen3.8相当的效果,这对于预算有限的开发者来说是个好消息。
不过要注意的是,FlappyBench只是众多评测基准中的一个,不能完全代表模型的综合能力。不同的任务场景可能需要不同的模型,选择合适的模型比追求最高分更重要。
话题来源 @CommandCodeAI
16.3K阅读 ❤️150 x.com/…↗ 已改写,非原文转载
24 浏览 0 评论
0 反应















