最近在整理自己的模型使用习惯,发现不同任务适合的模型差别挺大的。
先说结论:Kimi K3是目前最强的开源编程模型,GLM-5.3紧随其后。对于简单到中等难度的任务,DeepSeek V4.1 Flash是首选,速度快到离谱,成本也低得惊人。复杂任务就交给Astra。
有个细节挺有意思:Codex配合开源模型效果更好,而Claude Code用同一个模型成本可能翻倍。这说明工具链的选择和模型本身一样重要。
我昨天用Kimi K3跑了一个代码重构任务,大概2000行的Python项目,整个过程不到3分钟就完成了。以前用其他模型至少要等10分钟以上。
DeepSeek V4.1 Flash在日常任务中表现很稳定,特别是那些不需要深度推理的场景,比如数据清洗、格式转换、简单的API调用。速度真的快到让你忘记在等AI。
Astra处理复杂任务时确实更靠谱,特别是那些需要多步骤推理的场景。不过成本也相应高一些,所以我会根据任务复杂度来选择。
GLM-5.3在某些特定场景下表现比Kimi K3还要好,特别是在中文理解和生成方面。如果你的项目涉及大量中文内容,可以考虑优先试试。
工具链的搭配真的很重要,同样的模型在不同的工具里表现可能天差地别。找到适合自己的组合,效率提升不是一点半点。
话题来源 @Yuchenj_UW
90.1K阅读 ❤️1523 x.com/…↗ 已改写,非原文转载
28 浏览 0 评论
0 反应














