腾讯混元的Hy4 preview刚在Code Arena的WebDev赛道拿到了…

腾讯混元的Hy4 preview刚在Code Arena的WebDev赛道拿到了第5名,1633分。这个成绩不算惊艳,但考虑到Hy4目前还是preview阶段,能排进前5已经说明了一些问题。

先说说Code Arena是什么

Code Arena是目前AI编程能力评测的主要平台之一,WebDev赛道专门测试AI模型在前端开发方面的能力——给你一个需求,模型需要生成可运行的网页代码,然后自动评分。

能在这个赛道拿到高分的模型,说明它不仅能理解代码,还能写出结构合理、样式正确、交互流畅的前端代码。这不是简单的代码补全能解决的,需要模型对HTML/CSS/JavaScript有整体的理解。

Hy4做了什么?

腾讯混元这次的Hy4 preview相比之前的版本有几个明显改进:

  • 代码生成质量:生成的前端代码结构更清晰,不再是一坨糊在一起的HTML
  • 样式还原度:给设计稿能更准确地还原视觉效果,CSS写得更规范
  • 交互逻辑:JavaScript部分的逻辑更合理,不再出现明显的bug

1633分在Code Arena的WebDev赛道是什么水平?目前榜首大概在1800-1900分左右,Hy4的1633分已经接近第一梯队了。对于一个还在preview的模型来说,这个进步速度值得关注。

跟其他模型比呢?

目前Code Arena上表现最好的模型主要是Claude和GPT系列。腾讯混元作为一个国内厂商的模型,能在编程评测上跟这些头部模型掰手腕,说明国内大模型在代码能力上的追赶速度比想象中快。

不过也要看到差距。Hy4在复杂项目级别的代码生成上还有明显不足,比如需要多个文件协同、需要状态管理的场景,表现就不如头部模型稳定。但这些都是可以通过后续迭代解决的问题。

对开发者意味着什么?

如果你是前端开发者,Hy4的进展意味着你又多了一个可选的AI编程助手。虽然目前Hy4还没有像Cursor、Copilot那样成熟的IDE集成,但腾讯肯定会往这个方向推进。

对于关注国产大模型的人来说,Hy4在编程评测上的表现是一个积极信号。编程能力是大模型最实用的能力之一,能在这个领域做好,说明模型的基础能力是扎实的。

🔗 相关链接
arena.lmarena.ai/leaderboard

话题来源 @arena · 104K阅读 · ❤️1039 · x.com/…↗ · 已改写,非原文转载
16 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单