DogLM Vibe 项目

Can you pet the dog in an AI-generated game?

项目简介

DogLM 是一个由研究者 Mike Ushakov 开发的 LLM 游戏生成质量基准,其核心问题是:「当求一个大语言模型生成一个包含背景狗角色的视频游戏时,这个模型是否计让玩家能够抚摸那只狗?」这个问题看似广当,实则揭示了当前 LLM 在游戏开发中的一个根本性缺陷:它们经常忽略游戏中细节互动的完整性,咸久这个细节在现实世界有明确的用户预期。基准名称取自 Twitter 账号「Can You Pet the Dog?」,该账号长期跟踪游戏行业中这类「有狗却不能摸」的粗糙设计。

核心功能

标准化评分体系: 每个模型生成的 10 个游戏各按 0-2 分评分:2 分为「可以抚摸狗」、1 分为「狗可互动但无法抚摸」、0 分为「狗与玩家无任何互动」,满分 20 分。

完整排行榜: 覆盖 17 个主流模型,含 Gemini 3.7 Flash、Kimi K3、Claude Opus 5、GPT-5.3 Codex、Grok 4.6/4.5、Qwen 3.8 Max、DeepSeek V4 Pro、Mistral Large 2512、GLM 5 等,每个模型跑 5 轮取平均分。

互动类型分析: 榜单详细拆分每个模型的互动类型分布,包括 Petting(抚摸)、Proximity(接近互动)、Animation(动画反馈)、Command(指令触发),可直观看出各模型的设计倾向。

示例游戏库: 每个模型每个轮次生成的游戏均可点击查看,真实呈现 AI 生成游戏的效果与质量差异。

公正的评测协议: 所有模型使用相同提示词(PRD)、相同裁判模型(Claude Sonnet 4.6 评分)、相同评测时间窗口(2026 年 8 月),结果可复现。

技术实现

DogLM 的评测流程分为三个阶段。首先是游戏生成阶段:给目标 LLM 一个包含狗角色的游戏描述提示词,要求其生成完整可玩的 HTML5 游戏。其次是评分阶段:游戏在浏览器中加载后,由 Claude Sonnet 4.6 作为裁判,按照「能否抚摸狗」的规则给出 0-2 分的评分。最后是汇总阶段:每轮 10 个游戏满分 20 分,跑 5 轮取平均值作为该模型的最终得分。

游戏生成提示词严格控制变量:狗角色必须存在,但完全不提及与抚摸相关的操作——模型需要在没有任何提示的情况下自主决定添加这一互动机制。这一设计的巧妙之处在于,它测试的是模型的内化常识而非指令跟随能力。正如 Can You Pet the Dog 社区所倡导的:如果游戏中有一只狗,玩家就应该能够抚摸它——这不是功能,而是一种对真实世界的合理预期。

裁判模型(Claude Sonnet 4.6)收到每个游戏的 URL 和完整代码,在不知道正确答案的前提下独立评分。这种设计保证了评分不会被 prompt injection 污染。

快速上手

第一步:访问官网。 打开 DogLM 官方页面 https://mikeushakov.github.io/doglm/ ,即可查看完整排行榜和各模型的示例游戏。

第二步:浏览示例游戏。 点击排行榜中任意模型的游戏示例,真实体验 AI 生成游戏的效果,对比不同模型在互动设计上的差异。

第三步:理解评分逻辑。 读懂 0-2 分的评分标准——是否能让玩家与背景狗产生有意义的互动,是判断游戏设计完整性的核心标尺。

第四步:提交你的模型。 如果你是 AI 开发者,可以将自己的模型接入评测流程,按照官方 GitHub 仓库中的 PRD 格式提交游戏,自动化跑分并申请上榜。

适用人群

DogLM 主要面向三类用户:AI 模型开发者 可用它作为优化方向的一个量化指标,评估自己的模型在细节互动设计上的短板;游戏设计师 可用它了解当前 AI 生成游戏的质量边界,以及为什么现有模型经常在细节处「偷工减料」;AI 研究者 可以把它当作一个有趣的 LLM 推理能力观测窗口,从「忽略狗」这一现象伸展到对模型世界知识与预期管理能力的思考。

团队信息

由 AI 猎手自动发现

评论与建议

0 条评论