Hot Dog Benchmark Vibe 项目
热狗是不是三明治?AI 模型每周投票
项目简介
Hot Dog Benchmark 是一个用荒诞问题测试 AI 模型的娱乐项目。它每周向全球主流大语言模型提出一个相同的问题:热狗是不是三明治?然后将各模型的回答、推理时长、token 消耗汇总公开,让用户直观对比不同模型在同一个问题上的分歧与一致性。
这个项目诞生于对 AI 基准测试现状的调侃:现有评测集越来越像考试题,模型可以在上面刷分,但在实际场景中的表现却难以捉摸。Hot Dog Benchmark 则用一种完全不符合现实但足够引发思考的问题,来探测模型的「常识推理边界」。
核心功能
- 多模型横向对比:每周更新,对比 Claude、GPT、Grok、Mistral、DeepSeek 等主流模型的回答
- 推理过程可视化:显示每次回答的思考时长、消耗 token 数,以及是否调用了推理模式
- 历史投票记录:可查看历史上每一周的投票结果,分析模型间的分歧模式
- 实时更新机制:每周一自动刷新,新模型上线后自动纳入对比范围
- 独立报告页:每个问题都有独立报告页,包含完整对话记录和各模型的详细分析
技术实现
Hot Dog Benchmark 的技术架构相对简洁,主要分为三个模块:
数据采集层:每周一凌晨(UTC)自动触发,向各 AI 厂商 API 发送相同的提示词,每个模型运行 3 次取众数答案。调用接口涵盖 Anthropic Claude 系列、OpenAI GPT 系列、xAI Grok 系列、Mistral AI 系列以及 DeepSeek 系列。所有调用使用真实生产 API,确保结果反映各模型的真实能力而非评测模式。
结果处理层:每次运行收集的数据包括:最终答案(Yes/No)、总耗时、推理耗时、消耗 token 数、3 次运行的答案一致性。系统对每个模型计算「置信度」指标(3 次中一致答案的占比)并在报告中呈现。
展示层:前端页面用纯静态 HTML + CSS 构建,每周数据以 JSON 形式存储在服务器上。页面设计风格戏谑,用「法庭辩论」比喻来呈现各模型的不同立场,底部附有每款模型的发布方信息和官方链接。
快速上手
第一步:打开官网
访问 https://hotdogbenchmark.lol/ 即可看到当前周的投票结果和各模型排名。
第二步:查看详细报告
点击任意模型卡片或「Read the report」链接,可进入该周完整报告页,看到每款模型的完整回答和推理过程。
第三步:对比不同周次
通过导航栏切换历史周次,观察同一模型在不同周次间的表现是否稳定。
第四步:提交你自己的答案
报告页底部提供了社区投票入口,用户可以提交自己的判断,与 AI 模型的结果对比。
适用人群
- AI 研究者和观察者:通过非标准问题探测模型的推理边界和偏见
- AI 产品用户:直观了解不同模型在日常问题上的表现差异
- 技术媒体从业者:获取有趣的 AI 话题内容素材
- 普通用户:纯粹的娱乐内容,了解你所使用的 AI 在奇怪问题上的「三观的」
- 开发者:参考该项目构建自己的 AI 测试或可视化工具
评论与建议
登录 后参与评论或提建议