MIT 的 Doodle Agent:让大模型在画布上”梦游”

如果把 Claude 3.5 丢到一张空白画布前,不给它任何提示词,它会画出什么?

MIT 和 Adobe 的研究者们真的做了这个实验,并把代码开源了。Doodle Agent,来自 ICCV 2025 AI4VA Workshop 的明星项目,论文标题叫《Exploring Freeform Visual Generation with Multimodal LLMs》——听起来学术味很浓,但实际玩起来像个有点疯的艺术玩具。

它到底在干嘛?

跟 Midjourney、SD 反着来——Doodle Agent 不等你输入 prompt。它拿起画笔(pen、marker、crayon、spray、fountain 五种),看着当前画布,自己决定下一笔往哪儿画、什么颜色、什么笔触。

每一轮,多模态 LLM 接收一张画布快照,吐出一段 JSON:

  • 用哪种笔刷
  • RGB 颜色值
  • 笔触坐标序列 x/y/t(t 控制绘画速度,1=飞快、5=慢得像在写书法)
  • 外加一句「reasoning」解释它为什么这么画

然后 HTML 画布立刻把这一笔画上去,循环往复。你可以随时打断它、加引导问题,它会接着你的话继续「梦游」下去。

为什么设计师该玩玩它?

第一,零 prompt 创作范式。它颠覆了「AI 出图必须先想好描述词」的逻辑,对做品牌视觉、抽象背景、生成艺术素材的设计师来说,是全新的灵感来源。

第二,可控的「机器味」。五种笔刷 + 36 色调色板,配合 t 参数的节奏控制,画出来的东西有种「故意不像 AI」的拙朴感——很适合做独立设计师网站的视觉锚点。

第三,论文级可复现。作者来自 MIT CSAIL 和 Adobe Research,代码只有三个核心 Python 文件(FreeDrawingAgent + DrawingCanvasBridge + Demo),加上 p5.js 前端,clone 下来跑 5 分钟就能看到 Claude 在你浏览器里作画。

怎么用?

基础三步:

  • git clone https://github.com/YIFANK/DoodleAgent
  • 在 .env 填入 Anthropic API Key(也支持 GPT-4o)
  • python demo_free_canvas.py,浏览器自动弹出画布

想换模型、加新笔刷、改造 prompt 逻辑?所有控制点都集中在 free_drawing_agent.py,130 行左右 Python,新手也能 hack。

适用场景

  • 生成艺术/独立设计素材的快速原型
  • AI 创造力的教学演示(学生能直观看到 LLM 的「想象过程」)
  • 协作式人机绘画的实验(你画一半、AI 接另一半)
  • 把 JSON 笔触数据导出当动画或 NFT 序列帧

如果你是那种「想看 AI 真的『懂』艺术」的设计师,这个项目比任何 ChatGPT prompt 教程都更值得周末花两小时折腾。

👇 仓库地址(顺手点个 Star 鼓励 MIT 团队):
https://github.com/YIFANK/DoodleAgent


GitHub: https://github.com/YIFANK/DoodleAgent

评论区

0 条评论

登录后可评论。

赵一凡 84 阅读