MIT 的 Doodle Agent:让大模型在画布上”梦游”
如果把 Claude 3.5 丢到一张空白画布前,不给它任何提示词,它会画出什么?
MIT 和 Adobe 的研究者们真的做了这个实验,并把代码开源了。Doodle Agent,来自 ICCV 2025 AI4VA Workshop 的明星项目,论文标题叫《Exploring Freeform Visual Generation with Multimodal LLMs》——听起来学术味很浓,但实际玩起来像个有点疯的艺术玩具。
它到底在干嘛?
跟 Midjourney、SD 反着来——Doodle Agent 不等你输入 prompt。它拿起画笔(pen、marker、crayon、spray、fountain 五种),看着当前画布,自己决定下一笔往哪儿画、什么颜色、什么笔触。
每一轮,多模态 LLM 接收一张画布快照,吐出一段 JSON:
- 用哪种笔刷
- RGB 颜色值
- 笔触坐标序列 x/y/t(t 控制绘画速度,1=飞快、5=慢得像在写书法)
- 外加一句「reasoning」解释它为什么这么画
然后 HTML 画布立刻把这一笔画上去,循环往复。你可以随时打断它、加引导问题,它会接着你的话继续「梦游」下去。
为什么设计师该玩玩它?
第一,零 prompt 创作范式。它颠覆了「AI 出图必须先想好描述词」的逻辑,对做品牌视觉、抽象背景、生成艺术素材的设计师来说,是全新的灵感来源。
第二,可控的「机器味」。五种笔刷 + 36 色调色板,配合 t 参数的节奏控制,画出来的东西有种「故意不像 AI」的拙朴感——很适合做独立设计师网站的视觉锚点。
第三,论文级可复现。作者来自 MIT CSAIL 和 Adobe Research,代码只有三个核心 Python 文件(FreeDrawingAgent + DrawingCanvasBridge + Demo),加上 p5.js 前端,clone 下来跑 5 分钟就能看到 Claude 在你浏览器里作画。
怎么用?
基础三步:
git clone https://github.com/YIFANK/DoodleAgent- 在
.env填入 Anthropic API Key(也支持 GPT-4o) python demo_free_canvas.py,浏览器自动弹出画布
想换模型、加新笔刷、改造 prompt 逻辑?所有控制点都集中在 free_drawing_agent.py,130 行左右 Python,新手也能 hack。
适用场景
- 生成艺术/独立设计素材的快速原型
- AI 创造力的教学演示(学生能直观看到 LLM 的「想象过程」)
- 协作式人机绘画的实验(你画一半、AI 接另一半)
- 把 JSON 笔触数据导出当动画或 NFT 序列帧
如果你是那种「想看 AI 真的『懂』艺术」的设计师,这个项目比任何 ChatGPT prompt 教程都更值得周末花两小时折腾。
👇 仓库地址(顺手点个 Star 鼓励 MIT 团队):
https://github.com/YIFANK/DoodleAgent
评论区
登录后可评论。