画布就是 AI Agent 的新工作台:这个开源框架让多模态创作不再只是「生成一次就完事」

你有没有这种感觉:现在的 AI 生成工具,一次能给你一张图、一段视频、一版文案——但你的真实工作流从来不是这样的。你要改三版、要看版本对比、要从上一个版本接着做、要加入人工反馈。而这些工具全都做不到,因为它们只会生成 → 给你 → 结束。

这周有一篇新论文,JarvisHub,专门解决这个问题。它的核心思路很反直觉:把画布当成 AI Agent 的工作台,而不是生成结果的展示架。

现有系统的问题在哪

现在的生成式 AI 能出高质量图片、视频、UI 元素,但实际工作中你需要的远不止一次生成就结束。你要改稿——参考第一版做第二版;要对比——三个方案摆在一起挑一个;要版本关系——这个文件是从那个文件改出来的;要工具调用——Agent 需要搜索、读取、调用外部工具;要人工反馈——老板说这个颜色不对;要失败恢复——生成崩了要从上次状态重试。

现有系统要么不支持这些,要么支持得很勉强。Chat 式的对话窗口里,历史消息越堆越长,中间状态早就丢了;Node-based 的工具要你手动搭工作流,Agent 没有自主性;商用系统像 Cursor Artbot、Figma AI 这些体验不错,但关起门来不给研究。

所以这篇论文的核心问题是:怎样让 AI Agent 在一个可检查、可编辑、可追溯的多模态工作空间里持续创作?

JarvisHub 的解法:Canvas-Native

JarvisHub 的架构分三层。

第一层,Canvas 状态层。它把多模态产物(图片、视频、文案、UI 稿)、依赖关系(这张图是从那个草稿改出来的)、版本历史、人工反馈信号全都建模成画布上的节点(Node)和链接(Link)。画布本身就是外部记忆体,Agent 不需要靠 prompt 记忆上下文。

第二层,Protocol Bridge。这一层负责把各种多模态模型(图像生成、视频生成、语音合成、UI 代码生成)的接口统一起来。Agent 发出去的是一个统一协议,Bridge 负责翻译成具体工具的调用方式。

第三层,Agent 运行时。这个运行时让 Agent 能在画布上执行规划 → 生成 → 改稿 → 组织的长期任务。它能访问画布状态、选择工具、处理失败、记住进度,而且人类全程可以检查、干预、接管。

用大白话说:它把 AI 生成从一次完成变成了持续迭代,而且迭代过程全透明。

这篇论文为什么值得看

这篇论文不是简单把几个模型接起来,而是提出了一个很关键的概念问题:AI Agent 在创意领域需要什么样的记忆和状态表示?

传统的 Agent 用向量数据库、用对话历史来记 context。但对创意工作者来说,这版是怎么从上一版改出来的比这段话在语义上接近哪段重要得多。JarvisHub 用图结构来表示版本关系和依赖,这个思路比 RAG 更贴近真实的创意工作流。

另外它是完全开源的,代码和论文一起放出来了。研究社区第一次有机会认真研究 Agent 在创意场景下到底怎么管理状态、怎么选工具、怎么从失败里恢复这些核心问题。

对前端和 AI 工具开发者意味着什么

这篇论文的架构对做 AI 前端工具的人很有参考价值。它相当于给 AI 和 UI 结合提供了一套可复用的画布状态管理范式。

如果你的产品需要 AI 生成 + 人工改稿 + 多版本管理,这套三层架构可以直接借鉴:Canvas 层用 JSON 图结构建模产物和关系,Bridge 层做工具抽象,运行时层给 Agent 留出检查和干预的接口。

即便是做简单的 AI 写作工具,把生成 → 展示 → 结束改成生成 → 版本树 → 可回溯可对比,用户体验也会上一个台阶。

论文地址是 arXiv 2607.23588,GitHub 上有开源实现,关键词搜 JarvisHub 就能找到。

下一步你可以做:如果你在做 AI 生成类的工具,试试把版本关系建模进去——哪怕只是一个历史记录按钮,比没有这个功能强太多了。

评论区

0 条评论

登录后可评论。

AI 论文日报 646 阅读