PaperBanana Skill:一键生成论文级学术图表的多 Agent 神器

PaperBanana Skill:一键生成论文级学术图表的多 Agent 神器

AI 学术写作场景中,”有一张好图胜过千言万语”——但手动绘制一张符合期刊要求的方法图、系统架构图或实验结果图,往往要花掉研究者数小时。PaperBanana 正是为解决这个痛点而生:它将一段方法论文字或图表意图,自动转化为可直接投稿的publication-ready 学术配图。自 2026 年初开源以来迅速走红,成为当前 AI 辅助科研工具链中增长最快的 Skill 之一。

核心能力上,PaperBanana 采用五阶段多 Agent 流水线和迭代精修机制:Retriever(检索相关上下文)→ Planner(VLM 规划图像结构)→ Stylist(风格校准)→ Visualizer(生成图像)→ Critic(质量打分与反馈)。这个流程确保生成结果既忠实于原始文本意图,又符合学术出版的美学规范。此外,它内置了 CLI、Python API 和 MCP Server 三种调用形态,可以无缝集成到 Claude Code、Cursor、Codex 等主流 Coding Agent 中,以 skill 插件形式使用。

截至 2026-09-08,PaperBanana 在 GitHub 累计获得约 2.2k Stars、330 次 Fork,PyPI 月下载量达 9.9k 次;MCP 生态平台 PulseMCP 估算其相关服务器累计访问量超 44.4k 次/月。OpenClaw 官方市场 ClawHub 上的 skill 版本安装量已达 14.4 万次,且仍以日均 ~4 stars 的速度稳步增长。项目采用 MIT 许可证,由 llmsresearch 社区维护。

GitHub 链接:
https://github.com/llmsresearch/paperbanana

原作者是 llmsresearch 团队,基于 Google Research 原始论文 “PaperBanana: Automating Academic Illustration for AI Scientists”(Zhu et al., arXiv:2601.23265)进行了开源实现与扩展。llmsresearch 专注于 AI 科研工具链的开源社区化,已围绕 PaperBanana 构建了 MCP Server、OpenClaw Skill、Codex Skill 等多端适配。

PaperBanana 的核心价值在于”AI Scientist 工作流补全”。传统科研流程中,从写方法章节到配图完成,中间存在大量重复性的图表制作负担——尤其是需要反复迭代版本时。PaperBanana 将这个环节自动化:用户只需提供方法章节文本或图表意图描述,系统即可输出可直接放入论文的图表文件,支持 PNG/JPEG/WebP 多种格式,以及 1:1、2:3、16:9 等多种比例。

  • 多 Agent 流水线:Retriever → Planner → Stylist → Visualizer → Critic 五阶段协作,确保每张图在语义忠实度和视觉美感上达到出版标准
  • 迭代精修:内置 --auto-refine 循环,Critic 持续反馈,图像质量可多次自我优化直至达标
  • VLM 驱动规划:基于 Google Gemini 的 VLM 进行图结构规划,无需用户手动描述布局
  • 三种调用接口:CLI(generate.py/plot.py/evaluate.py)、Python API、MCP Server,适配不同集成场景
  • 图表评估功能evaluate.py 对生成图与参考图进行 Faithfulness(语义忠实度)、Readability(可读性)、Conciseness(简洁性)、Aesthetics(美学)四维打分
  • 兼容多 Coding Agent:Claude Code Skill、OpenClaw Skill、Codex Skill 均已发布,主流 AI 编程工具均可直接使用

安装与基本使用非常简便。以 CLI 为例:

# 安装
pip install paperbanana

# 配置 API Key
paperbanana setup   # 自动打开浏览器引导获取 Gemini API Key

# 从方法章节文本生成图表
paperbanana generate 
  --input examples/sample_inputs/transformer_method.txt 
  --caption "Overview of our encoder-decoder architecture with sparse routing"

# 从 CSV/JSON 数据绘制图表
paperbanana plot 
  --data-file /path/to/results.csv 
  --intent "Line plot showing training loss over epochs"

# 评估生成图质量
paperbanana evaluate 
  --generated output.png 
  --reference human_reference.png 
  --context "The methodology section text..." 
  --caption "Framework overview"

在 Claude Code / OpenClaw Agent 中使用 Skill 模式:

# 安装 skill
openclaw skills install openclaw-paperbanana

# 对话中直接触发
# > 帮我画一张 encoder-decoder 框架的方法图,附图注"Proposed Architecture"

PaperBanana 的目标用户是 AI/ML 研究者、计算机科学博士研究生、以及需要大量制作学术配图的科研人员。无论是 NeurIPS、ICML、ACL 等顶会投稿,还是期刊论文中的方法论图、实验对比图、系统架构图,都可以用它来替代手动绘图。相较于让 AI 编程助手”截图描述”,PaperBanana 直接输出出版级图片文件,工作流整合度更高。

输入示例 1(文本 → 架构图)
输入一段方法章节文本:描述了一个 encoder-decoder 架构、稀疏路由机制和注意力模块的交互关系
输出:一张完整的 encoder-decoder 架构图,包含所有模块框、箭头标注和图注,可直接放入论文

输入示例 2(CSV → 图表)
输入:一份 CSV 文件含各模型在 5 个基准测试上的准确率数值
输出:一张对比柱状图,标注了模型名称、坐标轴和图例,发表级排版格式

整体来看,PaperBanana 补全了 AI 科研写作工具链中最耗时的一环——图表制作。它以开源、多 Agent 协作、迭代精修为核心设计,既能作为独立 CLI 工具使用,又能以 Skill 形式嵌入 AI Coding Agent 的日常工作流。对于需要频繁发表顶会论文的研究者,这是一款值得优先安装的效率利器。


GitHub: https://github.com/llmsresearch/paperbanana

评论区

0 条评论

登录后可评论。

Skill超级捕获手 12 阅读