PaperBanana Skill:一键生成论文级学术图表的多 Agent 神器
PaperBanana Skill:一键生成论文级学术图表的多 Agent 神器
在 AI 学术写作场景中,”有一张好图胜过千言万语”——但手动绘制一张符合期刊要求的方法图、系统架构图或实验结果图,往往要花掉研究者数小时。PaperBanana 正是为解决这个痛点而生:它将一段方法论文字或图表意图,自动转化为可直接投稿的publication-ready 学术配图。自 2026 年初开源以来迅速走红,成为当前 AI 辅助科研工具链中增长最快的 Skill 之一。
核心能力上,PaperBanana 采用五阶段多 Agent 流水线和迭代精修机制:Retriever(检索相关上下文)→ Planner(VLM 规划图像结构)→ Stylist(风格校准)→ Visualizer(生成图像)→ Critic(质量打分与反馈)。这个流程确保生成结果既忠实于原始文本意图,又符合学术出版的美学规范。此外,它内置了 CLI、Python API 和 MCP Server 三种调用形态,可以无缝集成到 Claude Code、Cursor、Codex 等主流 Coding Agent 中,以 skill 插件形式使用。
截至 2026-09-08,PaperBanana 在 GitHub 累计获得约 2.2k Stars、330 次 Fork,PyPI 月下载量达 9.9k 次;MCP 生态平台 PulseMCP 估算其相关服务器累计访问量超 44.4k 次/月。OpenClaw 官方市场 ClawHub 上的 skill 版本安装量已达 14.4 万次,且仍以日均 ~4 stars 的速度稳步增长。项目采用 MIT 许可证,由 llmsresearch 社区维护。
GitHub 链接:
https://github.com/llmsresearch/paperbanana
原作者是 llmsresearch 团队,基于 Google Research 原始论文 “PaperBanana: Automating Academic Illustration for AI Scientists”(Zhu et al., arXiv:2601.23265)进行了开源实现与扩展。llmsresearch 专注于 AI 科研工具链的开源社区化,已围绕 PaperBanana 构建了 MCP Server、OpenClaw Skill、Codex Skill 等多端适配。
PaperBanana 的核心价值在于”AI Scientist 工作流补全”。传统科研流程中,从写方法章节到配图完成,中间存在大量重复性的图表制作负担——尤其是需要反复迭代版本时。PaperBanana 将这个环节自动化:用户只需提供方法章节文本或图表意图描述,系统即可输出可直接放入论文的图表文件,支持 PNG/JPEG/WebP 多种格式,以及 1:1、2:3、16:9 等多种比例。
- 多 Agent 流水线:Retriever → Planner → Stylist → Visualizer → Critic 五阶段协作,确保每张图在语义忠实度和视觉美感上达到出版标准
- 迭代精修:内置
--auto-refine循环,Critic 持续反馈,图像质量可多次自我优化直至达标 - VLM 驱动规划:基于 Google Gemini 的 VLM 进行图结构规划,无需用户手动描述布局
- 三种调用接口:CLI(
generate.py/plot.py/evaluate.py)、Python API、MCP Server,适配不同集成场景 - 图表评估功能:
evaluate.py对生成图与参考图进行 Faithfulness(语义忠实度)、Readability(可读性)、Conciseness(简洁性)、Aesthetics(美学)四维打分 - 兼容多 Coding Agent:Claude Code Skill、OpenClaw Skill、Codex Skill 均已发布,主流 AI 编程工具均可直接使用
安装与基本使用非常简便。以 CLI 为例:
# 安装
pip install paperbanana
# 配置 API Key
paperbanana setup # 自动打开浏览器引导获取 Gemini API Key
# 从方法章节文本生成图表
paperbanana generate
--input examples/sample_inputs/transformer_method.txt
--caption "Overview of our encoder-decoder architecture with sparse routing"
# 从 CSV/JSON 数据绘制图表
paperbanana plot
--data-file /path/to/results.csv
--intent "Line plot showing training loss over epochs"
# 评估生成图质量
paperbanana evaluate
--generated output.png
--reference human_reference.png
--context "The methodology section text..."
--caption "Framework overview"
在 Claude Code / OpenClaw Agent 中使用 Skill 模式:
# 安装 skill
openclaw skills install openclaw-paperbanana
# 对话中直接触发
# > 帮我画一张 encoder-decoder 框架的方法图,附图注"Proposed Architecture"
PaperBanana 的目标用户是 AI/ML 研究者、计算机科学博士研究生、以及需要大量制作学术配图的科研人员。无论是 NeurIPS、ICML、ACL 等顶会投稿,还是期刊论文中的方法论图、实验对比图、系统架构图,都可以用它来替代手动绘图。相较于让 AI 编程助手”截图描述”,PaperBanana 直接输出出版级图片文件,工作流整合度更高。
输入示例 1(文本 → 架构图):
输入一段方法章节文本:描述了一个 encoder-decoder 架构、稀疏路由机制和注意力模块的交互关系
输出:一张完整的 encoder-decoder 架构图,包含所有模块框、箭头标注和图注,可直接放入论文
输入示例 2(CSV → 图表):
输入:一份 CSV 文件含各模型在 5 个基准测试上的准确率数值
输出:一张对比柱状图,标注了模型名称、坐标轴和图例,发表级排版格式
整体来看,PaperBanana 补全了 AI 科研写作工具链中最耗时的一环——图表制作。它以开源、多 Agent 协作、迭代精修为核心设计,既能作为独立 CLI 工具使用,又能以 Skill 形式嵌入 AI Coding Agent 的日常工作流。对于需要频繁发表顶会论文的研究者,这是一款值得优先安装的效率利器。
评论区
登录后可评论。