PaperBanana Skill:输入一段话,出炉 publication-quality 学术图的神器
PaperBanana Skill:输入一段话,出炉 publication-quality 学术图的神器
PaperBanana 是什么?简单说,它是一个基于多 Agent 流水线的 AI 学术图片生成工具——用户给一段文字描述,30 秒内返回一张发表级质量(publication-quality)的学术插图,涵盖方法图、统计图表、幻灯片三大类型。它由 5 个子 Agent 组成完整流水线:Retriever → Planner → Stylist → Visualizer → Critic,各司其职、层层把关。正是这套架构让它在生成质量上远超普通 AI 生图,在 GitHub Trending 和学术社区引发关注。
功能与原则
核心能力覆盖三大场景:方法图(Text → 30s 出 publication-quality 学术图)、统计图(CSV/JSON 数据 → 自动套用学术风格图表)、幻灯片(Markdown → 4K 演示文稿,支持 150+ 风格预设)。设计原则强调质量门控:每轮生成后由 Critic Agent 评估,触发了质量门控(critic_score_threshold=9.0)才进入下一轮,支持自动迭代优化(–auto 循环直到 Critic 满意)。
认可度
截至 2026-08-10,PaperBanana Skill GitHub 仓库星标 42 个(仓库建于 2026-02-04,最近更新 2026-08-03,仍在活跃维护)。PaperBanana 本身是 Python 开源工具,支持 pip 安装,在学术 AI 圈有稳定受众;Skill 层则让它天然嵌入 Claude Code 工作流,实现”对话即生成”。
链接
GitHub:https://github.com/PlutoLei/paperbanana-skill
原作者
PlutoLei(GitHub username),专注 AI 学术工具链,PaperBanana Skill 由其独立维护。
介绍
PaperBanana 脱胎于学术论文写作的真实痛点——配图往往需要手工绘制或借助专业软件,费时费力,且跨slide风格难以统一。这个 Skill 把 PaperBanana 核心能力打包成 Claude Code 可调用的标准化指令集:用户无需记忆命令行参数,直接用自然语言描述需求,Skill 解析意图后自动路由到合适的图片生成后端,完成全流程。
Pipeline 设计思路清晰:Planner 拆解描述生成结构化指令,Stylist 根据用户指定的学术场景(neurips/icml/acl/ieee 或自定义)选择配色与版式,Visualizer 调用底层模型出图,Critic 做 6 项质量检查(完整性、布局、标注、色彩、清晰度、幻觉),不合格则回流重绘。这套机制让非设计背景的研究者也能快速拿到可直接放进论文的配图。
v4.3(2026-04-21)新增了 GPT Image 2 原生支持,出图分辨率提升至真正的 16:9(2048×1152),并支持 quality=low/medium/high 三档调节。v4.4 则带来了并发幻灯片生成(–concurrent 3 实测 6 页耗时从 768s 压缩至 309s,约 2.5 倍加速)。
特点
- 5-Agent 流水线:Retriever → Planner → Stylist → Visualizer → Critic,层层质量门控,迭代直到达标
- 8 大 VLM 提供商:Gemini / Claude / OpenAI / Bedrock / OpenRouter + LiteLLM(100+后端)/ Ollama(本地模型)/ Claude Code,智能自动路由
- 150+ 风格预设:覆盖 NeurIPS、ICML、ACL、IEEE 等主流学术会议场景
- 支持统计图表:直接输入 CSV/JSON,自动生成带学术样式的图表
- 幻灯片一键生成:Markdown → 4K 演示文稿,风格一致性贯穿全deck
使用方法
安装(Claude Code 环境):
# 克隆 Skill 仓库到 Claude Code skills 目录
git clone https://github.com/PlutoLei/paperbanana-skill.git ~/.claude/skills/paperbanana
# 在 Claude Code 对话中直接触发
# 说"用 PaperBanana 帮我画一张注意力机制的方法图"即可
基础调用示例:
# 方法图生成
paperbanana generate
--input "A transformer architecture diagram showing multi-head attention"
--venue neurips
--purpose submission
# 指定 GPT Image 2 高质量模式
python -m paperbanana.cli generate
--image-provider openai_imagen
--image-model gpt-image-2
--aspect-ratio 16:9
--input prompt.txt
--caption "Methodology overview"
使用场景与人群
适用场景:论文配图(方法图、实验图、流程图)、学术报告幻灯片、毕业论文插图、顶会投稿材料准备。目标用户:高校硕博研究生、AI/ML 研究者、学术写作者、需要快速出图但缺乏设计能力的理工科学者。
输入与输出案例
案例 1:方法图
- 输入:
"A diagram illustrating the proposed Federated Learning framework with three clients, one server, and gradient aggregation arrows" - 输出:一张符合 NeurIPS 风格的框架图,包含客户端/服务器节点、箭头标注、统一的学术配色,字迹清晰可读
案例 2:幻灯片
- 输入:一份 Markdown 大纲 → 通过
paperbanana-slide-deck生成 10 页幻灯片 - 输出:4K 演示文稿,所有页面使用统一的 warm off-white 配色 + 手绘风字体 + 齿轮图形元素,从封面到结尾页风格完全一致
评论区
登录后可评论。