Google Nano Banana 又出新玩法:6 步工作流让 AI 出图更专业
Google Nano Banana 又出新玩法:6 步工作流让 AI 出图更专业
最近在 Smithery 翻到个挺有意思的 Skill:image-gen(来自 krishagel/geoffrey 仓库),专门用 Google 的 Nano Banana Pro(Gemini 3 Pro Image)做图像生成。
但它不只是”调 API 出图”那么简单——它内置了完整的 6 步编辑工作流(PAI 6-step editorial process),把图像生成从”碰运气”变成了可复用的工程流程。
Nano Banana 2 有什么不一样?
Nano Banana 2 是 2026 年 2 月发布的,重点能力包括:
- 文字渲染:图里的文字终于能看清了(之前的痛点)
- Google Search grounding:实时数据接入,股票、天气都能上
- 主体一致性:跨多张图保持最多 5 个角色的一致
- 多轮对话:迭代精修而不是一次性出图
- 最多 14 张参考图:做风格迁移、构图融合
- 1K/2K/4K 三档分辨率
那 6 步工作流具体是啥?
这是这个 Skill 最值钱的部分。它把出图拆成 6 步走:
- Extract narrative:先理解完整的故事/概念
- Derive visual concept:提炼出单一视觉隐喻,配 2-3 个实体物件
- Apply aesthetic:定风格、色调、氛围
- Construct prompt:把上面这些组合成具体的生成指令
- Generate:调用脚本执行
- Validate:对照标准检查,不行就重生成
这种结构化思维,对做信息图(infographic)和技术示意图(diagram)特别有用。Skill 里已经预设了两套工作流模板:infographic.md 和 diagram.md,直接拿来用。
三个脚本,一个 Skill
scripts/generate.py:文生图,支持横竖比例和分辨率参数scripts/edit.py:编辑已有图片(比如换背景、改风格)scripts/compose.py:多图合成(融合参考图的风格到新图里)
环境变量只需要一个 GEMINI_API_KEY。代码用 uv run 跑,依赖自动装。
用起来怎么样?
举两个例子:
# 生成咖啡店插画
uv run scripts/generate.py "A cozy coffee shop in autumn" coffee.png
# 生成神经网络科普信息图
uv run scripts/generate.py "Infographic explaining how neural networks work" nn.png 16:9 2K
注意一个有意思的限制:不要用 Read 工具读取生成的图片。生成的图是给用户看的,不是给 Agent 自己做视觉分析的——做编辑用 edit.py 脚本,不要直接 Read。
价格档位
- 1K:免费档 / $0.04(适合预览)
- 2K:$0.134(封面、信息图推荐)
- 4K:$0.24(专业素材)
适用场景
如果你做小红书、AI 公众号、知识付费课程,需要大量图:
- 封面图:16:9 横版,2K 足够清晰
- 科普信息图:用 infographic 工作流
- 产品 mockup:用 edit.py 调整细节
- 风格一致的角色图:用 compose.py + 多张参考图
对比之前推荐的 baoyu-image-gen(多 provider 全能选手),这个 Skill 的优势在于:工作流模板更系统,适合需要批量出图的创作者。
GitHub:https://github.com/krishagel/geoffrey/tree/main/skills/image-gen
GitHub: https://github.com/krishagel/geoffrey/tree/main/skills/image-gen
评论区
登录后可评论。