Google Nano Banana 又出新玩法:6 步工作流让 AI 出图更专业

Google Nano Banana 又出新玩法:6 步工作流让 AI 出图更专业

最近在 Smithery 翻到个挺有意思的 Skillimage-gen(来自 krishagel/geoffrey 仓库),专门用 Google 的 Nano Banana Pro(Gemini 3 Pro Image)做图像生成

但它不只是”调 API 出图”那么简单——它内置了完整的 6 步编辑工作流(PAI 6-step editorial process),把图像生成从”碰运气”变成了可复用的工程流程。

Nano Banana 2 有什么不一样?

Nano Banana 2 是 2026 年 2 月发布的,重点能力包括:

  • 文字渲染:图里的文字终于能看清了(之前的痛点)
  • Google Search grounding:实时数据接入,股票、天气都能上
  • 主体一致性:跨多张图保持最多 5 个角色的一致
  • 多轮对话:迭代精修而不是一次性出图
  • 最多 14 张参考图:做风格迁移、构图融合
  • 1K/2K/4K 三档分辨率

那 6 步工作流具体是啥?

这是这个 Skill 最值钱的部分。它把出图拆成 6 步走:

  1. Extract narrative:先理解完整的故事/概念
  2. Derive visual concept:提炼出单一视觉隐喻,配 2-3 个实体物件
  3. Apply aesthetic:定风格、色调、氛围
  4. Construct prompt:把上面这些组合成具体的生成指令
  5. Generate:调用脚本执行
  6. Validate:对照标准检查,不行就重生成

这种结构化思维,对做信息图(infographic)和技术示意图(diagram)特别有用。Skill 里已经预设了两套工作流模板:infographic.mddiagram.md,直接拿来用。

三个脚本,一个 Skill

  • scripts/generate.py:文生图,支持横竖比例和分辨率参数
  • scripts/edit.py:编辑已有图片(比如换背景、改风格)
  • scripts/compose.py:多图合成(融合参考图的风格到新图里)

环境变量只需要一个 GEMINI_API_KEY。代码用 uv run 跑,依赖自动装。

用起来怎么样?

举两个例子:

# 生成咖啡店插画
uv run scripts/generate.py "A cozy coffee shop in autumn" coffee.png

# 生成神经网络科普信息图
uv run scripts/generate.py "Infographic explaining how neural networks work" nn.png 16:9 2K

注意一个有意思的限制:不要用 Read 工具读取生成的图片。生成的图是给用户看的,不是给 Agent 自己做视觉分析的——做编辑用 edit.py 脚本,不要直接 Read。

价格档位

  • 1K:免费档 / $0.04(适合预览)
  • 2K:$0.134(封面、信息图推荐)
  • 4K:$0.24(专业素材)

适用场景

如果你做小红书、AI 公众号、知识付费课程,需要大量图:

  • 封面图:16:9 横版,2K 足够清晰
  • 科普信息图:用 infographic 工作流
  • 产品 mockup:用 edit.py 调整细节
  • 风格一致的角色图:用 compose.py + 多张参考图

对比之前推荐的 baoyu-image-gen(多 provider 全能选手),这个 Skill 的优势在于:工作流模板更系统,适合需要批量出图的创作者。

GitHubhttps://github.com/krishagel/geoffrey/tree/main/skills/image-gen


GitHub: https://github.com/krishagel/geoffrey/tree/main/skills/image-gen

评论区

0 条评论

登录后可评论。

赵一凡 9 阅读