mediagen Skill:让 Claude Code 自己生成图片和视频的统一技能包

mediagen 是一个让 AI 编程 Agent 直接生成图像和视频的技能包——一个安装、一次配置,即可调用 Google Gemini、OpenAI DALL·E、Kie AI 近三十款模型生成图片或视频,并自动附带 EU AI Act 合规标记。2026-08-22 刚开源就登上了 GitHub Trending 和 LobeHub Skill 市场,被冠以「编码代理的视觉手脚」之称。相比让 Agent 调用截图再手动复制进 prompt 的原始方式,mediagen 把图像生成封装成可组合的工具链,开发者用自然语言描述需求,Agent 就能自动调用正确的模型、判断比例、写入文件、标注 AI 来源。适合所有需要在代码流程里自动产出视觉内容的开发者。

核心能力与设计原则

mediagen 解决的是「让 Agent 做视觉创作」这件事的标准化问题:它把三个主流图像/视频生成 API 统一成一套 CLI + MCP Server + Skill 三位一体的工具,同一套配置、同样的调用逻辑,Claude Code、Cursor、Windsurf 等主流 Agent 都能直接使用。

设计原则有三条:多 Provider 统一入口(Gemini、OpenAI、Kie AI 各有擅长,Skill 自动根据任务选最优)、零 Prompt 注入风险(API Key 不经过对话窗口,只走本地配置文件)、EU AI Act 合规内置(IPTC/XMP 元数据标记 + 可选可见水印,生成内容自动满足欧盟 AI 透明度要求)。

认可度

截至 2026-09-05,GitHub 星标数为 54 颗(仓库创建于 2026-08-22),Forks 0。对于一个刚开源两周的项目,这个热度已属新晋 Trending 级别。LobeHub Skill 市场已收录,并出现在多个 GitHub Trending 追踪周报中。whstrending.ai 记录其「13 个快照、最长登榜 24 天」。npm 包 mediagen 同期上线,CI 持续交付。

链接

GitHub 仓库:https://github.com/Cripacx/mediagen

原作者

Cripacx(GitHub username),项目采用 MIT 许可证,用 TypeScript 编写,Node.js >= 20.11 即可运行。

详细介绍

mediagen 的核心是一个多 Provider 聚合的图像/视频生成管道。它以 CLI 为底层(npx -y mediagen image/video),Skill 层封装成 Claude Code 等 Agent 的可调用技能,MCP Server 层让不支持 Skill 但支持 MCP 协议的编辑器(如 VS Code)也能直接调用。三层共用同一套配置和 Provider 注册逻辑,能力完全对等。

支持的 Provider 有三层:

  • Google Gemini:支持 Nano 到 Banana 全系列,最高 4K 分辨率,唯一支持视频生成的 Provider(含 21:9 超宽比例)
  • OpenAI DALL·E / gpt-image:仅图像,不支持 16:9(最宽 1536×1024 即 3:2),skill 会自动将宽屏请求路由到 Gemini
  • Kie AI:聚合约三十款第三方模型(Flux、Imagen、Grok 等),适合有特定模型偏好的用户

EU AI Act 合规是 mediagen 的差异化功能:生成内容自动写入 IPTC/XMP DigitalSourceType 元数据(机器可读),并可叠加可见水印(--visible-label),满足欧盟对 AI 生成内容的双重披露义务。

主要特点

  • 三端一体:Skill(Claude Code)+ CLI + MCP Server,一套配置三处通用,无需为每个平台单独适配
  • 智能路由:Skill 层知道每个 Provider 的能力边界(如 OpenAI 做不了 16:9),自动选最优解
  • 安全配置:API Key 只能通过 mediagen init 交互式写入本地配置文件,不经过 Agent 对话层,拒绝 Prompt 注入风险
  • EU AI Act 合规:IPTC/XMP 元数据 + 可选可见标签,生成内容自动满足欧盟法规要求
  • 跨 Agent 通用:Claude Code、Cursor、Windsurf、VS Code(通过 MCP)、Zed 等均支持,迁移成本为零

使用方法

第一步:安装 Skill(Claude Code 等)

npx -y skills add Cripacx/mediagen --skill mediagen

第二步:初始化配置(交互式向导)

npx -y mediagen init
# 依次输入 GEMINI_API_KEY / OPENAI_API_KEY / KIE_API_KEY
# 验证每个 Key 是否可用,选择默认模型

第三步:让 Agent 生成图像

在 Claude Code 对话中直接说:

“Make a hero image for the landing page, wide, something moody and industrial.”

Agent 会自动执行:

npx -y mediagen image "A disused loading dock at dusk, wet concrete…" 
  --aspect-ratio 21:9 --json
# → ./output/image-20260823T094107Z.png

指定模型(精确控制)

npx -y mediagen image "描述文本" 
  --model gemini-3-pro-image 
  --aspect-ratio 21:9 --size 4K 
  --mark --output-name hero.png --json

查看可用模型列表

npx -y mediagen models

作为 MCP Server 使用(VS Code / Cursor)

claude mcp add mediagen -- npx -y mediagen mcp

适用场景与目标用户

适用场景:

  • 为应用/网站自动生成配图、封面、Banner
  • 视频制作流程中自动生成 B-roll 素材(需 Gemini 视频支持)
  • 设计稿生成后自动添加合规水印
  • CI/CD 流水线中按需生成测试用图

目标用户:

  • 开发者——需要在代码流程里集成图像生成,不想手动复制 Prompt
  • AI 工作流构建者——搭建 Agent 自动化 pipeline,需要一个可靠的视觉生成节点
  • 面向欧盟市场的产品团队——需要 EU AI Act 合规的图像来源标记

输入与输出案例

案例一:生成产品 Landing Page 配图

输入(对 Agent 说):

“Make a hero image for the landing page, wide, something moody and industrial.”

Agent 执行 → 输出:

./output/image-20260823T094107Z.png

(21:9 超宽比例,Gemini 生成,机器可读元数据已写入)


案例二:指定模型 + 合规水印

输入:

“Same thing with gemini-3-pro-image, 21:9, 4K, marked as AI-generated, saved as hero.png.”

Agent 执行 → 输出:

{
  "success": true,
  "filePath": "./output/hero.png",
  "kind": "image",
  "provider": "gemini",
  "model": "gemini-3-pro-image",
  "mimeType": "image/png"
}

文件同时携带 IPTC/XMP AI 来源标记,发布到公开平台时满足欧盟合规要求。


GitHub: https://github.com/Cripacx/mediagen

评论区

0 条评论

登录后可评论。

Skill超级捕获手 10 阅读