mediagen Skill:让 Claude Code 自己生成图片和视频的统一技能包
mediagen 是一个让 AI 编程 Agent 直接生成图像和视频的技能包——一个安装、一次配置,即可调用 Google Gemini、OpenAI DALL·E、Kie AI 近三十款模型生成图片或视频,并自动附带 EU AI Act 合规标记。2026-08-22 刚开源就登上了 GitHub Trending 和 LobeHub Skill 市场,被冠以「编码代理的视觉手脚」之称。相比让 Agent 调用截图再手动复制进 prompt 的原始方式,mediagen 把图像生成封装成可组合的工具链,开发者用自然语言描述需求,Agent 就能自动调用正确的模型、判断比例、写入文件、标注 AI 来源。适合所有需要在代码流程里自动产出视觉内容的开发者。
核心能力与设计原则
mediagen 解决的是「让 Agent 做视觉创作」这件事的标准化问题:它把三个主流图像/视频生成 API 统一成一套 CLI + MCP Server + Skill 三位一体的工具,同一套配置、同样的调用逻辑,Claude Code、Cursor、Windsurf 等主流 Agent 都能直接使用。
设计原则有三条:多 Provider 统一入口(Gemini、OpenAI、Kie AI 各有擅长,Skill 自动根据任务选最优)、零 Prompt 注入风险(API Key 不经过对话窗口,只走本地配置文件)、EU AI Act 合规内置(IPTC/XMP 元数据标记 + 可选可见水印,生成内容自动满足欧盟 AI 透明度要求)。
认可度
截至 2026-09-05,GitHub 星标数为 54 颗(仓库创建于 2026-08-22),Forks 0。对于一个刚开源两周的项目,这个热度已属新晋 Trending 级别。LobeHub Skill 市场已收录,并出现在多个 GitHub Trending 追踪周报中。whstrending.ai 记录其「13 个快照、最长登榜 24 天」。npm 包 mediagen 同期上线,CI 持续交付。
链接
GitHub 仓库:https://github.com/Cripacx/mediagen
原作者
Cripacx(GitHub username),项目采用 MIT 许可证,用 TypeScript 编写,Node.js >= 20.11 即可运行。
详细介绍
mediagen 的核心是一个多 Provider 聚合的图像/视频生成管道。它以 CLI 为底层(npx -y mediagen image/video),Skill 层封装成 Claude Code 等 Agent 的可调用技能,MCP Server 层让不支持 Skill 但支持 MCP 协议的编辑器(如 VS Code)也能直接调用。三层共用同一套配置和 Provider 注册逻辑,能力完全对等。
支持的 Provider 有三层:
- Google Gemini:支持 Nano 到 Banana 全系列,最高 4K 分辨率,唯一支持视频生成的 Provider(含 21:9 超宽比例)
- OpenAI DALL·E / gpt-image:仅图像,不支持 16:9(最宽 1536×1024 即 3:2),skill 会自动将宽屏请求路由到 Gemini
- Kie AI:聚合约三十款第三方模型(Flux、Imagen、Grok 等),适合有特定模型偏好的用户
EU AI Act 合规是 mediagen 的差异化功能:生成内容自动写入 IPTC/XMP DigitalSourceType 元数据(机器可读),并可叠加可见水印(--visible-label),满足欧盟对 AI 生成内容的双重披露义务。
主要特点
- 三端一体:Skill(Claude Code)+ CLI + MCP Server,一套配置三处通用,无需为每个平台单独适配
- 智能路由:Skill 层知道每个 Provider 的能力边界(如 OpenAI 做不了 16:9),自动选最优解
- 安全配置:API Key 只能通过
mediagen init交互式写入本地配置文件,不经过 Agent 对话层,拒绝 Prompt 注入风险 - EU AI Act 合规:IPTC/XMP 元数据 + 可选可见标签,生成内容自动满足欧盟法规要求
- 跨 Agent 通用:Claude Code、Cursor、Windsurf、VS Code(通过 MCP)、Zed 等均支持,迁移成本为零
使用方法
第一步:安装 Skill(Claude Code 等)
npx -y skills add Cripacx/mediagen --skill mediagen
第二步:初始化配置(交互式向导)
npx -y mediagen init
# 依次输入 GEMINI_API_KEY / OPENAI_API_KEY / KIE_API_KEY
# 验证每个 Key 是否可用,选择默认模型
第三步:让 Agent 生成图像
在 Claude Code 对话中直接说:
“Make a hero image for the landing page, wide, something moody and industrial.”
Agent 会自动执行:
npx -y mediagen image "A disused loading dock at dusk, wet concrete…"
--aspect-ratio 21:9 --json
# → ./output/image-20260823T094107Z.png
指定模型(精确控制)
npx -y mediagen image "描述文本"
--model gemini-3-pro-image
--aspect-ratio 21:9 --size 4K
--mark --output-name hero.png --json
查看可用模型列表
npx -y mediagen models
作为 MCP Server 使用(VS Code / Cursor)
claude mcp add mediagen -- npx -y mediagen mcp
适用场景与目标用户
适用场景:
- 为应用/网站自动生成配图、封面、Banner
- 视频制作流程中自动生成 B-roll 素材(需 Gemini 视频支持)
- 设计稿生成后自动添加合规水印
- CI/CD 流水线中按需生成测试用图
目标用户:
- 开发者——需要在代码流程里集成图像生成,不想手动复制 Prompt
- AI 工作流构建者——搭建 Agent 自动化 pipeline,需要一个可靠的视觉生成节点
- 面向欧盟市场的产品团队——需要 EU AI Act 合规的图像来源标记
输入与输出案例
案例一:生成产品 Landing Page 配图
输入(对 Agent 说):
“Make a hero image for the landing page, wide, something moody and industrial.”
Agent 执行 → 输出:
./output/image-20260823T094107Z.png
(21:9 超宽比例,Gemini 生成,机器可读元数据已写入)
案例二:指定模型 + 合规水印
输入:
“Same thing with gemini-3-pro-image, 21:9, 4K, marked as AI-generated, saved as hero.png.”
Agent 执行 → 输出:
{
"success": true,
"filePath": "./output/hero.png",
"kind": "image",
"provider": "gemini",
"model": "gemini-3-pro-image",
"mimeType": "image/png"
}
文件同时携带 IPTC/XMP AI 来源标记,发布到公开平台时满足欧盟合规要求。
评论区
登录后可评论。