让 AI 帮你「做图做视频」!这三个 Skill 把 OpenAI 和 xAI 直接接进编程工作流
跟 AI 说「给我做一张产品图」,它真的就给你做出来了——不是返回一个链接,而是直接把文件写进你的项目目录。
这就是 media-gen-skills 在做的事。这是一个 GitHub 上刚出来的 AI 素材生成工具包,包含三个互为补充的 Skill:gpt-image-2、grok-image 和 grok-imagine-video。
三个 Skill,分别适合谁
gpt-image-2 是主力输出,OpenAI 的图生图模型。 它能文生图、能局部重绘(inpainting,涂个遮罩它只改那一块)、能多图合成一张、还能选输出尺寸和格式(PNG / JPEG / WebP)。做品牌物料、产品海报、设计稿的时候想要精准控制,用它最合适。费用大概是 0.006 到 0.21 美元一张,高质量 1024×1024 大概 21 美分。
grok-image 是 xAI 出品的轻量图生图,速度快、成本低(每张约 7 美分)。缺点是不能编辑已有图、也不能选精确尺寸。如果你只是需要快速出图做参考、概念草图,选 grok-image 省预算。
grok-imagine-video 是压轴亮点——xAI 的 AI 视频生成。能文生视频(最长 15 秒)、能把静态图动画化、能把参考图里的人/物合成进视频里、还能对已有视频做编辑或延长。分辨率支持 480p / 720p,比例有 1:1、16:9、9:16 等常见格式。
装起来有多简单
只要你的 AI 编程工具支持 Agent Skills(Claude Code、Kimi CLI、Cursor 等都支持),三行命令装完:
- 把仓库克隆到本地
- 运行
npx skills add satasuk03/media-gen-skills --all -g -y(全局安装) - 复制一份
.env.example为.env,填入 OpenAI 和/或 xAI 的 API Key
之后直接跟 AI 说人话就行:「帮我生成一张日式简约风格的产品图」「把这张照片做成缓慢推进的动画」「把我的产品图换个背景」——它自动选 Skill,自动跑脚本,自动把文件写进工作目录。
为什么值得收藏
过去做 AIGC 物料,要在多个平台之间切换、反复复制粘贴 Prompt。现在这个工具包把 OpenAI 和 xAI 的生成能力直接接进了你的 AI 编程环境——意味着你可以把图像生成嵌进任何工作流里,做自动化品牌素材、批量出图、甚至做 AI 设计系统。3 个 Skill 加起来,覆盖了从草图到成品图、从静态图到动态视频的完整链路。
唯一需要注意的是:视频生成大概需要几分钟时间(模型排队 + 处理),Skill 内部会处理等待,你不需要盯着。
GitHub:https://github.com/satasuk03/media-gen-skills
评论区
登录后可评论。