一个 Skill 搞定图片/视频/音乐/语音!AI 内容创作者的全家桶工具箱

AI 内容创作,最烦的不是生成本身——而是来回切换工具、记一堆参数、调半天 API。

今天挖到一个”全家桶”级别的 Skillmedia-generation-skill。它不是什么新模型,而是一套覆盖图片、视频、音乐、语音的完整生成工作流,装进一个 SKILL.md 里,让 AI 助手直接调用,参数、技巧、坑位全给你整理好了。

一张图看懂它能干啥

这个 Skill 封装了 5 个工具的完整知识:

  • 图片生成:OpenAI gpt-image-1 / DALL-E 3 / MiniMax image-01 支持,尺寸、质量、种子全覆盖
  • 文字转语音:6 种 OpenAI 音色 + 3 种 MiniMax 中文音色,语速可调(0.25x ~ 4x)
  • 视频生成:MiniMax T2V-01,5-10 秒,支持 720p/1080p,附详细 prompt 写法指南
  • 视频状态查询:异步任务轮询机制,最多约 10 次查询(3 分钟内出结果)
  • 音乐生成:MiniMax music-2.5,支持纯器乐和带歌词的歌曲,附和弦/节奏/乐器描述框架

最值钱的是那几个”避坑指南”

很多 Skill 只告诉你”怎么用”,这个 Skill 还告诉你”别怎么用”。比如视频生成,它明确列出:

  • ✅ 好 prompt:”A golden retriever running through a wheat field at sunset, slow motion, cinematic”
  • ❌ 坏 prompt:”A video”(太模糊)或”两个人在咖啡馆聊天同时一只狗跑过…”(太复杂,单一主体效果最好)

语音生成那边还有个很实用的 Tips:语速 0.8-0.9 最适合叙述,1.1-1.2 适合摘要——这种参数经验你自己试要花不少时间。

几个可以直接套的工作流

Skill 里内置了 5 个组合配方:

  • 播客开场:音乐 jingle → 语音开场白 → 直接合成
  • 社交媒体帖子:配图 → 写 caption → 可选加无障碍音频版
  • 视频旁白:TTS 语音 → 生成匹配视频 → 轮询状态 → 输出
  • 专辑封面 + 预览:图生封面 → 音乐生成匹配情绪的短曲
  • 有声书章节:分段 TTS → 保持音色一致 → 按顺序输出

Provider 能力一览(避免踩坑)

OpenAI 和 MiniMax 各有所长,这个 Skill 给你整理了一张矩阵表:

  • OpenAI:图片 + TTS(视频/音乐暂无)
  • MiniMax:图片 + TTS + 视频 + 音乐,全能

如果只配了一个 API Key,它支持自动检测并切换最优 Provider。

怎么安装

一行命令搞定:

npx skills add https://github.com/librefang/librefang --skill media-generation-skill

来自 librefang/librefang 开源项目(Rust 编写的 Agent OS),Stars 369,质量有保证。

GitHubhttps://github.com/librefang/librefang


GitHub: https://github.com/librefang/librefang

评论区

0 条评论

登录后可评论。

苏棠 15 阅读