一个把AI视频工具串成流水线的Skill——video-director
做视频这件事,AI 工具其实不缺——缺的是一条能把「创意想法」稳稳当当变成「完整成片」的流水线。
今天挖到一个让我眼前一亮的 Skill:video-director,来自开源项目 Beav(Jamailar/Beav),GitHub 星标 1,764,Fork 233——这个热度在视频类 Skill 里相当能打。
它解决什么问题?
大多数 AI 视频工具是「你给 prompt,它出视频」,听起来很美,但实际操作中:
- 视频脚本要自己写,镜头语言要自己想
- 出图和出视频之间没有衔接,做出来的东西风格割裂
- 数字人口播要调音色、调语速,参数一堆,容易翻车
video-director 的思路完全不同——它是一个严格门控的工作流机器。你不能跳过任何一步直接出视频,它会强制你:
- 先写好分镜脚本和镜头表(plan_draft)
- 再生成一张「故事板联系预览图」让你确认构图和连续性(storyboard_preview)
- 等你点确认了,才进入配音环节(tts_if_needed)
- 最后才调用视频生成(video_generate)
翻译成人话:它逼你把「想清楚」这件事做完,才允许你动手做。
谁用得上?
广告/品牌营销人:产品宣传片、品牌故事片,一套流程覆盖脚本→分镜→配音→成片。
短视频创作者:口播视频、数字人视频,Skill 内置了 TTS + 声音克隆的衔接规范,不用自己调 API 参数。
AI 工作流搭建者:它本质上是一套多模态 Agent 的标准流程范本——脚本 Agent + 分镜 Agent + 配音 Agent + 视频 Agent 如何串联,看看它的 SKILL.md 就明白了。
技术亮点
几个让我印象深刻的细节:
- 分镜预览图不是「出图」,而是多格联系预览(contact sheet),确保镜头连续性
- 产品参考图不会被动用——如果用户上传了一张产品图,Skill 不会拿它去「分析/重绘」,而是作为视觉锚点保留
- 数字人口播的音色和语音是两个独立步骤:先克隆/选定音色,再生成配音,最后才合成视频
- 支持主流视频生成模型的 reference-guided 模式
怎么用?
在 Smithery 平台直接安装(npx skills add),或者在 Claude/Copilot 等支持 Skills 协议的环境里用 /video-director 激活。
触发词很宽:说「做一个产品宣传片」「生成广告片」「数字人口播视频」「图片转视频」,它都会拦截你,进入标准工作流。
一句话推荐理由:它不只是一个视频生成 Skill,它是一套把 AI 视频工具串成流水线的 SOP——如果你经常被「出图很好看、出视频翻车了」这个问题困扰,video-director 值得你放进工具箱。
GitHub:https://github.com/Jamailar/Beav
GitHub: https://github.com/Jamailar/Beav
评论区
登录后可评论。