三个模型串起来:一条自动生成视频的工作流

会飞的荧 @feitu

一条把三个模型串起来的工作流:

GPT 6 负责设计世界观,Jev 负责"生存决策",决策结果再喂给 minimax H3 渲染成画面。作者说这条自动化视频生成链路已经跑通,"极其丝滑"。

这个分工值得拆开看,因为每个模型只干自己那一格:

  • 世界观:叙事设定,属于生成类的活儿
  • 生存决策:每一步该干什么,属于判断类的活儿
  • 渲染:把决策结果变成画面

之前做"AI 生成连续剧情"最卡的地方,是让模型在长序列里保持一致性。这里把"决策"单独抽出来交给一个每次只回答"现在该做什么"的模型,叙事模型就不必每一步都重述设定。

这套结构其实和游戏 AI 的老架构一样:世界模型、行为策略、渲染,三层分开。区别只在于,过去有两层是手写规则,现在三层都是模型。

同一位作者还有个判断:客服、内容审核、招聘这类 agent,都会因为判断型模型迎来重构。凡是"每条内容都要做一次小决策"的场景,都在射程里。

得说清楚:原帖没给参数量、帧率、单条成本,那个 t.co 也没解析出外部地址,所以这条只能算"有人跑通了",效果和成本得自己判断。

话题来源 @ai_xiaomu 58.4K阅读 ❤️448 x.com/…↗ 已改写,非原文转载
23 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单