一条把三个模型串起来的工作流:
GPT 6 负责设计世界观,Jev 负责"生存决策",决策结果再喂给 minimax H3 渲染成画面。作者说这条自动化视频生成链路已经跑通,"极其丝滑"。
这个分工值得拆开看,因为每个模型只干自己那一格:
- 世界观:叙事设定,属于生成类的活儿
- 生存决策:每一步该干什么,属于判断类的活儿
- 渲染:把决策结果变成画面
之前做"AI 生成连续剧情"最卡的地方,是让模型在长序列里保持一致性。这里把"决策"单独抽出来交给一个每次只回答"现在该做什么"的模型,叙事模型就不必每一步都重述设定。
这套结构其实和游戏 AI 的老架构一样:世界模型、行为策略、渲染,三层分开。区别只在于,过去有两层是手写规则,现在三层都是模型。
同一位作者还有个判断:客服、内容审核、招聘这类 agent,都会因为判断型模型迎来重构。凡是"每条内容都要做一次小决策"的场景,都在射程里。
得说清楚:原帖没给参数量、帧率、单条成本,那个 t.co 也没解析出外部地址,所以这条只能算"有人跑通了",效果和成本得自己判断。
23 浏览 0 评论
0 反应












