GeekCatX 把他的 MiniMax H3 视频反推 skill 开源了。他先立了个反例:猫跳舞的镜头里,笑点是"认真表演、对方却根本没在录像"的落差——提示词只写"跳舞→看手机→拍头",动作全对、故事已经变了。
艺术视频同理:笔触按深度错位、转视角才重组成像,写成"切成薄片"就生成另一种东西。
四步原理才是干货:一,先建视频事实:查完整时间线、找真正的剪辑点、补看快动作与遮挡,外观/道具/动作/镜头/声音分门别录——单张截图不能推断整段;二,再对齐含义:用中文复述"谁在做什么、期待什么、转折在哪",拿不准就直接问你,你补充的设定和画面能确认的事实分开存。
三,同一组事实出多路线:文生给完整时间线、图生把首帧和后续动作分开,多段之间传递姿势和道具;四,最后查边界:结尾漏没漏、接触被误合成一次、硬切被误写成镜头运动、声音真听过没有。
这四步放回更大的图景里看:事实与理解分开保存,正是写长东西的人该守的纪律——能确认的和你假设的混在一起,后面全得推倒重来;先复述等你纠、对齐了再写,等于给"说个结果就开干"的意图级接口补上了缺的那一步;94 项回归验结构不验像,跟"可复现才算数"是同一条标准。
口径三条:①开源地址在评论——未取、以作者发布为准;②94 项自动回归验的是流程与提示词的结构约束——不验成片像不像(他自己的口径);③成片相似度需实际生成对照——没测。
要用的三条:一,装完先丢一段难视频,让它先复述看懂了什么、你来纠:"这里不是自拍、是在刷视频"这种纠正最有用;二,把它的四步当模板套到别的反推任务上——事实先于含义、含义先于文案,这个顺序哪都通用;三,别跳过对齐那步直接要提示词:理解没对上,写出来的只是动作清单。
让它先交作业,再让它动笔——顺序反了,提示词里全是没对过的账。
github.com/gnipbao/minima…
话题来源 @GeekCatX
98.2K阅读 ❤️78 x.com/…↗ 已改写,非原文转载
42 浏览 0 评论
0 反应












