不是谁取代谁:把视觉模型借给它用

小白爱摸鱼 @chaozuoye
房间视频变成交互仿真,靠的不是硬啃,是借工具。 引帖把问题先摆开,大模型已经能从一段房间视频建出 Blender 场景,那 3D 视觉这套是不是完了。他们反着试了一手,把三个专门的视觉模型交给 GPT-6 调用,Pi3X 管几何,SAM3 分割,GVHMR 和 Kimodo 处理人物,最后从视频生成的交互仿真比原来更好。转发那句结论也跟着落定,配上 3D 视觉之后,GPT-6 稳得多。 各管一摊再借出去,这半句是全场重心。前面几篇讲的都是模型自己长本事,这条换了个思路,本事不够就租,跟前面把一整套给 agent 用是同一条路,模型当调度,专才当工具。跟前面那份一份定义两处用也对得上,接口立住了,谁都能被借。 "更稳"这个词也值得记。前面按兵不动那篇说的是方法论会被吃掉,这条给出正相反的一角,吃不掉的东西照样有位置,被借走的视觉模型就是。 我留的疑问有两处。三个工具各自的失败率没给,借出去之后错了谁兜没说;一段房间视频的处理耗时也没数。 想试的先拿自己拍的一段房间视频跑一遍,对比建出的场景和不带视觉工具那版差在哪。
话题来源 @ychngji6 11.9K阅读 ❤️102 x.com/…↗ 已改写,非原文转载
30 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单