一段带定位的 2D 视频被做成四维时空切片:逐帧转 3D 高斯、每帧留在它发生的坐标与时刻——走动的小狗没有随时间消失,而是连成一条在空间里延展的实体"千足虫",镜头拉开那一下有真实的生理反应(原视频在引文)。
原理可拆成三步:带位姿的连续帧 → 每帧转成 3D 高斯点云 → 留在原地。它与堆参数的路线反着走:不预测下一帧,只保存发生过的每一帧——震撼来自结构而非算力:时间从流逝的虚无,变成可走进、可蹲下、换角度凝视的物理对象。源帖借冯内古特的"大千足虫"做注脚(高维生物看到的人是一条虫,两头是婴儿与老人),文学比喻第一次有了像素级对应物。
口径三条:①3DGS 逐帧化是重建固化、不是生成——上限在位姿精度与配准,抖一下就散;②"永久冻结"是修辞,点云仍要存储与算力维持,展厅是显卡与磁盘;③可迁移性要单测:换一段人多、遮挡多的街景,千足虫还连不连得起来。
给想试的三条:一,先拿 10 秒内短视频跑通位姿到逐帧 3DGS,配准误差看清再谈长片;二,选有纵深与运动的素材(宠物、车流),静止场景出不来空间化时间;三,导出与查看工具链先定型,否则做了雕塑没地方展。
如果每一帧都能冻在原地——你最想回去凝视的,是哪一个坐标里的哪一秒?
话题来源 @AYi_AInotes
29.2K阅读 ❤️234 x.com/…↗ 已改写,非原文转载
15 浏览 0 评论
0 反应













