1
00:00:00,000 --> 00:00:05,000
改变视角，保留动态。
输入完整视频，生成持续演变的场景。

2
00:00:05,000 --> 00:00:08,300
几何、光照与光学介质共同作用，
形成视频中记录的外观。

3
00:00:08,300 --> 00:00:12,000
对这些因素的变化逐一显式建模十分困难。
完整视频记录了它们随时间共同产生的外观。

4
00:00:12,000 --> 00:00:16,000
单帧 RGB 条件只能观察一个时刻。
GeoV2V 以完整的源视频片段作为条件。

5
00:00:16,000 --> 00:00:20,000
源视频与目标视频的隐变量共享视频自注意力，
没有额外设置帧间隔离掩码。

6
00:00:20,000 --> 00:00:24,200
选取的时刻用于示意跨时间的信息访问。
源视频条件方案沿用 ReCamMaster。

7
00:00:24,200 --> 00:00:30,700
接下来移动相机。
实测 LiDAR 为新视角提供空间依据。

8
00:00:30,700 --> 00:00:34,500
同一扫描展开为三个目标视角，
横向偏移分别为 1 米、2 米、4 米。

9
00:00:34,500 --> 00:00:37,467
对应的原始生成结果，
出现在各自标定投影的下方。

10
00:00:37,467 --> 00:00:40,800
训练配对来自 CARLA 中构建的 Para4D：
变化的地图、建筑资源，以及动态交通。

11
00:00:40,800 --> 00:00:43,700
七个平行位置，各含五个相机视角，
同步运动、采集同一时间轴上的视频。

12
00:00:43,700 --> 00:00:46,633
源视频、几何和相机位姿为预测提供条件。
同步采集的目标视频提供配对监督。

13
00:00:46,633 --> 00:00:50,467
三个动态场景，各有七个横向位置。
标出的源视角与监督视角继续同步播放。

14
00:00:50,467 --> 00:00:55,000
训练示意展开为模型结构。
两个目标视角先验共同引导视频生成。

15
00:00:55,000 --> 00:00:59,000
稠密几何控制第 1 至 15 个 DiT 块，
LiDAR 控制第 16 至 30 个块。

16
00:00:59,000 --> 00:01:03,000
完整源视频隐变量与加噪目标隐变量共同处理，
再将目标序列解码为新视角视频。

17
00:01:03,000 --> 00:01:08,000
源视频与三个生成视角，
沿同一采集时钟同步推进。

18
00:01:08,000 --> 00:01:11,200
时间信息支持场景动态，
随视角变化延续到生成视频中。

19
00:01:11,200 --> 00:01:15,000
转向灯是一个跨时间的事件。
观察论文原始帧中标出的灯光变化。

20
00:01:15,000 --> 00:01:18,500
事件随时间展开。
条件输入同样包含时间信息。

21
00:01:18,500 --> 00:01:24,000
补充材料中的雨天示例，
进一步展示变化的光照与光学效果。

22
00:01:24,000 --> 00:01:29,000
GeoV2V：完整视频条件，几何引导生成。
改变视角，保留动态。
