Tracking Everything Everywhere All at Once
Tracking Everything Everywhere All at Once
OmniMotion:通过建立一个隐式的规范三维空间,实现各帧之间的位置坐标双向映射,从而实现所有点的目标跟踪。
代码仓库
注:笔者对相关领域并不熟悉,仅记录个人理解。
动机
已有方法在遮挡、全局一致性上效果不佳,故本文希望通过建立一个全局的、与运动无关的准规范三维空间,并建模每帧目标与该空间之间的可逆映射,从而建立帧之间的位置坐标映射关系。
方法

该方法的核心模块包含:
- 将第\(i\)帧\(L_i\)上的位置\(\mathbf{x}_i\)映射到准规范三维空间\(G\)上的规范坐标点\(\mathbf{u}\)的可逆映射函数:\(\mathbf{u}=\tau_i(\mathbf{x}_i)\)
- 获得点\(u\)的颜色\(\mathbf{c}\)与密度\(\sigma\)的函数:\(F_{\theta}(\mathbf{u})=(\mathbf{c},\sigma)\)
因此,某个目标在第\(j\)帧上的位置\(\mathbf{x}_j\)可以通过其在第\(i\)帧的位置\(\mathbf{x}_i\)进行推测:
其中\(\tau_i(\cdot)\)通过可逆网络实现。
由于上述映射过程是在三维空间展开的,所以对于原始二维帧上的点\(p_i\),需要通过一系列采样过程提升到三维进行处理。
由于\(\tau\)能够表示相机运动,所以简单使用固定、正交的相机。因此,采样的射线定义为:\(\mathbf{r}_i(z)=[\mathbf{p_i}, z]\)。
取\(K\)个深度值\(z\),第\(k\)个深度上的颜色与密度则为\((\mathbf{c}_k,\sigma_k)=F_{\theta}(\tau_i(\mathbf{x}_i^k))\)。
通过alpha compositing进行聚合:
颜色也通过类似的过程获得。
训练
- 监督光流\(\hat{\mathbf{f}}_{i \rightarrow j}=\hat{\mathbf{p}}_j - \mathbf{p}_i\)的MAE:
- 监督颜色的MSE的\(L_{pho}\)
- 正则化项,要求相邻帧上的三维坐标映射尽量相近,即最小化MAE:
实验

在遮挡、大幅度相机运动方面相较于之前的方法有明显提升。
局限
- 处理快速、非刚体运动仍然困难
- 优化比较困难,对于难度高的视频可能会收敛到一个局部最优
- 计算开销大
总结
通过隐式空间建立帧间映射是一种非常有趣的方法,相当于通过准三维规范空间建立了一个“中转”。而构建的过程则利用了视频中目标在不同帧之间的运动与颜色。
一个唐突的联想是类CLIP的多模态模型也是利用了模态间的一致性构建公共子空间。不过这种模型的训练往往依赖大量成对数据。而视频场景下,可用的信息就只有视频本身的内容以及预先计算好的光流,或许这就是该方法存在一些训练困难的原因之一吧。

浙公网安备 33010602011771号