Tracking Everything Everywhere All at Once

Tracking Everything Everywhere All at Once

OmniMotion:通过建立一个隐式的规范三维空间,实现各帧之间的位置坐标双向映射,从而实现所有点的目标跟踪。
代码仓库
注:笔者对相关领域并不熟悉,仅记录个人理解。

动机

已有方法在遮挡、全局一致性上效果不佳,故本文希望通过建立一个全局的、与运动无关的准规范三维空间,并建模每帧目标与该空间之间的可逆映射,从而建立帧之间的位置坐标映射关系。

方法

img

该方法的核心模块包含:

  • 将第\(i\)帧\(L_i\)上的位置\(\mathbf{x}_i\)映射到准规范三维空间\(G\)上的规范坐标点\(\mathbf{u}\)的可逆映射函数:\(\mathbf{u}=\tau_i(\mathbf{x}_i)\)
  • 获得点\(u\)的颜色\(\mathbf{c}\)与密度\(\sigma\)的函数:\(F_{\theta}(\mathbf{u})=(\mathbf{c},\sigma)\)

因此,某个目标在第\(j\)帧上的位置\(\mathbf{x}_j\)可以通过其在第\(i\)帧的位置\(\mathbf{x}_i\)进行推测:

\[\mathbf{x}_j=\tau_j^{-1} \circ \tau_i(\mathbf{x}_i) \]

其中\(\tau_i(\cdot)\)通过可逆网络实现。

由于上述映射过程是在三维空间展开的,所以对于原始二维帧上的点\(p_i\),需要通过一系列采样过程提升到三维进行处理。

由于\(\tau\)能够表示相机运动,所以简单使用固定、正交的相机。因此,采样的射线定义为:\(\mathbf{r}_i(z)=[\mathbf{p_i}, z]\)。

取\(K\)个深度值\(z\),第\(k\)个深度上的颜色与密度则为\((\mathbf{c}_k,\sigma_k)=F_{\theta}(\tau_i(\mathbf{x}_i^k))\)。

通过alpha compositing进行聚合:

\[\hat{\mathbf{x}}_j=\sum^K_{k=1}T_k \alpha_k \mathbf{x}_j^k \]

\[where \ \alpha_k=1-\exp(-\sigma_k) \]

\[T_k=\prod_{l=1}^{k-1}(1-\alpha_l) \]

颜色也通过类似的过程获得。

训练

  • 监督光流\(\hat{\mathbf{f}}_{i \rightarrow j}=\hat{\mathbf{p}}_j - \mathbf{p}_i\)的MAE:

\[L_{flo}=\sum_{{\mathbf{f}}_{i \rightarrow j} \in \Omega_f} ||\hat{\mathbf{f}}_{i \rightarrow j} - \mathbf{f}_{i \rightarrow j}|| \]

  • 监督颜色的MSE的\(L_{pho}\)
  • 正则化项,要求相邻帧上的三维坐标映射尽量相近,即最小化MAE:

\[L_{reg}=\sum_{(i,\mathbf{x})\in \Omega_x} || \tau_{i+1}^{-1} \circ \tau_i(\mathbf{x}_i) + \tau_{i-1}^{-1} \circ \tau_i(\mathbf{x}_i) - 2 \mathbf{x}_i ||_1 \]

实验

img

在遮挡、大幅度相机运动方面相较于之前的方法有明显提升。

局限

  • 处理快速、非刚体运动仍然困难
  • 优化比较困难,对于难度高的视频可能会收敛到一个局部最优
  • 计算开销大

总结

通过隐式空间建立帧间映射是一种非常有趣的方法,相当于通过准三维规范空间建立了一个“中转”。而构建的过程则利用了视频中目标在不同帧之间的运动与颜色。

一个唐突的联想是类CLIP的多模态模型也是利用了模态间的一致性构建公共子空间。不过这种模型的训练往往依赖大量成对数据。而视频场景下,可用的信息就只有视频本身的内容以及预先计算好的光流,或许这就是该方法存在一些训练困难的原因之一吧。

posted @ 2025-09-28 16:58  Bcai  阅读(42)  评论(0)    收藏  举报