视频加载失败

InfiniDepth 论文笔记

InfiniDepth 阅读笔记 论文:InfiniDepth: Arbitrary-Resolution and Fine-Grained Depth Estimation with Neural Implicit Fields(arXiv 2601.03252v1,2026) 机构:浙江大学、理

论文主题导航
文章目录

InfiniDepth 阅读笔记#

论文:InfiniDepth: Arbitrary-Resolution and Fine-Grained Depth Estimation with Neural Implicit Fields(arXiv 2601.03252v1,2026)

机构:浙江大学、理想汽车、深圳大学。项目页:zju3dv.github.io/InfiniDepth

一句话总结#

把单目深度从离散网格表示改写成连续的神经隐式场 dI(x,y)=Nθ(I,(x,y))d_I(x,y)=N_\theta(I,(x,y)),配一个多尺度局部隐式解码器,使深度可以在任意连续二维坐标处查询,从而实现任意分辨率、细粒度的深度估计;并由此衍生出抵消密度不均的深度查询采样策略,提升大视角变化下的单视角新视角合成。

研究动机#

现有主流深度估计的根本局限在于离散网格表示:

  • 预测位置被锁死在固定网格上,输出分辨率本质受限于训练图像尺寸,难以扩展到任意分辨率。
  • 由网格还原稠密深度只能靠两种方式,二者都损失高频细节:卷积上采样会平滑;从隐变量线性投影到深度块难以表达局部几何变化。
  • 在几何变化剧烈的区域(边缘、薄结构)容易预测失真。

另一个痛点在新视角合成(NVS):前馈式方法预测逐像素深度后反投影,得到的点云密度严重不均(远处点稀、斜面点稀),导致大视角变化下出现孔洞和伪影。

核心思想:用隐式神经表示(INR)替换离散网格。INR 将连续坐标映射到信号 y=Fθ(x)\mathbf{y}=F_\theta(\mathbf{x}),与分辨率无关、参数更少、能表达细粒度几何,已在 NeRF、PiFU、LIIF、AnyFlow 等工作中验证。本文首次系统地把它用作单目深度的基础表示。

主要贡献#

  • 提出将深度建模为神经隐式场的新表示,论证其在任意分辨率与细粒度深度估计上的能力。
  • 设计深度查询(采样)策略,在物体表面生成均匀分布的三维点,改善大视角变化下的 NVS 质量。
  • 构建 Synth4K,一个从五款游戏采集的高质量 4K 深度基准,用于在高分辨率与精细几何细节层面做评测。

方法#

问题定义:给定单张 RGB 图像 I∈RH×W×3I\in\mathbb{R}^{H\times W\times 3},对图像平面任意连续坐标 (x,y)∈[0,W]×[0,H](x,y)\in[0,W]\times[0,H] 估计深度

dI(x,y)=Nθ(I,(x,y)).d_I(x,y)=N_\theta(I,(x,y)).

NθN_\theta 被实例化为多尺度局部隐式解码器,由特征查询和深度解码两个模块构成。

特征查询#

  • 编码器:ViT 编码图像得到 token;参照 DPT 设计重组模块,从多个 ViT 层抽取 token 并投影到不同隐藏维度。
  • 特征金字塔:浅层特征上采样到更高空间分辨率(保细节),深层特征保持原生分辨率(保语义),构成金字塔 {fk}k=1L\{f^k\}_{k=1}^L,fk∈Rhk×wk×Ckf^k\in\mathbb{R}^{h_k\times w_k\times C^k}。
  • 坐标映射:查询坐标 (x,y)(x,y) 映射到第 kk 尺度位置 (xk,yk)=(x⋅wkW, y⋅hkH)(x_k,y_k)=\left(x\cdot\frac{w_k}{W},\,y\cdot\frac{h_k}{H}\right)。
  • 局部聚合:在 (xk,yk)(x_k,y_k) 的 2×22\times2 网格邻域 Nk\mathcal{N}_k 上做双线性插值,得到该尺度的查询特征 f(x,y)k∈R1×Ckf^k_{(x,y)}\in\mathbb{R}^{1\times C^k}。

注意:特征查询用的是简单的双线性插值,而非学习偏移或交叉注意力。消融(表 9)显示这一最简单方案在度量深度上反而性能最好、开销最小。

深度解码#

将多尺度局部描述子从浅(细节)到深(语义)分层融合。令 h1:=f(x,y)1\mathbf{h}_1:=f^1_{(x,y)}(最高分辨率尺度),对 k=1,…,L−1k=1,\dots,L-1 用残差门控融合块逐级融合:

hk+1=FFNk ⁣(f(x,y)k+1+gk⊙Linear(hk)),\mathbf{h}_{k+1}=\mathrm{FFN}_k\!\left(f^{k+1}_{(x,y)}+\mathbf{g}_k\odot\mathrm{Linear}(\mathbf{h}_k)\right),

其中 Linear(⋅)\mathrm{Linear}(\cdot) 对齐维度,gk∈(0,1)Ck+1\mathbf{g}_k\in(0,1)^{C_{k+1}} 是可学习逐通道门控,⊙\odot 为逐元素乘,FFNk\mathrm{FFN}_k 为两层前馈网络。最终由 MLP 头输出深度:

dI(x,y)=MLP(hL).d_I(x,y)=\mathrm{MLP}(\mathbf{h}_L).

实现细节(补充):FFN 先 4 倍升维再压回;MLP 头三层线性 + ReLU,输入维 1024、隐藏维 256,末层后用 ELU 缓解梯度消失。

无限深度查询(采样策略)#

目的:逐像素反投影得到的点云密度不均,需要按表面面积分配采样预算,使三维点在表面上均匀。

关键观察——每像素对应的三维表面面积 ΔS(x,y)\Delta S(x,y) 受两个几何因素影响:

  • 深度平方缩放:远处像素覆盖的面积随距离平方增长(∝d2\propto d^2)。
  • 表面朝向效应:法向偏离视线时投影被压缩,单个像素覆盖更大实际面积。

据此定义自适应权重

w(x,y)=dI(x,y)2∣n(x,y)⋅v(x,y)∣+ε∝ΔS(x,y),w(x,y)=\frac{d_I(x,y)^2}{|\mathbf{n}(x,y)\cdot\mathbf{v}(x,y)|+\varepsilon}\propto\Delta S(x,y),

dI2d_I^2 对应深度平方缩放,∣n⋅v∣|\mathbf{n}\cdot\mathbf{v}| 补偿朝向效应。法向由隐式场可微性给出,对反投影点 X(x,y)\mathbf{X}(x,y) 关于连续图像坐标求雅可比并叉乘:

n(x,y)=∂xX×∂yX∥∂xX×∂yX∥∈R3.\mathbf{n}(x,y)=\frac{\partial_x\mathbf{X}\times\partial_y\mathbf{X}}{\|\partial_x\mathbf{X}\times\partial_y\mathbf{X}\|}\in\mathbb{R}^3.

采样实现(补充):将 wiw_i 归一化为概率 pi=wi/∑wip_i=w_i/\sum w_i,构建 CDF,用均匀分层逆变换采样取目标值 qj=j+0.5Nq_j=\frac{j+0.5}{N},找最小 kjk_j 使 CDF(kj)≥qj\mathrm{CDF}(k_j)\ge q_j,得到与 {pi}\{p_i\} 频率匹配的像素索引;再对每个选中像素加 U(−0.5,0.5)\mathcal{U}(-0.5,0.5) 亚像素抖动。最终在这些连续坐标查询并反投影,得到近似均匀覆盖的点云。

法向图(图 4)由 torch autograd 自动求导得到,间接说明模型内部几何质量高。

实现要点#

  • 编码器:DINOv3 ViT-Large;取第 4、11、23 层特征,投影到 256、512、1024 维;第 4、11 层特征分别上采样 4 倍、2 倍。
  • 训练数据:只用合成数据集(真实数据深度噪声多、不完整)。包括 Hypersim、VKITTI、TartanAir、IRS、UnrealStereo4K、UrbanSyn;补充中还有 MatrixCity、MVS-Synth、BlendedMVS、CREStereo、FSD、DynamicReplica。
  • 损失:隐式表示允许只监督稀疏采样点,随机取 NN 个坐标-深度对算 l1l_1 损失 L=1N∑i∣di−d^i∣\mathcal{L}=\frac{1}{N}\sum_i|d_i-\hat d_i|;每图采样 10 万对。
  • 优化:AdamW,学习率 1×10−51\times10^{-5},8 卡 NVIDIA GPU,单卡 batch 4,训练 80 万步。
  • 深度归一化:先转对数空间降低场景间方差,再用 2%/98% 分位做仿射不变归一化 dnorm=dlog−dmindmax−dmind_{norm}=\frac{d_{log}-d_{min}}{d_{max}-d_{min}}。
  • 亚像素监督:训练时保留真值深度图的原始(高于输入)分辨率,在像素内的亚像素坐标处监督;消融(表 7)证明优于仅在像素中心监督的逐像素监督。

Synth4K 基准#

动机:真实数据集真值深度低分辨率、稀疏,无法可靠评测高分辨率与细粒度能力。

  • 用 ReShade 从五款游戏(《赛博朋克2077》《漫威蜘蛛侠2》《迈尔斯·莫拉莱斯》《死亡岛》《看门狗》,记为 Synth4K-1 至 -5)抓取 3840×2160(4K)RGB-D,颜色与深度缓冲对应。
  • 每个子集数百对图像,覆盖室内外多样场景。
  • 高频(HF)掩码:对深度图在多平滑尺度 DsD_s 上算绝对拉普拉斯响应 L(Ds)\mathcal{L}(D_s),逐像素取多尺度最大 EE,用 98% 分位归一化得 E^\hat E,温度锐化 E~=E^1/τ\tilde E=\hat E^{1/\tau},归一化为采样概率后多项式采样得 HF 候选位置。掩码突出几何丰富区域,支持针对细节的定向评测。

实验#

评测协议与指标#

  • 相对深度:五个真实数据集 KITTI、ETH3D、NYUv2、ScanNet、DIODE,评测前做尺度-平移对齐;在 Synth4K 评测全图 4K 与 HF 掩码区域。指标 δ0.5,δ1,δ2\delta_{0.5},\delta_1,\delta_2,即满足 max⁡(d/d∗,d∗/d)<1.250.5,1.251,1.252\max(d/d^*,d^*/d)<1.25^{0.5},1.25^1,1.25^2 的像素百分比。
  • 度量深度:用 PromptDA 的深度提示模块引入稀疏深度(每图采样 1500 点),记为 Ours-Metric,不做对齐。因带稀疏输入精度更高,故采用更严阈值 δ0.01,δ0.02,δ0.04\delta_{0.01},\delta_{0.02},\delta_{0.04}(对应 1.01/1.02/1.04)。
  • 公平性:所有方法同输入分辨率(真实集 504×672,Synth4K 504×896);基线输出双线性上采样到 4K,本方法直接 4K 查询。

主要结果#

  • Synth4K(表 1 相对、表 2 度量):在所有子集、所有指标上显著领先所有现有方法,尤其在 HF 细节区域优势明显,凸显高分辨率与细粒度能力。
  • 真实数据集相对深度(表 3):Ours 与当前 SOTA 持平(KITTI/ETH3D/NYUv2 等多项 δ1\delta_1 领先)。
  • 真实数据集度量深度(表 4):Ours-Metric 明显优于 Marigold-DC、Omni-DC、PriorDA、PromptDA。Marigold-DC 因 VAE 量化损失导致度量精度低。
  • 定性(图 5、6、7、11、12):深度图、点云在边缘和高频区域更清晰、孔洞更少。

消融(表 5、7、8、9)#

  • 深度表示(隐式场 vs DPT 离散网格解码,同编码器同数据):度量深度提升显著,相对深度提升适中。原因:稀疏深度输入降低度量模糊性,隐式 + 局部预测进一步提精度;而纯 RGB 相对深度模糊性高,定量指标饱和,但视觉细节仍更好(图 7)。
  • 多尺度特征查询 vs 单尺度末层特征:多尺度带来跨数据集的显著提升。
  • 特征查询设计(表 9):双线性插值优于坐标偏移 MLP、局部集成、交叉注意力——后者增加参数与计算却无增益。
  • 编码器:DINOv3 vs DINOv2 在相对深度上无显著差异。
  • 效率与参数量(表 6):解码器参数量在所有对比方法中最低(约 15M);速度慢于 DepthAnythingV2、MoGe-2(它们用卷积解码器、细节较差),但优于同样追求细粒度的 DepthPro、Marigold、PPD,且细节水平更高。

应用:单视角新视角合成#

  • 给深度模型加轻量高斯泼溅(GS)头:用深度查询策略在可见表面生成均匀点作高斯中心,GS 头预测高斯属性(位置偏移 oo、颜色偏移 cc、尺度 ss、不透明度 α\alpha、旋转 rr),并用颜色与 Plücker 射线特征加 ViT 特征构成逐点 token。
  • 训练:冻结预训练 InfiniDepth 编码器,仅训 GS 头,学习率 1×10−41\times10^{-4},l1l_1 + LPIPS 监督,在 Waymo 子集训练、未见场景评测。
  • 结果(图 1c、8、13):相比预测像素对齐深度的 ADGaussian,大视角(如 BEV)下孔洞与伪影显著更少,结果更完整稳定。

局限与未来工作#

  • 仅单目、仅单视角深度数据训练;用于视频时无显式时间一致性约束,可能帧间闪烁。
  • 未来:扩展到多视角设定以提升时间稳定性与三维一致性,并融入更广的三维感知与重建流程。

评述与要点提炼#

  • 表示层面的换血:贡献核心不是新网络模块,而是把深度的基础表示从离散网格换成连续隐式场,由此自然解锁任意分辨率、细粒度、可微法向、稀疏点监督、亚像素监督等一系列性质。
  • 简单即有效:特征查询用最朴素的双线性插值反而最优,残差门控分层融合是主要的结构设计。
  • 评测闭环:自建 4K 的 Synth4K + HF 掩码,填补了现有真实基准无法评测高频细节的空白,是论文论证细粒度优势的关键支撑。
  • 下游价值:可微隐式场带来的几何感知采样策略,使同一表示直接服务于 NVS 的密度均衡,体现了表示的可复用性。
文章目录