InfiniDepth 论文笔记
InfiniDepth 阅读笔记 论文:InfiniDepth: Arbitrary-Resolution and Fine-Grained Depth Estimation with Neural Implicit Fields(arXiv 2601.03252v1,2026) 机构:浙江大学、理
论文主题导航
文章目录
InfiniDepth 阅读笔记
论文:InfiniDepth: Arbitrary-Resolution and Fine-Grained Depth Estimation with Neural Implicit Fields(arXiv 2601.03252v1,2026)
机构:浙江大学、理想汽车、深圳大学。项目页:zju3dv.github.io/InfiniDepth
一句话总结
把单目深度从离散网格表示改写成连续的神经隐式场 ,配一个多尺度局部隐式解码器,使深度可以在任意连续二维坐标处查询,从而实现任意分辨率、细粒度的深度估计;并由此衍生出抵消密度不均的深度查询采样策略,提升大视角变化下的单视角新视角合成。
研究动机
现有主流深度估计的根本局限在于离散网格表示:
- 预测位置被锁死在固定网格上,输出分辨率本质受限于训练图像尺寸,难以扩展到任意分辨率。
- 由网格还原稠密深度只能靠两种方式,二者都损失高频细节:卷积上采样会平滑;从隐变量线性投影到深度块难以表达局部几何变化。
- 在几何变化剧烈的区域(边缘、薄结构)容易预测失真。
另一个痛点在新视角合成(NVS):前馈式方法预测逐像素深度后反投影,得到的点云密度严重不均(远处点稀、斜面点稀),导致大视角变化下出现孔洞和伪影。
核心思想:用隐式神经表示(INR)替换离散网格。INR 将连续坐标映射到信号 ,与分辨率无关、参数更少、能表达细粒度几何,已在 NeRF、PiFU、LIIF、AnyFlow 等工作中验证。本文首次系统地把它用作单目深度的基础表示。
主要贡献
- 提出将深度建模为神经隐式场的新表示,论证其在任意分辨率与细粒度深度估计上的能力。
- 设计深度查询(采样)策略,在物体表面生成均匀分布的三维点,改善大视角变化下的 NVS 质量。
- 构建 Synth4K,一个从五款游戏采集的高质量 4K 深度基准,用于在高分辨率与精细几何细节层面做评测。
方法
问题定义:给定单张 RGB 图像 ,对图像平面任意连续坐标 估计深度
被实例化为多尺度局部隐式解码器,由特征查询和深度解码两个模块构成。
特征查询
- 编码器:ViT 编码图像得到 token;参照 DPT 设计重组模块,从多个 ViT 层抽取 token 并投影到不同隐藏维度。
- 特征金字塔:浅层特征上采样到更高空间分辨率(保细节),深层特征保持原生分辨率(保语义),构成金字塔 ,。
- 坐标映射:查询坐标 映射到第 尺度位置 。
- 局部聚合:在 的 网格邻域 上做双线性插值,得到该尺度的查询特征 。
注意:特征查询用的是简单的双线性插值,而非学习偏移或交叉注意力。消融(表 9)显示这一最简单方案在度量深度上反而性能最好、开销最小。
深度解码
将多尺度局部描述子从浅(细节)到深(语义)分层融合。令 (最高分辨率尺度),对 用残差门控融合块逐级融合:
其中 对齐维度, 是可学习逐通道门控, 为逐元素乘, 为两层前馈网络。最终由 MLP 头输出深度:
实现细节(补充):FFN 先 4 倍升维再压回;MLP 头三层线性 + ReLU,输入维 1024、隐藏维 256,末层后用 ELU 缓解梯度消失。
无限深度查询(采样策略)
目的:逐像素反投影得到的点云密度不均,需要按表面面积分配采样预算,使三维点在表面上均匀。
关键观察——每像素对应的三维表面面积 受两个几何因素影响:
- 深度平方缩放:远处像素覆盖的面积随距离平方增长()。
- 表面朝向效应:法向偏离视线时投影被压缩,单个像素覆盖更大实际面积。
据此定义自适应权重
对应深度平方缩放, 补偿朝向效应。法向由隐式场可微性给出,对反投影点 关于连续图像坐标求雅可比并叉乘:
采样实现(补充):将 归一化为概率 ,构建 CDF,用均匀分层逆变换采样取目标值 ,找最小 使 ,得到与 频率匹配的像素索引;再对每个选中像素加 亚像素抖动。最终在这些连续坐标查询并反投影,得到近似均匀覆盖的点云。
法向图(图 4)由 torch autograd 自动求导得到,间接说明模型内部几何质量高。
实现要点
- 编码器:DINOv3 ViT-Large;取第 4、11、23 层特征,投影到 256、512、1024 维;第 4、11 层特征分别上采样 4 倍、2 倍。
- 训练数据:只用合成数据集(真实数据深度噪声多、不完整)。包括 Hypersim、VKITTI、TartanAir、IRS、UnrealStereo4K、UrbanSyn;补充中还有 MatrixCity、MVS-Synth、BlendedMVS、CREStereo、FSD、DynamicReplica。
- 损失:隐式表示允许只监督稀疏采样点,随机取 个坐标-深度对算 损失 ;每图采样 10 万对。
- 优化:AdamW,学习率 ,8 卡 NVIDIA GPU,单卡 batch 4,训练 80 万步。
- 深度归一化:先转对数空间降低场景间方差,再用 2%/98% 分位做仿射不变归一化 。
- 亚像素监督:训练时保留真值深度图的原始(高于输入)分辨率,在像素内的亚像素坐标处监督;消融(表 7)证明优于仅在像素中心监督的逐像素监督。
Synth4K 基准
动机:真实数据集真值深度低分辨率、稀疏,无法可靠评测高分辨率与细粒度能力。
- 用 ReShade 从五款游戏(《赛博朋克2077》《漫威蜘蛛侠2》《迈尔斯·莫拉莱斯》《死亡岛》《看门狗》,记为 Synth4K-1 至 -5)抓取 3840×2160(4K)RGB-D,颜色与深度缓冲对应。
- 每个子集数百对图像,覆盖室内外多样场景。
- 高频(HF)掩码:对深度图在多平滑尺度 上算绝对拉普拉斯响应 ,逐像素取多尺度最大 ,用 98% 分位归一化得 ,温度锐化 ,归一化为采样概率后多项式采样得 HF 候选位置。掩码突出几何丰富区域,支持针对细节的定向评测。
实验
评测协议与指标
- 相对深度:五个真实数据集 KITTI、ETH3D、NYUv2、ScanNet、DIODE,评测前做尺度-平移对齐;在 Synth4K 评测全图 4K 与 HF 掩码区域。指标 ,即满足 的像素百分比。
- 度量深度:用 PromptDA 的深度提示模块引入稀疏深度(每图采样 1500 点),记为 Ours-Metric,不做对齐。因带稀疏输入精度更高,故采用更严阈值 (对应 1.01/1.02/1.04)。
- 公平性:所有方法同输入分辨率(真实集 504×672,Synth4K 504×896);基线输出双线性上采样到 4K,本方法直接 4K 查询。
主要结果
- Synth4K(表 1 相对、表 2 度量):在所有子集、所有指标上显著领先所有现有方法,尤其在 HF 细节区域优势明显,凸显高分辨率与细粒度能力。
- 真实数据集相对深度(表 3):Ours 与当前 SOTA 持平(KITTI/ETH3D/NYUv2 等多项 领先)。
- 真实数据集度量深度(表 4):Ours-Metric 明显优于 Marigold-DC、Omni-DC、PriorDA、PromptDA。Marigold-DC 因 VAE 量化损失导致度量精度低。
- 定性(图 5、6、7、11、12):深度图、点云在边缘和高频区域更清晰、孔洞更少。
消融(表 5、7、8、9)
- 深度表示(隐式场 vs DPT 离散网格解码,同编码器同数据):度量深度提升显著,相对深度提升适中。原因:稀疏深度输入降低度量模糊性,隐式 + 局部预测进一步提精度;而纯 RGB 相对深度模糊性高,定量指标饱和,但视觉细节仍更好(图 7)。
- 多尺度特征查询 vs 单尺度末层特征:多尺度带来跨数据集的显著提升。
- 特征查询设计(表 9):双线性插值优于坐标偏移 MLP、局部集成、交叉注意力——后者增加参数与计算却无增益。
- 编码器:DINOv3 vs DINOv2 在相对深度上无显著差异。
- 效率与参数量(表 6):解码器参数量在所有对比方法中最低(约 15M);速度慢于 DepthAnythingV2、MoGe-2(它们用卷积解码器、细节较差),但优于同样追求细粒度的 DepthPro、Marigold、PPD,且细节水平更高。
应用:单视角新视角合成
- 给深度模型加轻量高斯泼溅(GS)头:用深度查询策略在可见表面生成均匀点作高斯中心,GS 头预测高斯属性(位置偏移 、颜色偏移 、尺度 、不透明度 、旋转 ),并用颜色与 Plücker 射线特征加 ViT 特征构成逐点 token。
- 训练:冻结预训练 InfiniDepth 编码器,仅训 GS 头,学习率 , + LPIPS 监督,在 Waymo 子集训练、未见场景评测。
- 结果(图 1c、8、13):相比预测像素对齐深度的 ADGaussian,大视角(如 BEV)下孔洞与伪影显著更少,结果更完整稳定。
局限与未来工作
- 仅单目、仅单视角深度数据训练;用于视频时无显式时间一致性约束,可能帧间闪烁。
- 未来:扩展到多视角设定以提升时间稳定性与三维一致性,并融入更广的三维感知与重建流程。
评述与要点提炼
- 表示层面的换血:贡献核心不是新网络模块,而是把深度的基础表示从离散网格换成连续隐式场,由此自然解锁任意分辨率、细粒度、可微法向、稀疏点监督、亚像素监督等一系列性质。
- 简单即有效:特征查询用最朴素的双线性插值反而最优,残差门控分层融合是主要的结构设计。
- 评测闭环:自建 4K 的 Synth4K + HF 掩码,填补了现有真实基准无法评测高频细节的空白,是论文论证细粒度优势的关键支撑。
- 下游价值:可微隐式场带来的几何感知采样策略,使同一表示直接服务于 NVS 的密度均衡,体现了表示的可复用性。

