三维重建,入门到精通!Bilibili的Up主“意の茗”分享
Bilibili 的 Up 主“意の茗”分享三维重建学习资源,涵盖 NeRF、SLAM、渲染、评价指标与数据集。

原文刊载于微信公众号「布尔艺数」,发布日期:2023-04-26。查看原文。以下为当时发布的内容。
Bilibili的Up主“意の茗”(意の茗的个人首页),研究生在读,主要研究方向是三维重建。
当前的三维重建前沿在研究什么呢?
纵向来看,靠近底层,是越来越鲁棒的特征描述和匹配,是精度越来越高的相机位姿估计,是速度越来越快的多视角几何(MVS,Multi-View Stereo)和运动结构恢复(SfM,Structure from Motion);走向顶层,是直接从2D图像逆渲染出的3D模型的神经隐式辐射场(NeRF,Neural Radiance Field),与生成扩散模型(Difussion Models)结合的ACGI(AI Generated Content),乃至多模态交互建模和编辑等等。
横向来看,三维重建的特征描述子从传统的SIFT、ORB等等发展到了基于深度学习的抽象特征,甚至引入注意力机制实现抗模糊和弱纹理的效果;而基于此的三维重建方法也都从以COLMAP为代表的传统管线,向着端到端的深度学习方法演变,进而引入语义信息和动态内容。

而这些向着各个角度拓展的分支方向,有着一脉相承的核心思想,或者说,有着共同的落地点,那就是同步定位与建图(SLAM,Simultaneous Localization And Mapping)。SLAM前端的主要任务是相机追踪,沿着三维重建纵向的脉络向下考验位姿估计算法的精度;后端的重要内容是建图,顺着三维重建的向上发展由稀疏特征点,到稠密点云,再到神经隐式地图。而SLAM本身的定位与建图功能又让它在横向上得以在机器人定位和避障、自动驾驶、虚拟现实等应用中发挥核心作用。

总得来说,SLAM作为一个庞大繁杂的系统,整合了当前三维重建各个方向的前沿进展,对系统中各个方法组件都提出了最高的性能要求。因此,当有人问我如何入门三维重建,我都会建议它去看高翔博士的《视觉SLAM十四讲》。

一直以来,传统算法主导着SLAM的研究方向,因为它们精确且快速。然而,传统算法往往难以对多变的现实数据鲁棒,这时就需要引入深度学习方法,来从更高维的特征空间分析、构造三维信息。将深度学习方法引入SLAM前端已不是新鲜事,而用神经网络替换SLAM的后端点云却是最近才兴起的思路,代表性的方法便是NeRF。
-
【论文讲解】Nice-SLAM:当NeRF遇到SLAM,会有多Nice?

NICE-SLAM的pipeline
NeRF跳过特征提取,直接用多层感知机(MLP,Multilayer Perceptron)从2D图像拟合3D模型,用可微的体渲染和连续的位姿表达,让NeRF模型有了新视角合成能力,而这种能力可以弥补传统点云模型的空洞,预测遮挡区域,从而让点云地图能够跳过曲面重建、纹理贴图、光线追踪等步骤,直接进行照片级渲染,从而满足自动驾驶、虚拟现实的应用需求。

当然,NeRF并非为SLAM而生,将它应用于SLAM系统仍有很大的阻碍,我整理了一下当前基于NeRF的SLAM方法,展示了当前学者们在为NeRF融入SLAM做着怎样的努力。
综上,本频道会重点关注NeRF的前沿进展,探究将它们应用到SLAM中的可能性,分享自己的感悟和思考,在为大家带来启发的同时,为这个社区贡献自己的一份力。
当前,已有的视频涉及以下内容:
(1)SLAM需要快速甚至实时的后端建图,而当前NeRF方法在尽可能地加速以满足实时需求;
(2)SLAM需要精确的相机位姿估计,而NeRF本身依赖已知的相机位姿,于是有了一些无需位姿输入的NeRF方法;
(3)SLAM需要不断地拓展地图,而原版NeRF受限于MLP的容量,难以建模大场景,因此这也是突破方向之一;
-
List
看不懂?没关系,还有些入门向的知识点讲解与资源分享:


