【论文泛读】NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis

news2025/1/19 11:21:59

NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis | NeRF: 用于视图合成的神经辐射场的场景表示 | 2020年

出自文献:Mildenhall B, Srinivasan P P, Tancik M, et al. Nerf: Representing scenes as neural radiance fields for view synthesis[C]//European Conference on Computer Vision. Springer, Cham, 2020: 405-421.

img

Fig. 1:通过场景的一些图片作为输入,我们提出一种优化连续的 5D 神经辐射场表示的方法

摘要

  • 我们提出一种方法,使用较少的视图(view)作为输入,对一个连续、隐含的体积场景函数(volumetric scene function)进行优化,从而实现了关于复杂场景的新视图合成的最先进的结果。
  • 我们的算法用全连接深度网络来表示场景,其输入是 5D 坐标空间位置 ( x , y , z ) (x,y,z) (x,y,z)视角方向(viewing direction)$ (θ,ϕ)$;其输出是体积密度(volume density)和该空间位置上发射出来的辐射亮度(radiance,与视角相关)
  • 通过沿着相机光线(camera rays)获取 5D 坐标,使用经典的立体渲染(volume rendering)技术,我们将输出的颜色和密度投影到图像上,从而实现视图合成
  • 由于立体渲染是可导的,神经网络的优化,只需要提供一系列确定相机位姿的图像

1 介绍

  • 我们的工作,用新的方法解决了在

    视图合成(view synthesis)

    中长期以来的问题。

    • 我们直接优化一个连续的 5D 场景表示(scene representation)参数(网络权重),根据捕获到图像,最小化渲染误差。
    • 我们把静态场景表示为连续的 5D 函数(指输入是 5D ),输出在各个空间点 ( x , y , z ) (x,y,z) (x,y,z) 和各个方向 ( θ , ϕ ) (θ,ϕ) (θ,ϕ) 发射出来的辐射亮度密度(就像可导的透明度,控制穿过 ( x , y , z ) (x,y,z) (x,y,z) 的射线,可以累加多少辐射亮度)
    • 我们的方法是优化一个深度全连接的神经网络没有用到卷积层,全连接神经网络又称多层感知器(MLP);我们用这个 MLP 来表示这样的函数:根据一个 5D 坐标 ( x , y , z , θ , ϕ ) (x,y,z,θ,ϕ) (x,y,z,θ,ϕ),回归输出一个体积密度视角相关的 RGB 颜色
  • 整个流水线如下图所示:

img

Fig. 2: 神经辐射场场景表示 和 可导的渲染流程 的概述。我们的图像合成,通过(图 a)沿着相机光线采样出 5D 坐标(位置和视角方向);(图 b)把位置喂给 MLP,生成颜色和体积密度;(图 c)使用立体渲染技术,利用这些值得到一张图像。由于这个渲染函数是可导的,因此我们可以最小化 合成图像 和 真实观察图像 的残差,进行场景表示的优化。
  • 为了根据某一视角(viewpoint),渲染出这个神经辐射场(Neural Radiance Field, NeRF),我们:
    1. 使相机光线穿过场景,生成一组 3D 采样点
    2. 让这些 3D 点和对应的 3D 视角方向作为神经网络的输入,生成一组颜色密度
    3. 使用经典的立体渲染技术,累加这些颜色和密度,得到 2D 图像
  • 由于以上过程是可导的,我们可以使用梯度下降来优化模型,最小化 观测图像模型回归计算的图像之间的误差。
    • 这可以鼓励神经网络学习的场景模型具有一致性(coherent),即在包含场景内容的位置,可以得到较大的体积密度,和准确的颜色。
  • 我们发现对于复杂的场景,用简单的方法优化 NeRF 效果不理想:
    • 很难得到高分辨率的收敛结果;
    • 也不能高效利用相机光线所需的采样点。
  • 于是,我们这样解决以上问题:
    • 用一个位置编码(positional encoding)对输入 5D 坐标进行变换,使得 MLP 可以表示高频函数;
    • 提出层次化的采样流程(hierarchical sampling procedure),减少所需的采样点。
  • 我们的方法保留了体积表示的优点:
    • 可以表示复杂的几何和外观;
    • 可以通过投影图像进行梯度下降的优化。
  • 重要的是,我们的方法克服了体积表示的一个关键问题:在表示高分辨率的复杂场景时,离散的体素网格的存储空间成本非常高
  • 总结下来,本文的贡献如下:
    • 包含复杂几何和材质的连续场景的表示方法:使用参数化为 MLP 的 5D 神经辐射场
    • 基于立体渲染技术的可导的渲染流程,用于网络的优化。其中还包括层次化的采样策略,专注于可见的场景内容(visible scene content),充分利用了 MLP 的容量。
    • 使用位置编码,将输入 5D 坐标映射到更高维的空间,让 NeRF 可以学习表示高频的场景内容

2 相关工作

3 神经辐射场的场景表示

我们把一个连续的场景表示为一个 5D 向量值函数(vector-valued function)

  • 输入是 3D 位置 x = ( x , y , z ) x=(x,y,z) x=(x,y,z) 和 2D 视角方向 ( θ , ϕ ) (θ,ϕ) (θ,ϕ)
  • 输出是发射颜色 c = ( r , g , b ) c=(r,g,b) c=(r,g,b) 和体积密度 σ σ σ

在实际中,我们把视角方向表示为 3D 笛卡尔单位向量 d d d。我们用一个 MLP 网络来近似这个连续的 5D 场景表示:
F Θ : ( x , d ) → ( c , σ ) F_{\Theta}:(\mathbf{x}, \mathbf{d}) \rightarrow(\mathbf{c}, \sigma) FΘ:(x,d)(c,σ)
我们优化该网络的权重,使之对于每个输入 5D 坐标,都会得到对应的密度和有方向的发射颜色。

我们约束了预测体积密度 σ 的网络的输入仅仅是位置 X,而预测 RGB 颜色 C 的网络的输入是位置和视角方向,通过这种方式可以鼓励网络学习到多视角连续的表示

  • 在具体实现上,MLP F Θ F_{\Theta} FΘ 首先用 8 层的全连接层(使用 ReLU 激活函数,每层有 256 个通道),处理 3D 坐标 x x x,得到 σ σ σ一个 256 维的特征向量
  • 这个 256 维的特征向量,与视角方向一起拼接起来,喂给另一个全连接层(使用 ReLU 激活函数,每层有 128 个通道),输出方向相关的 RGB 颜色。

图 3 可以观察到,我们的方法可以表示出非朗伯体效应(non-Lambertian effects)。从图 4 可以观察到,如果训练模型时没有视角的依赖(只有 X 一个输入),那么模型会很难表示出高光(specularity)

img

Fig. 3:视角相关的发射辐射亮度。在(a)和(b),我们从不同视角定位相同位置的两个点。我们的方法可以预测两个 3D 点变化的高光现象。在图(c)中我们可以看到这个性质,在视角方向的半球上连续地呈现。

img

Fig. 4:展示我们的整个模型如何受益于视角相关的辐射亮度,以及如何受益于把输入坐标传入高频率位置编码的方法。如果去除视角相关性(view dependence),会导致模型失去镜面(高光)反射;如果移除位置编码,会大大降低模型表征高频几何和纹理信息的能力,导致过度平滑的外观。

4 辐射场的立体渲染

我们的 5D 神经辐射场把场景表示为:任意空间点上的体积密度有方向的辐射亮度使用经典的立体渲染的原理,我们可以渲染出任意射线穿过场景的颜色体积密度 σ ( x ) σ(x) σ(x) 可以解释为:光线停留在位置 X� 处的无穷小粒子的可导概率。在最近和最远边界为 t n t_n tn t f t_f tf 的条件下,相机光线 r ( t ) = o + t d r(t)=o+td r(t)=o+td 的颜色 C ( r ) C(r) C(r)为:
C ( r ) = ∫ t n t f T ( t ) σ ( r ( t ) ) c ( r ( t ) , d ) d t ,  where  T ( t ) = exp ⁡ ( − ∫ t n t σ ( r ( s ) ) d s ) \begin{equation} C(\mathbf{r})=\int_{t_{n}}^{t_{f}} T(t) \sigma(\mathbf{r}(t)) \mathbf{c}(\mathbf{r}(t), \mathbf{d}) d t, \text { where } T(t)=\exp \left(-\int_{t_{n}}^{t} \sigma(\mathbf{r}(s)) d s\right) \end{equation} C(r)=tntfT(t)σ(r(t))c(r(t),d)dt, where T(t)=exp(tntσ(r(s))ds)

函数 $T(t) $表示沿着光线从 t n t_n tn t t t累积的透明度(accumulated transmittance) ,即 光线从 t n t_n tn 出发到 t t t,穿过该路径的概率。视图的渲染需要求这个积分 C ( r ) C(r) C(r),它是就是虚拟相机穿过每个像素的相机光线,所得到的颜色。

我们使用求积法(quadrature)进行积分的数值求解。确定性的求积分不太适合 MLP,我们采用的是**分层抽样(stratified sampling)**的方法。我们把 [ t n , t f ] [t_n,t_f] [tn,tf]分成均匀分布的小区段,接着对每个小区段进行均匀采样:
t i ∼ U [ t n + i − 1 N ( t f − t n ) , t n + i N ( t f − t n ) ] \begin{equation} t_{i} \sim \mathcal{U}\left[t_{n}+\frac{i-1}{N}\left(t_{f}-t_{n}\right), t_{n}+\frac{i}{N}\left(t_{f}-t_{n}\right)\right] \end{equation} tiU[tn+Ni1(tftn),tn+Ni(tftn)]
我们使用采样的样本,用积分法则来计算 C ( r ) C(r) C(r)
C ^ ( r ) = ∑ i = 1 N T i ( 1 − exp ⁡ ( − σ i δ i ) ) c i ,  where  T i = exp ⁡ ( − ∑ j = 1 i − 1 σ j δ j ) \begin{equation} \hat{C}(\mathbf{r})=\sum_{i=1}^{N} T_{i}\left(1-\exp \left(-\sigma_{i} \delta_{i}\right)\right) \mathbf{c}_{i}, \text { where } T_{i}=\exp \left(-\sum_{j=1}^{i-1} \sigma_{j} \delta_{j}\right) \end{equation} C^(r)=i=1NTi(1exp(σiδi))ci, where Ti=exp(j=1i1σjδj)
其中, δ i = t i + 1 − t i \delta_{i}=t_{i+1}-t_{i} δi=ti+1ti 是相邻样本之间的距离。

5 神经辐射场的优化

前面所述的核心算法,还不够实现最先进的效果。因此我们还引入了两项优化措施,帮助模型能够表征高分辨率的复杂场景:

  1. 输入坐标的位置编码(positional encoding):帮助 MLP 能够表示高频函数;
  2. 层次化的采样方案(hierarchical sampling procedure),可以有效地采样模型的高频表示。

5.1 位置编码(positional encoding)

尽管神经网络理论上可以逼近任意函数,但我们发现,用网络 F Θ F_{\Theta} FΘ 直接处理输入坐标 x y z θ ϕ xyzθϕ xyzθϕ,很难表示出高频的细节。这符合 Rahaman 等人最近的工作,他们证明了深度网络倾向于学习到频率较低的函数。他们还证明,使用高频函数,把输入映射到更高维的空间中,再喂给神经网络,可以更好地拟合具有高频变化的数据

我们把这部分理论应用到了神经场景表示,重新构建函数 F Θ F_{\Theta} FΘ,作为两个函数的组合函数: F Θ = F Θ ′ ∘ γ F_{\Theta}=F_{\Theta}^{\prime} \circ \gamma FΘ=FΘγ,该方法可以明显提高性能。

在这里,γ 表示一个从 R \mathbb{R} R 到更高维空间 R 2 L \mathbb{R}^{2L} R2L 的映射, F Θ ′ F_{\Theta}^{\prime} FΘ是普通的 MLP

我们使用的编码函数为:
γ ( p ) = ( sin ⁡ ( 2 0 π p ) , cos ⁡ ( 2 0 π p ) , ⋯   , sin ⁡ ( 2 L − 1 π p ) , cos ⁡ ( 2 L − 1 π p ) ) \begin{equation} \gamma(p)=\left(\sin \left(2^{0} \pi p\right), \cos \left(2^{0} \pi p\right), \cdots, \sin \left(2^{L-1} \pi p\right), \cos \left(2^{L-1} \pi p\right)\right) \end{equation} γ(p)=(sin(20πp),cos(20πp),,sin(2L1πp),cos(2L1πp))
该函数分别应用于 X X X 的三个坐标,以及视角方向单位向量 d d d 的三个坐标。

在本文示例中,对于 γ ( x ) γ(x) γ(x) L = 10 L=10 L=10;对于 γ ( d ) γ(d) γ(d) L = 4 L=4 L=4

与 Transformer 架构中使用的位置编码不同,我们这里的编码函数,是为了把连续的输入坐标映射到更高维的空间,好让 MLP 能够更好地近似高频的函数

5.2 分层体积采样(Hierachical volume sampling)

我们的渲染策略,会沿着相机光线的 N 个查询点(query points),密集地计算神经辐射场。这种策略并不高效:空闲空间和遮挡的区域,并没有对渲染图像起作用,但是依然会进行重复地采样。我们借鉴了立体渲染的早起工作,提出了层次化表示来提升渲染效率:根据期望的渲染效果,来按比例地分配采样点

于是我们并没有使用单个网络来表示场景,我们会同时优化两个网络:粗糙网络和精细网络。我们首先使用分层抽样,来采样第一个集合,包含 N c N_c Nc 个位置点,用方程(2)和(3)来计算粗糙网络。根据粗糙网络的输出,我们可以沿着光线生成更明智的采样点

重写式子(3)中的粗糙网络 C ^ c ( r ) \hat{C}_{c}(\mathbf{r}) C^c(r)
C ^ c ( r ) = ∑ i = 1 N c w i c i , w i = T i ( 1 − exp ⁡ ( − σ i δ i ) ) \begin{equation} \hat{C}_{c}(\mathbf{r})=\sum_{i=1}^{N_{c}} w_{i} c_{i}, \quad w_{i}=T_{i}\left(1-\exp \left(-\sigma_{i} \delta_{i}\right)\right) \end{equation} C^c(r)=i=1Ncwici,wi=Ti(1exp(σiδi))
把这些权重进行标准化: w ^ i = w i / ∑ j = 1 N c w j \hat{w}_{i}=w_{i} / \sum_{j=1}^{N_{c}} w_{j} w^i=wi/j=1Ncwj

我们使用逆变换采样(inverse transform sampling),从该分布采样出第二个集合,包含 N f N_f Nf 个位置。我们用第一个采样点集合和第二个采样点集合的并集上,计算我们的精细网络,最后使用所有 N c + N f N_c+N_f Nc+Nf 个样本,用方程(3)计算最终的光线颜色 C ^ f ( r ) \hat{C}_{f}(\mathbf{r}) C^f(r)

使用这种方法,可以分配更多的样本点在包含场景内容的区域内。它解决了与**重要性抽样(importance sampling)**相同的目标。

5.3 实现细节

6 结果

6.1 数据集

6.2 对比

6.3 讨论

6.4 Ablation studies

7 结论

  • 于使用 MLP 作为连续函数,用来表示物体和场景的研究,我们克服了过去工作的不足。与过去基于 CNN 的常用方法相比,我们用 5D 神经辐射场(用 MLP 表示的函数,其输入是 3D 位置和 2D 视角方向,输出体积密度视角相关的辐射亮度)来表示场景,生成了更好的渲染效果。
  • 未来方向
    • 尽管我们提出了分层体积采样的策略,实现用于渲染的高效采样,但未来仍然有很多研究工作的空间,来更高效地实现神经辐射场的优化和渲染。
    • 后期工作的另一个方向是可解释性:诸如体素和网格的表示方法,可以很容易地推断渲染质量失效模式(failure modes),但是当我们以深度神经网络的权重,对场景进行编码时,就不清楚如何分析这些问题。
  • 我们希望本文的工作,可以推动基于真实世界图像的图形学流水线的发展,通过真实物体和场景的图像,复杂的场景都可以由神经辐射场来组成。

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.coloradmin.cn/o/386911.html

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈,一经查实,立即删除!

相关文章

泼辣修图Polarr5.11.4 版,让你的创意无限延伸

泼辣修图是一款非常实用的图片处理软件,它不仅拥有丰富的图片处理功能,而且还能够轻松地实现自定义操作。泼辣修图的操作界面非常简洁,功能也非常丰富,使用起来非常方便快捷。 泼辣修图拥有非常丰富的图片处理功能,包括…

【冲刺蓝桥杯的最后30天】day1

大家好😃,我是想要慢慢变得优秀的向阳🌞同学👨‍💻,断更了整整一年,又开始恢复CSDN更新,从今天开始逐渐恢复更新状态,正在备战蓝桥杯的小伙伴可以支持一下哦!…

Rockchip Android13 GKI开发指南

Rockchip Android13 GKI开发指南 文章目录Rockchip Android13 GKI开发指南GKI介绍Google upstream kernel下载及编译Rockchip SDK中GKI相关目录介绍Rockchip GKI编译代码修改编译固件烧写KO编译及修改添加新的模块驱动的方法调试ko方法开机log确认uboot阶段Android阶段KO加载KO…

Java IO流详解

文章目录一、File1.1 构造方法1.2 文件操作 方法1.3 目录操作 方法1.4 文件检测 方法1.5 获取文件信息 方法1.6 应用练习二、IO 流2.1 InputStream 字节输入流 (读)🍓FileInputStream🍓BufferedInputStream2.2 OutputStream 字节输出流 (写)&#x1f34c…

【Redis】redis大key和大value的危害,如何处理?

前序 还记得上次和同事一起去面试候选人时,同事提了一个问题:Redis的大key有什么危害?当时候选人主要作答的角度是一个key的value较大时的情况,比如: 内存不均:单value较大时,可能会导致节点之…

[经验分享]gpt-3.5-Turbo|unity中实现http接口调用gpt新接口以及信息处理的实现案例分享

最近openAI发布了目前chatGPT所使用的模型gpt-3.5-Turbo,之前使用了text-davinci-003模型做了一个galgame的AI女友对话的demo。这次趁着新接口的发布,对这个demo也同步更新了模型调用的代码。本篇文章将分享一下,如何在unity里使用UnityWebRe…

记录一次PWM信号异常问题

问题我使用单片机输出PWM控制机械臂,但是控制过程中,机械臂总是会出现莫名的抽动。利用示波器测试PWM信号,发现信号正常。过程(1)在反复的测试过程中,队友提出,将示波器的地线放在左侧的GND波形…

计算机EI会议论文,和EI期刊论文有什么区别? - 易智编译EaseEditing

EI期刊论文,是期刊论文的一种。顾名思义,就是指发在期刊上的论文。 期刊论文发表的格式需要具体参考各期刊文章的要求学术论文格式,主要会发在月刊/季刊/年刊/不定期的刊上。 目前,国际著名的科技文献检索系统是SCI(…

安卓-AndroidManifest.xml修复

解析编译之后的AndroidManifest文件格式:http://www.520monkey.com/archives/575 案例apk jadx打开发现AndroidManifest.xml异常,无法正常显示 那么我们用apktool反编译试试 apktool d APK逆向-2.apk -f可以看到报错了,显示不能解析此xml…

[SSD科普] 固态硬盘物理接口SATA、M.2、PCIe常见疑问,如何选择?

前言犹记得当年Windows 7系统体验指数中,那5.9分磁盘分数,在其余四项的7.9分面前,似乎已经告诉我们机械硬盘注定被时代淘汰。势如破竹的SSD固态硬盘,彻底打破了温彻斯特结构的机械硬盘多年来在电脑硬件领域的统治。SSD数倍于HDD机…

数据结构 “串“ 的补充提升与KMP算法及其优化的具体实现

❤️作者主页:微凉秋意 ✅作者简介:后端领域优质创作者🏆,CSDN内容合伙人🏆,阿里云专家博主🏆 ✨精品专栏:C面向对象 🔥系列专栏:数据结构与课程设计 文章目录…

XSS漏洞基本概念

目录 XSS的原理和分类 XSS漏洞分类 dom 存储型 XSS的危害 XSS漏洞的验证 XSS的黑盒测试 XSS漏洞的白盒测试 XSS的原理和分类 xss全称跨站脚本攻击xss(Cross Site Scripting) 为了不和层叠样式表(Cascading Style Sheets, CSS)的缩写混淆&am…

MCU实现对外部脉冲信号的计数功能

有的传感器会输出脉冲信号,MCU需要统计脉冲输入的个数,通常有如下实现方式: 1.GPIO中断 原理很简单,利用GPIO的上升沿或者下降沿中断,进中断的次数就是脉冲的个数。只需要在中断服务函数里计数即可。 使用GPIO中断需…

Streaming System是第一章翻译

GIthub链接,欢迎志同道合的小伙伴一起翻译 Chapter 1.Streaming101 如今,流数据处理在大数据中是非常重要的,其主要原因是: 企业渴望对他们的数据有更及时的了解,而转换到流处理是实现更低延迟的一个好方法&#xf…

使用vite+vue3.0 创建一个cesium基础应用 ----01 项目搭建

使用vitevue3.0 创建一个cesium基础应用 ----01 项目搭建 1.使用yarn创建一个vite项目 我们可以在vite官网找到vite创建项目的命令 https://cn.vitejs.dev/ 可以使用yarn创建项目选择使用vue3.0框架,语言使用js 创建完成后结构如下: 2.找到vite社区中的…

idea通过Dockerfile上传项目到服务器

Docker通过Dockerfile上传项目 文章目录Docker通过Dockerfile上传项目1.创建一个简单的springBoot项目2.写一个简单的接口3.写Dockerfile文件4.新建docker镜像5.上传代码运行1.创建一个简单的springBoot项目 点击文件–>新建–>项目 点击选择Spring Initializer &#x…

火山引擎 DataTester:A/B 实验如何实现人群智能化定向?

更多技术交流、求职机会,欢迎关注字节跳动数据平台微信公众号,回复【1】进入官方交流群 在精细化运营时代,用户需求和业务场景愈加多元,在产品功能迭代以及各类活动中,面向不同人群的兴趣点,有针对性地“精…

导师信息管理系统

技术:Java、JSP等摘要:随着我国教育产业化的飞速发展,社会对教育水平和教学管理软硬件的要求日益提高,尤其是对一个学校能够具有一整套的管理软件提出了更多的要求。为了适应这种形式,教育系统尤其是大学不仅首先要有坚…

小成本互联网创业怎么做?低成本创业的方法分享

多数人都会有想法创业,尤其是在互联网上面创业,很多人看到了商机,但是因为成本的原因又放弃了,实际上,小成本也可以互联网创业!那么,小成本互联网创业怎么做?低成本创业的方法在这里…

【React】React——redux

🚩🚩🚩 💎个人主页: 阿选不出来 💨💨💨 💎个人简介: 一名大二在校生,学习方向前端,不定时更新自己学习道路上的一些笔记. 💨💨💨 💎目…