3D生成高频术语小词典:NeRF、高斯泼溅与AI造物
3D生成技术正从实验室走向应用,但五花八门的术语常让人一头雾水。这份小词典帮你抓住核心概念。
神经辐射场(NeRF):从二维照片中“挤出”三维世界
NeRF的全称是Neural Radiance Fields(神经辐射场),2020年提出后迅速成为3D视觉领域的明星技术。简单说,它用一组二维照片(比如从不同角度拍的同一物体),训练一个小型神经网络来“记住”这个物体在三维空间每个点上的颜色和密度。之后,任意给定一个新视角,网络就能合成出那个视角下的逼真图像。
为什么它重要? 传统三维重建依赖特征点匹配和三角测量,容易丢失细节(比如透明物体、反射面)。NeRF通过连续函数逼近,能生成极高保真的新视角图像,尤其擅长毛发、玻璃、烟雾等复杂结构。但代价是训练慢(数小时到一天),渲染更慢(单帧几秒到几十秒),而且只能处理静态场景。到2026年,已经有多种加速方案将单帧渲染压到实时,但高质量NeRF仍需要专业GPU。
常见误区: NeRF生成的“三维模型”不是传统意义上的多边形网格,而是一个隐式表示——你不能直接编辑它、给它换材质,只能“拍照”。如果要做游戏资产或工业设计,需要额外转换步骤。
高斯泼溅(Gaussian Splatting):实时渲染的新宠儿
高斯泼溅(Gaussian Splatting,简称3DGS)是2023年兴起的技术,直击NeRF的渲染速度瓶颈。它把场景表达成成千上万个三维高斯椭球体(有点像微小的“水滴”),每个椭球有自己的位置、形状、颜色和透明度。渲染时,这些椭球被“泼溅”到屏幕上,混合出最终图像。
与NeRF的差异: NeRF隐式存储信息,渲染需要沿光线反复查询网络;高斯泼溅显式存储椭球参数,渲染速度可超100 FPS(帧每秒),且训练时间从小时级降到分钟级。因此它很快被用于沉浸式视频、VR/AR等实时场景。到2026年,许多手机端3D扫描应用已经集成高斯泼溅,扫描一圈即可生成可实时浏览的模型。
局限: 高斯泼溅对动态场景的支持仍在完善,且存储空间比NeRF大(每个椭球存一组参数,场景规模大时可能占用数GB)。此外,它生成的依然是连续场,不能直接导出为可编辑网格。
文本到3D生成:用一句话“打印”物体
“文本到3D”指输入一句文字描述(如“一只蓝色陶瓷茶杯”),AI自动生成对应的三维模型。这是大模型多模态能力的延伸——图像生成已经成熟,3D生成则因数据稀缺和几何复杂性更难。主流方法分两种:
- 基于2D先验的方法:利用已有的文本到图像模型(如Stable Diffusion),从多个角度“画”出目标的二维图片,再用NeRF或SDS(得分蒸馏采样)技术反推3D结构。优点是无需大量3D数据,缺点是生成结果常有“多面体病”(不同角度不一致)。
- 直接3D生成方法:训练一个从文本到3D表示的端到端模型(如Point-E、Shap-E),直接输出点云或隐式编码。速度更快,但保真度低于基于2D先验的方法。
实际应用: 游戏原画师用来快速构思道具,电商平台自动生成商品展示模型。但当前还做不到“一次生成直接可用”,多数需要后期手工优化。2026年,该技术已能生成中等复杂度(几百个面)的模型,细节控制仍然是挑战。
隐式表示与显式表示:三维数据的两种“语言”
这是3D生成中最基础的概念之一,决定了你拿到的模型能被怎么用。
隐式表示:不直接存储几何点坐标,而是用一个函数(如神经网络或场)来描述“某个点是否在物体内部”或“该点的颜色密度”。NeRF、Occupancy Networks、Signed Distance Function(SDF)都属于隐式。优点是分辨率理论上无限高,适合复杂拓扑(如洞穴、血管)。缺点是不能直接编辑、需要二次提取才能得到网格。
显式表示:直接给出几何数据,常见形式有四类:
- 多边形网格(Mesh):三角形或四边形组成的表面,游戏和电影工业的标准。
- 点云(Point Cloud):三维点的集合,LiDAR扫描产物。
- 体素(Voxel):类似三维像素,规则网格,适合运算但存储大。
- 高斯泼溅椭球群:属于显式,但非传统几何。
如何选? 如果要跑实时渲染或导入游戏引擎,选网格;如果要做医学影像分析,隐式SDF更灵活;如果只是看个外观,高斯泼溅又快又逼真。
3D扩散模型:用“去噪”思路创造立体世界
扩散模型在图像领域已经家喻户晓(如DALL·E、Midjourney),3D扩散模型则是同样的理念迁移到三维。它学习从随机噪声中逐步恢复出干净的三维数据(点云、体素或隐式场)。训练时,对3D样本加噪声;推理时,从纯噪声开始一步步去噪,得到新样本。
主要挑战:三维数据远比二维图像稀疏且不规则,直接应用U-Net架构效果不佳。改进方向包括:
- 在隐空间做扩散(如训练一个3D VAE,把网格压缩到低维向量再扩散);
- 使用多视图扩散(同时生成多个视角的图,再融合成3D);
- 引入掩码策略(如Masked Diffusion Transformer)。
现状:2026年,3D扩散模型已能生成类别级物体(椅子、汽车、动物),但生成与文本精准对齐的复杂场景仍需结合其他技术。它的优势在于多样性——一次采样可得多种风格,而且可以通过条件控制(如给定部分点云)。
多边形网格与体素:最经典的两种3D数据格式
虽然新概念层出不穷,但多边形网格(Mesh)和体素(Voxel)依然是3D生成绕不开的基础。
多边形网格:由顶点、边和面组成,面多为三角形或四边形。几乎所有实时渲染引擎(Unity、Unreal)都原生支持网格。AI生成网格的难点在于自动保持拓扑正确(无空洞、无自交)。近年出现了一些“网格生成”专用模型(如MeshGPT),直接输出三角形流,但质量尚不能匹敌手工建模。
体素:把空间划分为规则立方格,每个格子标记是否有物体。体素容易计算布尔运算和物理模拟,也适合三维卷积神经网络。但分辨率一高(如512³),存储就爆炸。为此出现稀疏体素(如Octree)和混合表示(如Triplane)。
取舍:工业界偏爱网格(轻量化、易编辑),学术界偏爱体素(计算友好)。很多生成流水线采用“隐式场→提取网格”的两步走,既确保细节又得到可用格式。对于只想看效果的普通用户,体素和网格的差异不大。
以上六个术语覆盖了3D生成从采集、表示到合成的核心链条。下次听到“NeRF渲染”“高斯泼溅”“文本到3D”时,你至少知道它们各自解决什么问题、又有什么短板。技术仍在快速演化,2026年的今天,实时3D生成已不再遥远,但真正像“拍照一样做模型”还需要更多突破。
常见问题
NeRF和高斯泼溅哪个更适合做三维扫描
如果需要实时预览(如AR展示),选高斯泼溅;如果需要较高精度且不着急渲染,选NeRF。日常扫描高斯泼溅更省时。
文本到3D生成出来的模型可以直接用吗
多数情况需后期清理——模型可能缺少背面、几何有瑕疵。它更适合作为创意草稿,而非可直接投产的资产。
隐式表示和显式表示有什么区别
隐式用函数描述几何(如NeRF),适合复杂形状但不可编辑;显式直接存点或面(如网格),可编辑但分辨率受限。
3D扩散模型和图像扩散模型是一回事吗
核心思想相同,但3D数据更稀疏,模型结构需特殊设计(如用点云替换像素)。生成效果目前落后图像扩散。
多边形网格和体素哪个更常用
游戏和影视90%用网格,因为轻量易压缩。体素用于医学、科学计算,但分辨率高时文件巨大。
高斯泼溅的存储量会不会太大
是的,一个场景可能几十万到数百万个椭球,每个保存33个浮点数,文件可达GB级。压缩算法正在改进。
2026年3D生成技术较大突破在哪
实时高斯泼溅和端到端文本生成成熟度提升,普通用户可用手机完成高质量3D扫描与生成。