DreamFusion是一项突破性的技术研究,它提出了一种利用预训练的2D扩散模型生成高质量3D对象的新方法。这项工作的核心创新在于,它不需要任何3D训练数据,而是通过巧妙地将2D图像生成能力转化为3D结构。传统文本到3D的生成通常依赖于大规模3D数据集,但DreamFusion绕开了这一限制,仅从文本描述出发即可构建具有几何细节和纹理的3D模型。

该方法基于一个关键观察:预训练的2D扩散模型(如Imagen)已经学会了丰富的视觉概念和空间关系。DreamFusion引入了一种名为“分数蒸馏采样”的技术,通过优化一个可微的3D表示(如NeRF)来匹配2D扩散模型在不同视角下生成的图像。这个过程类似于从多个角度“雕刻”一个3D形状,确保每个视角的渲染结果都符合文本提示的语义和风格。

在具体实现中,DreamFusion使用一个随机初始化的神经辐射场作为3D场景的表示。它通过随机采样摄像机角度,将渲染的2D图像输入到冻结的2D扩散模型中,计算扩散模型对当前渲染图像与理想图像之间差异的梯度。这个梯度信号被反向传播到3D表示上,逐步优化其几何和颜色参数。为了提升生成质量,系统还引入了深度损失和正则化项,防止模型产生模糊或过于平滑的几何结构。

实验结果表明,DreamFusion能够生成与文本描述高度一致的3D对象,例如“一只穿着西装的泰迪熊”或“一座由宝石构成的城堡”。生成的模型具有清晰的轮廓、合理的反射和阴影,并在多视角下保持一致性。与同期其他方法相比,DreamFusion的优势在于其通用性和零样本能力,它不需要针对每个类别进行单独训练,也不需要任何3D标注数据。

这项研究对计算机图形学、虚拟现实和创意产业具有深远影响。它简化了从文本到3D资产的创作流程,使得非专业用户也能通过自然语言生成可用的3D模型。DreamFusion还展示了2D扩散模型在理解三维结构方面的潜力,为未来多模态生成任务提供了新的思路。其代码和预训练模型已开源,促进了后续研究的发展。