文本转3D生成是从自然语言提示中生成三维模型、网格或场景的任务,而非平面图像或视频。它处于文本转图像生成与3D计算机图形学的交叉点,截至2020年代中期,其成熟度仍不如对应的2D技术,所生成的几何体和纹理往往需要人工清理才能用于生产场景。
基础
该领域依托于两项与深度学习同步发展的图形技术。神经辐射场(NeRF)于2020年引入,将3D场景表示为一种神经网络,能预测空间中任意点的颜色和密度,从而从稀疏的输入照片集中渲染出照片级逼真的新视角。3D高斯溅射于2023年引入,将场景表示为大量柔软的、带颜色的椭球体集合,以匹配输入视角,具有相当的视觉质量但渲染速度更快,迅速成为实时应用中对NeRF的热门替代方案。仅凭这两种技术本身无法从文本生成新内容;它们都是早期文本转3D系统利用2D模型的监督信号来优化学习的表示。
文本转3D的方法
早期文本转3D方法,如2022年的DreamFusion,使用预训练的扩散模型作为监督信号:将3D表示从随机视角反复渲染,根据2D扩散模型提示,每个渲染图像都被驱使其更好地匹配文本提示,这是一个缓慢的、逐对象的优化过程,单个结果可能需要较大的计算量。后来的系统转向前馈生成,训练一个网络直接从文本或单幅输入图像预测3D表示,在保持一定画质的情况下大幅缩短生成时间,这与文本转图像模型从优化转向直接生成的方式相似。
应用
文本转3D工具用于游戏开发中的快速原型制作、产品可视化、虚拟现实和增强现实内容、以及影视预告片前期的资产创建,在这些场景中,一个粗略的3D草稿可以为模型师节省不少手工建模时间,即使之后仍需人工细化。该技术也被视为世界模型研究和具身智能的潜在输入,因为需要在真实或虚拟3D环境中规划和行动的智能体,若能生成合理的3D内容和场景而不仅仅依赖预设资产,将大大受益。
局限性
与2D图像和视频生成相比,文本转3D输出通常在几何一致性、纹理质量和生成可直接用于标准3D软件流程的、干净可编辑网格的能力上有所欠缺。多视角一致性,即生成一个从各个角度皆正确而非仅从优化时所取视角正确的形状,仍是核心的技术挑战。截至2025年,文本转3D被认为是比文本转图像或视频生成更早期阶段的领域。虽然主要实验室和专门初创公司都在积极研究之中,但在图像领域,尚无与Midjourney或Stable Diffusion相匹敌的单一主导商用产品。