深度学习抗锯齿(DLAA)是一种实时图像重建技术,它利用深度神经网络来平滑渲染图形中的锯齿边缘(即混叠伪影)。与依赖固定算法的传统抗锯齿方法不同,DLAA使用经过训练的Neural network,从低分辨率或部分采样的图像中推断出高细节的干净边缘。它主要用于对视觉保真度要求极高的视频游戏和交互式3D应用中,并且经常与同样使用AI但优先考虑性能提升的放大技术进行对比,后者通过以较低内部分辨率渲染再放大来实现性能增益。
DLAA的核心原理是将Artificial intelligence的计算能力应用于空间和时间混叠这一具体问题。传统方法如多重采样抗锯齿(MSAA)或快速近似抗锯齿(FXAA)要么需要大量内存带宽,要么产生模糊结果。DLAA则从大量高质量图像数据集中学习理想边缘应呈现的样子,使其能够从嘈杂或低分辨率的输入中重建出清晰、接近原生分辨率的图像。这种方法是将Machine learning应用于计算机图形学的一种形式,利用了现代Deep learning架构的模式识别能力。
技术方法
DLAA系统通常在主场景渲染后的后处理阶段运行。网络接收渲染帧(通常分辨率低于显示分辨率),以及运动矢量和深度信息。这些辅助输入帮助网络理解时间连贯性和对象边界,使其能够复用前一帧的信息来稳定图像并减少闪烁。网络本身通常基于Encoder-Decoder Architecture架构,该架构将输入压缩为潜在表示,然后扩展以生成最终的高分辨率输出。训练此类网络需要大量成对的低质量与高质量图像语料库,这一任务通常在Google Cloud或Amazon Web Services集群等强大硬件上执行。
关键组成部分是时间数据的处理。没有时间反馈,神经网络可能会在帧间产生不一致的结果,导致闪烁或重影。通过将前一帧馈入网络,DLAA可以实现与时间抗锯齿(TAA)相当的稳定性,同时产生更清晰的结果。这通常涉及当前帧与历史缓冲区之间类似于Cross-Attention的过程,使网络能够选择性地混合新旧信息。
与放大技术的对比
DLAA常与Nvidia的DLSS(深度学习超采样)或AMD的FSR(FidelityFX超分辨率)等基于AI的放大器归为一类,但存在关键区别。放大器以较低内部分辨率渲染游戏,然后使用AI将其放大到显示分辨率,从而提升帧率。相比之下,DLAA以原生显示分辨率渲染,然后应用神经网络来清理图像。这意味着DLAA不会提升性能,反而因额外计算而通常略有降低,但它提供了最高的图像质量。这使其成为拥有强大显卡、优先考虑视觉效果而非帧率的玩家的首选。
这种区别类似于使用Large language model总结文本与使用它生成新内容之间的差异;两者使用相同的基础技术但目标不同。在Generative AI的语境下,DLAA是一项判别性或重建性任务,而非生成性任务,因为它旨在恢复现有细节而非发明新信息。
硬件与软件支持
DLAA于2020年由Nvidia首次作为其DLSS 2.0技术的一部分引入,在同一软件开发工具包中作为独立模式提供。自那时起,它已被许多游戏开发者采用,通常作为图形设置中的可切换选项。虽然Nvidia的实现是专有的,并要求其RTX显卡,但其他供应商也探索了类似思路。例如,AMD开发了自己的FSR技术,其中包括一种功能类似于DLAA的原生质量模式,尽管它不基于深度学习。Intel的XeSS(Xe超采样)也包含一种可用于其Arc显卡抗锯齿目的的质量模式。
DLAA的实现并非易事。它需要访问运动矢量和深度缓冲区,而这些并不总是由游戏引擎公开。这导致了集成挑战,并非所有游戏都支持它。然而,Unreal Engine和Unity等主要游戏引擎已添加对各种DLAA实现的原生支持,简化了开发者的流程。计算成本也相当高,因为神经网络必须实时运行,通常每帧需在几毫秒内完成。这通常由现代GPU中的专用张量核心或类似的AI加速器来加速。
应用与未来方向
除了游戏之外,DLAA在虚拟现实(VR)和建筑可视化等其他实时渲染领域也具有潜在应用,这些领域对图像质量要求极高。在VR中,高分辨率和帧率要求使混叠尤为明显,DLAA有助于减少超采样的计算负担。在专业可视化中,DLAA可用于渲染复杂场景的高质量预览,而无需昂贵的离线渲染流程。
该领域的研究仍在进行中,新的架构和训练方法不断涌现。诸如残差网络和Batch Normalization等技术常用于提高训练稳定性和性能。该领域也受到Computer vision和图像处理进展的影响,BAIR (Berkeley AI Research)等学术机构为理论基础贡献了力量。随着Neural network硬件变得更加强大和高效,DLAA很可能成为所有实时图形应用的标准功能,最终完全取代传统抗锯齿方法。
局限性与挑战
尽管具有优势,DLAA并非没有局限性。输出质量高度依赖于训练数据以及网络泛化到未见场景的能力。某些类型的内容,如精细文本或重复图案,仍可能引发伪影。当物体快速移动时可能出现重影,时间反馈回路也可能引入延迟。此外,某些实现的专有性使其与特定硬件供应商绑定,限制了其采用范围。开源替代方案正在涌现,但它们通常需要更多调参,且可能无法达到同等质量水平。与任何Machine learning系统一样,也存在对训练分布过拟合的风险,这可能导致在边缘情况中出现意外行为。