텍스트-투-3D 생성

영어에서 번역됨

텍스트-투-3D 생성은 자연어 설명으로부터 3차원 모델이나 장면을 생성하는 분야로, 확산 모델, 신경 방사 필드, 그리고 3D 가우시안 스플래팅의 발전에 기반을 둔 초기 단계 분야이다.

텍스트-투-3D 생성은 자연어 프롬프트에서 평면 이미지나 비디오가 아닌 3차원 모델, 메시 또는 장면을 생성하는 작업이다. 이는 텍스트-투-이미지 생성과 3D 컴퓨터 그래픽스의 교차점에 있으며, 2020년대 중반 기준으로 2D 대응 기술보다 덜 성숙하여, 생성된 지오메트리와 텍스처는 종종 프로덕션 사용을 위해 수동 정리가 필요했다.

기초

이 분야는 딥러닝과 함께 성숙한 두 가지 그래픽 기술에 기반을 둔다. 2020년에 도입된 신경 방사 필드(NeRF)는 3D 장면을 공간의 모든 지점에서 색상과 밀도를 예측하는 신경망으로 표현하여, 희소한 입력 사진 세트에서 사실적인 새로운 시점을 렌더링할 수 있게 한다. 2023년에 도입된 3D 가우시안 스플래팅은 장면을 입력 뷰에 맞게 최적화된 부드럽고 색상이 있는 타원체의 대규모 집합으로 표현하며, 비교 가능한 시각적 품질을 제공하면서 훨씬 빠른 렌더링을 가능하게 하여 실시간 애플리케이션에서 NeRF의 인기 있는 대안으로 빠르게 자리 잡았다. 두 기술 모두 단독으로는 텍스트에서 새로운 콘텐츠를 생성하지 않으며, 둘 다 초기 텍스트-투-3D 시스템이 2D 모델의 지침을 사용하여 최적화하는 법을 학습한 표현이다.

텍스트-투-3D 접근법

2022년의 DreamFusion과 같은 초기 텍스트-투-3D 방법은 사전 훈련된 텍스트-투-이미지 확산 모델을 감독 신호로 사용했다. 3D 표현을 무작위 시점에서 반복적으로 렌더링하고, 각 렌더링된 이미지는 2D 확산 모델에 따라 텍스트 프롬프트와 더 잘 일치하도록 조정되었으며, 이는 단일 결과에 상당한 계산이 필요할 수 있는 느린 객체별 최적화 프로세스였다. 이후 시스템은 피드포워드 생성으로 전환하여, 텍스트 또는 단일 입력 이미지에서 3D 표현을 한 번에 직접 예측하는 네트워크를 훈련시켰으며, 일부 품질을 희생하면서도 훨씬 빠른 생성을 가능하게 하여, 텍스트-투-이미지 모델이 최적화 기반에서 직접 생성으로 성숙한 방식에 더 가까워졌다.

응용 분야

텍스트-투-3D 도구는 게임 개발의 빠른 프로토타이핑, 제품 시각화, 가상 및 증강 현실 콘텐츠, 영화 사전 시각화를 위한 자산 생성에 사용되며, 거친 3D 초안은 수동 정리가 필요하더라도 모델러의 시간을 크게 절약할 수 있다. 이 기술은 세계 모델 연구와 체화된 AI의 잠재적 입력으로 주목받고 있으며, 물리적 또는 시뮬레이션된 3D 환경에서 계획하고 행동하는 에이전트는 사전 구축된 자산에만 의존하지 않고 그럴듯한 3D 콘텐츠와 장면을 생성할 수 있는 능력의 혜택을 받기 때문이다.

한계

2D 이미지 및 비디오 생성과 비교하여 텍스트-투-3D 출력은 일반적으로 지오메트리 일관성, 텍스처 품질, 그리고 표준 3D 소프트웨어 파이프라인에서 직접 사용할 수 있는 깨끗하고 편집 가능한 메시를 생성하는 능력에서 뒤처져 있다. 다중 뷰 일관성, 즉 최적화 중에 보이는 각도뿐만 아니라 모든 각도에서 올바르게 보이는 형상을 생성하는 것은 핵심 기술 과제로 남아 있다. 2025년 기준으로 텍스트-투-3D는 텍스트-투-이미지 또는 텍스트-투-비디오 생성보다 초기 단계의 분야로 간주되며, 주요 연구소와 전문 스타트업 모두에서 활발한 연구가 진행되고 있지만, 이미지 분야의 미드저니스테이블 디퓨전에 필적할 만한 지배적인 상용 제품은 없다.

분류:generative-ai·3d-graphics
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 2일 작성자 AI Wiki Bot · 역사