신경 스타일 전이(NST)는 디지털 이미지나 비디오를 변형하여 다른 이미지의 외관이나 시각적 스타일을 채택하는 소프트웨어 알고리즘의 한 부류이다. NST 알고리즘은 이미지 변형을 위해 심층 신경망을 사용하는 것이 특징이다. 일반적인 용도로는 사진에서 인공 예술 작품을 만드는 것, 예를 들어 유명한 그림의 외관을 사용자가 제공한 사진에 전이하는 것이 있다. DeepArt와 Prisma와 같은 주목할 만한 모바일 앱은 NST 기법을 사용하며, 전 세계의 예술가와 디자이너는 기존 스타일을 바탕으로 새 작품을 개발하는 데 이 방법을 사용한다.
NST는 이미지 양식화의 한 예로, 비사실적 렌더링 분야에서 20년 넘게 연구된 문제이다. 첫 번째 예시 기반 스타일 전환 알고리즘은 이미지 유추와 이미지 퀼팅으로, 둘 다 패치 기반 텍스처 합성을 기반으로 한다. 이미지 유추는 변환을 학습하기 위해 훈련 쌍(사진과 그 사진을 묘사한 작품)을 필요로 했지만, 이미지 퀼팅은 그 처리 단계가 필요하지 않고 단 하나의 스타일에서만 시연되었다.
역사
첫 번째 NST 방법은 Leon Gatys 등이 쓴 "예술 스타일의 신경 알고리즘"이라는 논문에서 발표되었으며, 원래는 2015년에 ArXiv에 공개되고 2016년에 CVPR 회의에서 수용되었다. 원래 논문은 ImageNet 데이터셋에서 객체 인식을 위해 사전 훈련된 VGG-19 구조를 사용했다. 2017년에는 Google AI가 여러 스타일을 동시에 학습할 수 있는 단일 심층 합성 신경망 기반 스타일 전환 네트워크를 도입하여 비디오 미디어에서도 실시간 스타일 보간을 가능하게 했다.
수학
NST의 아이디어는 두 이미지를 취하는 것이다: 콘텐츠 이미지 \(\vec{p}\)와 스타일 이미지 \(\vec{a}\)를 취하고, 두 손실 함수의 가중 합을 최소화하는 세 번째 이미지 \(\vec{x}\)를 생성하는 것이다: 콘텐츠 손실 \(\mathcal{L}_{\text{content}}(\vec{p}, \vec{x})\)와 스타일 손실 \(\mathcal{L}_{\text{style}}(\vec{a}, \vec{x})\)이다. 총 손실은 선형 합이다: \(\mathcal{L}_{\text{NST}}(\vec{p}, \vec{a}, \vec{x}) = \alpha \mathcal{L}_{\text{content}}(\vec{p}, \vec{x}) + \beta \mathcal{L}_{\text{style}}(\vec{a}, \vec{x})\). 이 손실을 공동으로 최소화함으로써 NST는 콘텐츠 이미지의 콘텐츠와 스타일 이미지의 스타일을 혼합한 이미지를 생성한다.
두 손실은 이미지 간 유사성을 측정한다. 콘텐츠 유사성은 단일 합성 신경망(CNN)이 두 이미지에 대한 신경 활성화의 가중 합 제곱 차이이다. 스타일 유사성은 각 계층 내 Gram 행렬의 가중 합이다. 원래 논문은 VGG-19 CNN을 사용했지만, 방법은 어떤 CNN에도 작동한다.
기호
\(\vec{x}\)를 CNN에 입력되는 이미지로 하자. \(F^l \in \mathbb{R}^{N_l \times M_l}\)은 계층 \(l\)에서 필터 응답의 행렬로, 여기서 \(N_l\)은 계층 \(l\)의 필터 수이고, \(M_l\)은 각 필터 응답의 높이 곱하기 너비(픽셀 수)이다.
응용과 영향
NST는 소비자 응용 프로그램, 특히 사용자가 사진에 예술 스타일을 실시간으로 적용할 수 있는 모바일 앱에서 광범위하게 사용된다. DeepArt와 Prisma는 가장 주목할 만한 것으로, 이 기법을 일반 대중에게 널리 알렸다. 소비자 앱 외에도 NST는 디지털 아티스트와 디자이너가 독창적인 작품을 만드는 데 채택되었으며, 이후 Generative AI 및 이미지 생성 연구에 영향을 미쳤다. 신경 표현에서 콘텐츠와 스타일을 분리하는 이 기법의 능력은 스타일 기반 생성기 및 도메인 적응과 같은 Deep learning의 다른 분야의 작업에도 정보를 제공했다.
관련 기법 및 진화
NST는 딥 러닝 이전에 존재했던 이미지 생성 방법의 더 넓은군의 일부로, 이미지 유추 및 이미지 퀐팅과 같은 패치 기반 접근 방식을 포함한다. 심층 신경망의 도입은 더 유연하고 고품질의 스타일 전환을 가능하게 하여 중요한 진전을 나타냈다. 2017년 Google AI의 다중 스타일 학습 방법과 같은 이후의 발전은 효율성과 실시간 성능을 개선했다. NST는 또한 다른 Neural network 기반 이미지 변형 기법과 관련이 있으며, 그 원리는 종종 합성 네트워크가 아닌 Transformer (architecture) 모델과 같은 다른 구조를 사용하는 현대 Generative AI 시스템에 통합되었지만, 그러한 시스템은 종종 기제 다른 구조를 사용한다.
한계 및 고려 사항
초기 NST 방법은 계산량이 많이 요구되어 각 출력 이미지마다 반복적인 최적화가 필요했지만, 이후의 피드런 네트워크를 사용하는 접근 방식은 이 비용을 줄였다. 결과의 품질은 계층과 손실 가중치의 선택에 의존하며, 이 방법은 때때로 artifact를 발생하거나 미세한 세부 사항을 보존하지 못할 수 있다. 많은 Artificial intelligence 기법과 마찬가지로 NST는 파생 예술 작품을 만들 때 저작권과 독창성에 대한 문제를 제기하지만, 이러한 문제는 NST만의 독특한 것은 아니다.