오디오 인페인팅(audio inpainting)은 오디오 보간(audio interpolation)이라고도 불리며, 디지털 오디오 신호에서 손실되거나 손상된 부분을 재구성하는 오디오 복원 작업이다. 이 기법은 전송 오류, 데이터 손상, 또는 녹음 오류로 인해 오디오의 일부가 유실되었을 때 적용된다. 주요 목표는 들리는 왜곡을 피하면서 재구성된 부분이 원본 콘텐츠와 구별할 수 없도록 간격을 매끄럽게 채우는 것이다. 이는 각 누락 구간을 둘러싼 시간적 및 스펙트럼 정보를 분석하여 달성된다.
고전적인 방법은 통계적 모델이나 디지털 신호 처리 알고리즘을 사용하여 손상된 구간을 예측하고 합성하는 반면, 최근 솔루션은 딥러닝 모델을 활용하여 오디오 복원에서 데이터 기반 접근 방식의 광범위한 추세를 반영한다. 이 작업은 갭 길이에 따라 분류된다: 짧은 인페인팅(약 10밀리초 미만)은 클릭이나 클리핑과 같은 경우에서 흔히 발생하는 손실 정보의 정확한 복구를 목표로 하며, 긴 인페인팅(수백 밀리초에서 수 초)은 정확한 복구보다는 의미적으로 호환되는 새로운 정보를 생성해야 하며, 중간 인페인팅(수십 밀리초)은 이 사이에 위치하며 오디오의 비정상 특성이 중요해진다.
공식 정의
디지털 오디오 신호 \(\mathbf{x}\)를 고려하자. 손상된 버전 \(\tilde{\mathbf{x}} = \mathbf{m} \circ \mathbf{x}\)는 신뢰할 수 있는 샘플과 누락된 샘플을 인코딩하는 이진 마스크 \(\mathbf{m}\)를 사용하여 정의되며, \(\circ\)는 요소별 곱을 나타낸다. 오디오 인페인팅은 \(\mathbf{x}\)의 추정치인 재구성 \(\hat{\mathbf{x}}\)를 찾는 것을 목표로 한다. 이는 비고유한 솔루션 집합을 가진 잘못된 역문제(ill-posed inverse problem)이다. 최적 재구성 \(\hat{\mathbf{x}}^\)는 최적화를 통해 발견된다: \(\hat{\mathbf{x}}^ = \arg\min_{\hat{\mathbf{X}}} L(\mathbf{m} \circ \hat{\mathbf{x}}, \tilde{\mathbf{x}}) + R(\hat{\mathbf{x}})\), 여기서 \(L\)은 신뢰할 수 있는 프레임에서만 계산되는 거리 측정(예: 평균 제곱 오차)이고, \(R\)은 신호 정상성, 희소성, 또는 학습된 데이터 속성과 같은 사전 정보를 인코딩하는 정규화 항이다.
모델 기반 기법
모델 기반 기법은 때때로 고전적인 방법이라고도 불리며, 통계적 모델이나 디지털 신호 처리 알고리즘에 의존한다. 이러한 접근 방식은 로컬 신호 특성을 활용하여 누락된 구간을 예측하고 합성한다. 짧은 갭의 경우, 자기회귀 모델이나 보간 필터와 같은 방법은 높은 정확도로 누락된 샘플을 추정할 수 있다. 더 긴 갭의 경우, 모델 기반 기법은 정현파 모델이나 희소 표현과 같은 스펙트럼 모델링을 사용하여 그럴듯한 콘텐츠를 생성할 수 있다. 이러한 방법은 종종 계산 효율적이며 대규모 훈련 데이터 세트를 필요로 하지 않지만, 복잡한 비정상 오디오나 매우 긴 갭에는 어려움을 겪을 수 있다.
딥러닝 접근 방식
최근 솔루션은 특히 신경망과 같은 딥러닝 모델을 사용하여 오디오 인페인팅을 해결한다. 이러한 데이터 기반 방법은 대규모 오디오 예제 데이터 세트에서 누락된 부분을 재구성하는 방법을 학습한다. U-Net 및 잔차 네트워크와 같은 아키텍처가 일반적으로 사용되며, 종종 스펙트로그램 표현에서 작동한다. 생성 모델은 오디오에 적응된 트랜스포머 및 대규모 언어 모델을 포함하여 긴 갭에 대해 의미적으로 일관된 콘텐츠를 생성할 수 있다. 훈련은 일반적으로 재구성 정확도와 지각적 또는 적대적 손실을 결합한 손실 함수를 최소화하는 것을 포함하며, 이는 딥러닝 프레임워크에서 볼 수 있다. 이러한 방법은 복잡한 오디오와 긴 갭을 처리하는 데 뛰어나지만 상당한 계산 리소스와 데이터가 필요하다.
응용 및 과제
오디오 인페인팅은 오래된 녹음에서 클릭 제거, 손상된 전송 수리, 음성 또는 음악의 갭 채우기와 같은 오디오 복원에 실용적인 응용이 있다. 또한 오디오 편집 및 향상을 위한 인공지능 시스템에서도 관련이 있다. 과제로는 짧은 갭에 대한 정확한 복구와 긴 갭에 대한 의미적 생성을 균형 있게 맞추는 것, 시간적 일관성 보장, 아티팩트 방지가 포함된다. 문제의 잘못된 특성은 여러 유효한 재구성이 존재함을 의미하며, 정규화 또는 학습된 사전의 선택은 품질에 상당한 영향을 미친다. 최근 연구에서는 모델 기반 및 딥러닝 기법을 결합한 하이브리드 접근 방식이 두 가지의 강점을 활용하기 위해 탐구되고 있다.
같이 보기
- audio-restoration
- signal-processing
- Deep learning