AI 음악 생성은 머신러닝을 이용해 음악을 작곡, 편곡, 또는 제작하는 시스템을 의미하며, 짧은 기악 루프를 생성하는 도구부터 장르, 분위기, 가사를 설명하는 텍스트 프롬프트로 보컬이 포함된 완전한 노래를 제작할 수 있는 시스템까지 다양한 범위를 포함한다.
역사
알고리즘 작곡은 딥러닝보다 수십 년 앞서 존재했지만, 신경망 기반 음악 생성은 Google의 WaveNet 기반 오디오 연구와 OpenAI의 MuseNet 및 Jukebox(2019년과 2020년에 공개)와 같은 모델을 통해 추진력을 얻었다. 이 모델들은 다양한 아티스트와 장르의 스타일로 원본 오디오를 생성할 수 있었지만, 출력 품질과 긴 곡에서의 일관성은 여전히 제한적이었다. 이 분야는 2023년과 2024년에 Suno와 Udio의 등장과 함께 주류 사용으로 결정적으로 전환되었으며, 이 서비스들은 사용자가 짧은 텍스트 설명만으로 1분 이내에 가사와 보컬을 포함한 완전한 노래를 생성할 수 있게 했다. 이는 일반 청취자가 인간이 만든 음악과 구별하기 어려울 정도의 완성도와 장르 다양성을 달성했다.
기술적 접근
현대의 텍스트-음악 시스템은 일반적으로 구조와 가사를 계획하는 자기회귀 모델 구성 요소와 실제 파형 또는 중간 스펙트로그램 표현을 렌더링하는 확산 모델 또는 자기회귀 오디오 생성기를 결합하며, 이는 텍스트-음성 변환 및 텍스트-비디오 변환에 사용되는 기술과 유사한 방식이다. 일부 시스템은 오디오를 종단 간 직접 생성하는 반면, 다른 시스템은 작곡, 편곡, 보컬 합성을 단계별로 분리한다. 음성 복제와 마찬가지로, 참조 음성이나 스타일에 따라 생성을 조건화하는 능력은 특정 실제 아티스트의 노래 목소리를 모방하는 곡을 제작할 가능성을 제기했다.
저작권 및 업계 대응
음악 생성은 특히 논쟁의 여지가 많았는데, 이는 이러한 모델의 학습 데이터에 종종 라이선스 없이 저작권이 있는 상업용 녹음물이 포함되었기 때문이다. 2024년, Universal Music Group, Sony Music, Warner Music을 포함한 주요 음반사들은 대규모 저작권 침해를 주장하며 Suno와 Udio를 상대로 소송을 제기했으며, 이는 생성형 AI 기업들을 상대로 한 광범위한 AI 저작권 소송의 일부였다. YouTube와 Spotify를 포함한 일부 플랫폼은 AI 생성 트랙에 대한 공개 의무와 삭제 메커니즘을 도입하거나 논의했으며, AI 지원 또는 AI 생성 노래가 저작권 보호, 스트리밍 로열티, 또는 차트 등재 자격을 받을 수 있는지에 대한 질문은 2020년대 중반까지 대부분의 관할권에서 해결되지 않은 채 남아 있었다.
반응
음악가와 프로듀서들은 엇갈린 반응을 보였다. 일부는 아이디어 데모, 반주 트랙, 또는 창작 블록 극복을 위해 생성 도구를 수용한 반면, 다른 이들은 이 기술을 세션 뮤지션, 작곡가, 독립 아티스트의 생계에 대한 직접적인 위협으로 보았으며, 이는 텍스트-이미지 생성에서 제기된 노동 대체 우려와 유사하다. 스트리밍 플랫폼은 또한 로열티 파밍을 위해 대규모로 업로드되는 AI 생성 트랙의 증가를 보고했으며, 이는 ai slop으로 설명되는 콘텐츠 범람에 대한 더 넓은 우려에 기여했다. 2020년대 중반까지 AI 생성 음악은 신기함에서 주요 플랫폼의 신규 업로드 중 측정 가능한 비중으로 이동했지만, 그 법적 지위는 여전히 논쟁 중이었다.