Udio는 간단한 텍스트 프롬프트를 기반으로 음악을 생성하는 생성형 인공지능 모델로, 보컬과 악기 연주를 모두 생성할 수 있다. 2023년 12월에 설립된 스타트업 Uncharted Labs가 개발한 이 서비스는 Generative AI 기술을 사용하여 사용자 설명으로부터 독창적인 노래를 만든다. 무료 베타 버전은 2024년 4월 10일에 공개적으로 출시되어 사용자들이 비용 없이 월 최대 600곡을 생성할 수 있게 했다. 이 플랫폼은 생성된 트랙의 특정 부분을 수정할 수 있는 오디오 인페인팅과 같은 고급 기능을 위한 구독 등급을 제공한다.
이 서비스는 Google DeepMind의 전 연구원 팀에서 시작되었으며, Suno 및 Stable Audio와 같은 텍스트-음악 경쟁사도 포함하는 Artificial intelligence 창의적 도구의 더 넓은 흐름 속에 자리 잡고 있다. Udio의 출시는 현실적인 보컬 합성으로 상당한 주목을 받았지만, 저작권이 있는 음악으로 AI 모델을 훈련시키는 것의 윤리적 및 법적 영향에 대한 의문도 제기했다.
역사
Udio는 2023년 12월 Google DeepMind의 전 연구원 네 명(CEO David Ding, Conor Durkan, Charlie Nash, Yaroslav Ganin)과 Andrew Sanchez가 Uncharted Labs라는 이름으로 설립했다. 벤처 캐피털 회사 Andreessen Horowitz가 재정적 지원을 제공했으며, 음악 유통사 UnitedMasters, 뮤지션 will.i.am, Tay Keith, Common, 투자자 Kevin Wall, Instagram 공동 창업자 Mike Krieger, DeepMind 연구원 Oriol Vinyals도 지원했다. 회사는 초기 자금으로 850만 달러를 모금했으며 시드 펀딩에서 1,000만 달러의 가치를 평가받았다.
수개월간의 비공개 베타 단계를 거친 후, Udio는 2024년 4월 10일에 공개적으로 출시되었다. Sanchez는 목표를 뮤지션들이 훌륭한 음악을 만들고 미래에 그 음악으로 수익을 창출할 수 있게 하는 것이라고 설명했다. 이 출시는 Suno 및 Stable Audio와 같은 다른 텍스트-음악 생성기를 뒤따랐으며, AI 음악 생성의 경쟁 시기를 표시했다.
Udio는 Drake-Kendrick Lamar 불화 기간 동안 널리 유포된 패러디 노래인 Willonius Hatcher의 "BBL Drizzy"를 만드는 데 사용되면서 바이럴 주목을 받았으며, 첫 주에 Twitter에서 2,300만 회 이상의 조회수와 SoundCloud에서 330만 회의 스트리밍을 기록했다. 2024년 8월, 오스트리아 프로듀서 Butterbro가 Udio로 생성한 노래 "Verknallt in einen Talahon"은 독일 Top 50에 도달한 최초의 AI 생성 노래가 되었다.
기능
Udio는 텍스트 프롬프트를 기반으로 노래를 생성하며, 프롬프트는 장르(바버샵 콰르텟, 컨트리, 클래식, 힙합, 독일 팝, 하드 록 포함), 가사, 스토리 방향, 사운드의 기반이 될 다른 아티스트를 지정할 수 있다. 2024년 4월 기준 기본 생성 과정은 공개되지 않았다. 프로그램은 프롬프트를 기반으로 두 곡을 생성하며, 사용자는 추가 텍스트 프롬프트로 노래를 리믹스할 수 있다. 노래는 처음에 약 30초 길이로 생성되며 추가 30초 단위로 확장할 수 있다. 유료 구독자는 트랙 내에서 특정 편집을 가능하게 하는 오디오 인페인팅과 같은 고급 기능에 접근할 수 있다.
이 서비스는 다른 생성형 AI 시스템에서 사용되는 것과 유사한 Neural network 아키텍처를 포함할 가능성이 있는 Deep learning 모델을 활용한다. 현실적인 보컬을 생성하는 능력은 정교한 Transformer (architecture) 기반 모델의 사용을 시사하지만, 회사는 기술적 접근 방식을 공개적으로 상세히 설명하지 않았다. 사용자 인터페이스는 단순성을 강조하여 음악적 능력이 없거나 최소한인 사람들도 접근할 수 있게 한다.
평가
비평가들은 Udio의 출력에 대해 엇갈린 평가를 제공했다. PC World의 Mark Hachman은 Udio를 AI 아트 생성기와 비교했으며 "몇 가지 빈약한 가사"를 "꽤 중독성 있는" 노래로 바꾸는 능력을 칭찬했고, 보컬을 "믿을 수 없을 정도로 현실적이고 심지어 감정적"이라고 불렀다. ZDNET의 Sabrina Ortiz는 생성된 노래가 "인상적"이며 전문적으로 제작된 것처럼 들린다고 설명했으며, 다른 텍스트-음악 생성기의 노래보다 "더 풍부하고 더 깊은" 것이라고 언급했다. Tom's Guide의 Ryan Morrison은 Udio가 "합성 보컬에서 감정을 포착하는 초자연적인 능력"을 가지고 있으며 보컬 공연의 열정, 고통, 정신을 포착한 유일한 AI 음악 생성기라고 썼다.
Rolling Stone의 Brian Hiatt는 Udio가 Suno보다 "더 사용자 정의가 가능하지만 아마도 덜 직관적일 수 있다"고 썼으며, 일부 초기 사용자들이 Udio의 출력이 더 선명하게 들릴 수 있다고 제안했다고 덧붙였다. 그러나 Ars Technica의 Benj Edwards는 Udio의 생성 능력이 불완전하고 Suno보다 "덜 인상적"이라고 발견했으며, 노래가 상당히 짧고 "반쯤 구워지고 거의 악몽 같다"고 불렀다. Twitter의 베타 발표에 대한 응답으로 Telefon Tel Aviv 멤버 Joshua Eustis는 Udio를 "뮤지션을 대체하는 앱"이라고 부르고 사용된 데이터에 의문을 제기했다. Udio는 또한 온라인에서 "영혼 없는" 것으로 그리고 오디오 딥페이크를 생성할 가능성으로 비판을 받았다. Gizmodo의 Lucas Ropek는 Udio가 "음향적 넌센스로 가득 차 있으며" 노래가 "특별히 나쁘다"고 말했다.
저작권 우려
비평가들은 Udio를 훈련시키는 데 사용된 데이터가 무엇인지 그리고 그것이 저작권이 있는 음악으로 구성되었는지 의문을 제기했다. Rolling Stone은 Udio와 Suno 모두 저작권이 있는 음악으로 훈련되었다고 믿을 "상당한 이유"가 있다고 썼으며, Ars Technica의 Benj Edwards는 훈련 데이터가 "저작권이 있는 자료로 가득 차 있을 가능성이 높다"고 썼다. Udio는 프롬프트가 주어져도 저작권이 있는 노래를 직접 재현하지 않는다. Ding은 Udio에 "광범위한 자동 저작권 필터"가 있으며 회사가 안전 장치를 지속적으로 개선하고 있다고 말했다. Stability AI는 명시적으로 라이선스된 데이터 세트인 AudioSparx를 사용하여 Stable Audio 2.0으로 다른 접근 방식을 취했다.
2024년 6월, 미국 음반 산업 협회가 주도한 소송이 Udio와 Suno를 상대로 제기되었으며, 저작권이 있는 음반의 광범위한 침해를 주장했다. 이 소송은 회사들이 저작권이 있는 음악으로 훈련하는 것을 금지하고 이미 발생한 침해에 대해 작품당 최대 15만 달러의 손해 배상을 요구했다.
2025년 10월, Universal Music Group의 저작권 소송이 라이선스 계약으로 해결되었다. Udio는 "승인되고 라이선스된 음악"으로만 훈련된 플랫폼을 출시하는 데 동의했다. 회사는 이후 기존 사용자들이 새로운 스트리밍 기반 비즈니스 모델로 전환하기 전에 창작물을 다운로드할 수 있는 48시간이 주어질 것이라고 발표했다.