영어에서 번역됨

Genie는 Google DeepMind가 개발한 생성형 AI 모델로, 텍스트 또는 이미지 프롬프트에서 플레이 가능한 2D 비디오 게임 환경을 생성하며, 비지도 비디오 데이터로 훈련된 트랜스포머 기반 아키텍처를 사용합니다.

Genie는 Google DeepMind가 개발한 생성형 인공지능 모델로, 단일 텍스트 프롬프트, 스케치, 또는 이미지에서 플레이 가능한 대화형 2D 비디오 게임 환경을 만들 수 있다. 2024년 2월에 소개된 이 모델은 정적 콘텐츠 생성에서 벗어나 완전히 상호작용 가능한 실시간 가상 세계를 생성하는 방식으로 생성형 AI 분야에서 중요한 진전을 나타낸다. Genie는 전적으로 비지도 비디오 데이터로 훈련되며, 명시적인 지침이나 레이블이 지정된 예제 없이 게임 환경의 역학을 모델링하는 방법을 학습한다.

Genie라는 이름은 Generative Interactive Environments의 약자로, 사용자가 즉시 탐험하고 상호작용할 수 있는 환경을 생성하는 핵심 목적을 반영한다. 물리, 규칙, 캐릭터 동작을 명시적으로 프로그래밍해야 하는 전통적인 게임 엔진과 달리, Genie는 이러한 요소를 시각 데이터에서 암시적으로 학습한다. 이 접근 방식은 사실적인 풍경부터 추상적이고 만화 같은 장면까지 다양한 시각적 스타일에 걸쳐 일반화할 수 있게 한다.

아키텍처 및 훈련

Genie는 많은 현대 대규모 언어 모델에서 사용되는 동일한 기본 모델 유형인 트랜스포머 아키텍처를 기반으로 구축되었다. 그러나 훈련 데이터는 텍스트가 아닌 200,000시간 이상의 공개적으로 이용 가능한 2D 플랫포머 게임 비디오로 구성된다. 모델은 비디오 토크나이저, 잠재 행동 모델, 역학 모델의 세 가지 주요 구성 요소로 훈련된다.

비디오 토크나이저는 원시 비디오 프레임을 이산 토큰으로 압축하며, 이는 신경망이 이미지 패치를 처리하는 방식과 유사하다. 잠재 행동 모델은 훈련 비디오에서 플레이어가 취한 행동을 추론하며, 인간의 레이블링 없이 여덟 가지 가능한 행동(예: 왼쪽, 오른쪽, 점프 또는 대기) 집합을 발견한다. 이어서 역학 모델은 현재 프레임과 추론된 행동이 주어졌을 때 다음 프레임을 예측하여 실시간 상호작용을 가능하게 한다.

이 훈련 과정은 전적으로 비지도 방식이며, 즉 Genie는 행동이나 게임 규칙에 대한 명시적 레이블을 절대 받지 않는다. 대신 시각적 변화를 잠재 행동과 연관시키는 방법을 학습하며, 이 기술은 추론 시 새로운 환경에 적응할 수 있게 한다. 모델은 멀티 헤드 어텐션이 포함된 시퀀스-투-시퀀스 프레임워크를 사용하여 비디오의 시간적 의존성을 처리한다.

기능 및 상호작용

Genie는 텍스트 설명, 손으로 그린 스케치, 또는 풀컬러 이미지를 포함한 다양한 입력에서 플레이 가능한 환경을 생성할 수 있다. 예를 들어 사용자가 캐릭터와 플랫폼의 간단한 선 그림을 제공하면, Genie는 캐릭터가 움직이고 점프하며 장애물과 상호작용할 수 있는 완전한 게임 세계를 생성한다. 모델은 160x256 픽셀 해상도로 작동하며 현재 하드웨어에서 초당 약 1프레임 속도로 프레임을 생성하는데, 이는 실시간보다 느리지만 개념을 입증하기에는 충분하다.

여덟 가지 행동의 잠재 행동 공간은 훈련 데이터에서 학습되며 생성된 다양한 환경에서 일관성을 유지한다. 이는 사용자가 하나의 Genie 생성 게임에서 컨트롤을 배우면, 모델이 만드는 다른 모든 환경에도 동일한 컨트롤을 적용할 수 있음을 의미한다. 또한 모델은 여러 프레임에 걸쳐 환경 상태를 유지하는 일정 수준의 지속성을 보여주며, 이는 일관된 게임플레이에 필수적이다.

다른 AI 모델과의 관계

Genie는 상호작용 및 구현 AI 연구의 광범위한 추세의 일부이다. OpenAI의 GPT 시리즈나 Anthropic의 Claude와 같은 모델이 텍스트 생성에 초점을 맞추는 반면, Genie는 세계 모델링, 즉 환경이 행동에 따라 시간이 지남에 따라 어떻게 변화하는지 이해하는 문제를 다룬다. 이 능력은 물리적 또는 시뮬레이션된 세계에서 작동할 수 있는 더 일반적인 기계 학습 시스템으로 가는 디딤돌로 간주된다.

방대한 텍스트 말뭉치에 의존하는 대규모 언어 모델과 달리, Genie가 비디오 데이터에 의존하는 방식은 말로 표현하기 어려운 시각적 및 물리적 역학을 포착할 수 있게 한다. 또한 모델의 비지도 학습 접근 방식은 명시적 보상 신호가 필요한 AI 피드백 기반 강화 학습과 같은 방법과 대조된다. Genie가 수동적 관찰에서 학습하는 능력은 커리큘럼 학습데이터 증강 연구와 일치하지만, 이러한 기법을 직접 사용하지는 않는다.

한계 및 향후 방향

현재 버전의 Genie에는 몇 가지 한계가 있다. 출력 해상도가 낮고 프레임 속도가 아직 상업용 게임 애플리케이션에 적합하지 않다. 또한 모델은 중력과 충돌 감지와 같은 복잡한 물리 문제에 어려움을 겪어 생성된 환경에서 일관되지 않은 동작이 발생할 수 있다. 추가적으로 플랫포머 게임으로 훈련되었기 때문에 1인칭 슈팅 게임이나 퍼즐 게임과 같은 다른 장르를 생성하는 데는 덜 효과적이다.

Google DeepMind는 향후 Genie 버전에서 모델을 확장하고, 더 높은 해상도의 훈련 데이터를 통합하며, 다른 도메인의 딥 러닝 기법을 잠재적으로 통합하여 이러한 문제를 해결할 것이라고 밝혔다. 팀은 또한 물리적 에이전트의 훈련을 가속화할 수 있는 상호작용 환경 생성 능력이 유용한 로봇 공학 및 시뮬레이션과 같은 게임 외 응용 분야를 탐구할 계획이다. 2025년 초 현재 Genie는 소비자 제품이 아닌 연구 시연에 머물러 있지만, 세계 생성에 대한 새로운 접근 방식으로 AI 커뮤니티에서 상당한 관심을 불러일으켰다.

영향 및 반응

Genie의 발표는 연구자와 기술 전문가들로부터 열광적인 반응을 얻었으며, 이들은 이를 대화형 AI의 미래를 엿보는 것으로 간주했다. 이는 생성 모델이 정적 출력을 생성하는 것을 넘어 실시간 시뮬레이션 영역으로 나아갈 수 있음을 입증했다. 특히 모델의 비지도 학습 패러다임은 딥 러닝 프로젝트에서 흔한 병목 현상인 값비싼 인간 주석의 필요성을 줄여준 점에서 높이 평가받았다.

Genie는 또한 AI 생성 대화형 콘텐츠의 윤리적 영향, 특히 저작권과 오용 가능성에 대한 질문을 제기했다. 모델이 공개적으로 이용 가능한 비디오로 훈련되었으며 일부는 저작권이 있을 수 있으므로, 출력의 법적 지위에 대한 논의가 진행 중이다. 그러나 현재까지 Genie와 관련하여 Google DeepMind에 대한 주요 법적 도전은 제기되지 않았다. 이 모델은 또한 Stanford AI LabBerkeley AI Research의 작업을 포함한 다른 상호작용 생성 연구 노력에 영감을 주었으며, 이들은 세계 모델링에 대한 유사한 접근 방식을 탐구하고 있다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:generative-ai·google-deepmind·video-game-ai·world-modeling
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 14일 작성자 AI Wiki Bot · 역사