벤 풀은 Google DeepMind의 연구 과학자로, 생성형 인공지능과 머신러닝 분야에서 연구를 수행하고 있다. 그는 딥러닝 분야의 여러 영향력 있는 논문의 공동 저자로 잘 알려져 있으며, 여기에는 DreamFusion, Imagen, 그리고 점수 기반 생성 모델(score-based generative models)의 기초 작업이 포함된다. 그의 연구는 텍스트 설명으로부터 고품질의 이미지, 비디오, 3D 콘텐츠를 생성하는 방법을 개발하는 데 중점을 두고 있으며, 창의적 도구와 과학적 시뮬레이션에 응용된다.
풀의 연구는 생성형 AI의 현대적 지형을 형성하는 데 기여했으며, 특히 텍스트-이미지 합성과 3D 생성 분야에서 두드러진다. 그의 작업은 확률적 모델링의 이론적 토대와 실용적 엔지니어링 솔루션을 연결하며, 이 분야에서 저명한 인물로 자리매김하게 했다. 그는 학계와 산업계의 연구자들과 협력해 왔으며, 그의 논문은 AI 커뮤니티에서 널리 인용되고 있다.
초기 경력 및 교육
풀은 토론토 대학교에서 컴퓨터 과학 박사 학위를 취득했으며, 아론 쿠빌의 지도를 받았다. 박사 과정 동안 그는 변분 추론(variational inference)과 생성 모델링에 집중했으며, 블랙박스 변분 추론과 신경 어텐션 모델에 관한 논문을 발표했다. 그의 학위 논문은 이후 점수 기반 생성 모델 연구의 기초를 마련했다.
2016년 박사 학위를 마친 후, 풀은 OpenAI에 연구 과학자로 합류했다. OpenAI에서 그는 강화 학습과 생성 모델을 연구했으며, 신경망과 손실 함수와 관련된 프로젝트에 기여했다. 그는 2020년까지 OpenAI에 재직하며, 암시적 생성 모델과 적대적 훈련에 관한 여러 주목할 만한 논문을 공동 집필했다.
생성 모델링에 대한 주요 기여
2021년, 풀은 "Score-Based Generative Modeling with Critically-Damped Langevin Diffusion" 논문을 공동 집필했으며, 이 논문은 점수 기반 생성 모델을 위한 새로운 프레임워크를 소개했다. 이 연구는 국제 학습 표현 학회(ICLR)에서 발표되었으며, 임계 감쇠 Langevin 역학을 사용하여 샘플 품질과 훈련 안정성을 개선하는 방법을 시연했다. 이 논문은 확산 모델에 대한 후속 연구에 영향을 미친 기초 작업으로 간주된다.
2022년, 풀은 ICLR 2023에서 발표된 "DreamFusion: Text-to-3D using 2D Diffusion" 논문의 주 저자였다. DreamFusion은 사전 훈련된 2D 확산 모델(예: Imagen)을 활용하여 3D 훈련 데이터 없이도 텍스트 프롬프트로부터 3D 모델을 생성하는 방법을 소개했다. 이 접근 방식은 Score Distillation Sampling이라는 기법을 사용하며, 이후 텍스트-3D 생성 분야의 후속 연구에 널리 채택되고 영감을 주었다. 이 논문은 ICLR 2023에서 우수 논문상(Outstanding Paper Award)을 수상했다.
또한 2022년, 풀은 크리스 비숍의 팀이 이끄는 Google Research의 "Imagen: Photorealistic Text-to-Image Diffusion Models" 논문에 기여했다. Imagen은 대규모 트랜스포머 언어 모델을 사용하여 텍스트를 인코딩하고, 확산 모델의 캐스케이드를 통해 이미지를 생성함으로써 텍스트-이미지 합성에서 최첨단 성능을 달성했다. 이 논문은 사전 인쇄본으로 공개된 후 NeurIPS 2022에서 발표되었으며, 전례 없는 사실적 이미지 생성 능력을 보여주며 텍스트-이미지 생성 분야에서 확산 모델의 지배적 위치를 확립하는 데 기여했다.
Google DeepMind에서의 연구
풀은 2020년 Google Research에 합류했으며, 2023년 DeepMind와의 합병으로 Google DeepMind가 형성된 후에도 계속 연구를 수행하고 있다. Google DeepMind에서 그는 생성 모델의 확장과 효율성 향상에 중점을 두고 연구를 이어가고 있다. 그의 최근 연구는 텍스트나 이미지 입력으로부터 시간적으로 일관된 비디오를 생성하는 방법을 탐구하는 비디오 생성 분야를 포함한다. 또한 교차 어텐션 메커니즘을 사용하여 확산 모델의 출력을 제어하는 기법을 연구했다.
연구 외에도 풀은 오픈소스 도구와 프레임워크 개발에 기여했다. 그는 머신러닝 연구를 위한 라이브러리 개발에 참여했으며, 특히 JAX 기반 확산 모델 구현에 관여했다. 그의 연구는 NeurIPS, ICLR, ICML과 같은 주요 학회에서 발표되었으며, 그는 이러한 학회의 리뷰어 및 에어리어 체어로도 활동했다.
협력 및 영향
풀은 Google DeepMind에서 야코프 우슈코라이트, 리온 존스 등 다양한 연구자들과 협력해 왔다. 특히 아니마 아난드쿠마르와의 Caltech에서의 공동 연구는 점수 기반 생성 모델 분야에 큰 영향을 미쳤으며, 현재 이 분야의 표준이 된 여러 방법을 개발하는 데 기여했다. DreamFusion 논문은 특히 텍스트-3D 생성 연구의 큰 흐름을 만들어냈으며, 게임, 가상 현실, 로보틱스 등 다양한 응용 분야에 영향을 미쳤다.
그의 논문은 수만 회 인용되며, 학계 연구와 산업 응용 모두에 광범위한 영향을 미쳤다. 그가 개발한 기법은 이미지 생성 도구와 3D 자산 생성 파이프라인과 같은 상업 제품에 사용되고 있다. 2024년 현재, 풀은 Google DeepMind에서 활발히 연구를 수행하며 생성형 AI의 경계를 계속 확장하고 있다.
주요 논문
- "Score-Based Generative Modeling with Critically-Damped Langevin Diffusion" (ICLR 2021)
- "DreamFusion: Text-to-3D using 2D Diffusion" (ICLR 2023, 우수 논문상)
- "Imagen: Photorealistic Text-to-Image Diffusion Models" (NeurIPS 2022)
- "Deep Unsupervised Learning using Nonequilibrium Thermodynamics" (공동 저자, 2015)
- "Black-Box Variational Inference for Stochastic Differential Equations" (ICML 2016)
이러한 논문들은 생성 모델링의 이론적 기초와 실용적 응용에 대한 그의 기여를 보여준다. 그의 연구는 인공지능 및 관련 분야의 새로운 연구자 세대에 계속 영향을 미치고 있다.