닐 하울스비는 Google DeepMind의 연구 과학자로, 머신 러닝과 딥 러닝 분야에 기여한 공로로 인정받고 있다. 그는 비전 트랜스포머(ViT) 논문의 공동 저자로 가장 잘 알려져 있으며, 이 논문은 원래 자연어 처리를 위해 개발된 순수 트랜스포머 아키텍처가 이미지 패치의 시퀀스에 직접 적용될 때 이미지 분류에서 최첨단 결과를 달성할 수 있음을 입증했다. 이 연구는 인공 지능 분야에 상당한 영향을 미쳤으며, 비전 및 멀티모달 모델에 대한 후속 연구에 영향을 주었다.
하울스비의 연구 관심사는 신경망, 표현 학습, 효율적인 훈련 방법에 걸쳐 있다. 그의 연구는 종종 트랜스포머 기반 아키텍처와 실용적 응용 사이의 간극을 메우며, 확장 가능하고 효과적인 머신 러닝 시스템 개발에 기여한다.
교육 및 초기 경력
하울스비는 토론토 대학교에서 박사 학위를 마쳤으며, 베이지안 최적화와 능동 학습에 대해 연구했다. 그의 박사 연구는 하이퍼파라미터 튜닝과 실험 설계를 위한 효율적인 방법 개발에 초점을 맞췄으며, 이는 이후 대규모 모델 훈련 작업의 기초가 되었다. 박사 학위 후 그는 Google Brain(현재 Google DeepMind의 일부)에 연구 과학자로 합류하여 비전 및 언어 작업을 위한 새로운 아키텍처를 탐구하기 시작했다.
비전 트랜스포머(ViT)
2020년, 하울스비와 Google Brain의 동료들은 "An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale"이라는 논문을 발표했다. 이 논문은 이미지를 고정 크기 패치의 시퀀스로 취급하고 표준 트랜스포머 인코더로 처리하는 비전 트랜스포머를 소개했다. 이 접근 방식은 컴퓨터 비전에서 합성곱 신경망(CNN)의 지배적 사용에서 벗어난 것이었다. 저자들은 대규모 데이터셋에서 사전 훈련될 때 ViT가 여러 이미지 분류 벤치마크에서 CNN을 능가할 수 있으며, 훈련에 더 적은 계산 자원을 요구한다는 것을 보여주었다. ViT 아키텍처는 이후 많은 현대 비전 및 멀티모달 모델, 특히 생성형 AI 시스템에서 사용되는 모델의 기초 구성 요소가 되었다.
기타 기여
ViT 외에도 하울스비는 대규모 모델의 효율적인 미세 조정 연구에 기여했다. 그는 사전 훈련된 네트워크에 삽입되어 새로운 작업에 대한 파라미터 효율적 적응을 가능하게 하는 경량 모듈인 어댑터에 대한 작업에 참여했다. 이 연구 라인은 대규모 언어 모델 및 기타 대규모 시스템을 자원 제약 환경에 배포하는 데 실용적 의미를 갖는다. 하울스비는 또한 지식 증류, 자기 지도 학습, 트랜스포머 모델의 확장 동작과 같은 주제를 탐구했다.
영향 및 인정
ViT 논문은 널리 인용되었으며 학술 연구와 산업 실무 모두에 영향을 미쳤다. 이 논문은 비전 트랜스포머, 하이브리드 아키텍처, 의료 영상, 자율 주행, 로보틱스와 같은 분야의 응용에 대한 수많은 후속 연구에 영감을 주었다. 하울스비의 작업은 텍스트, 이미지, 오디오와 같은 여러 양식을 동일한 기본 트랜스포머 프레임워크로 처리할 수 있는 통합 아키텍처를 향한 인공 지능의 광범위한 추세의 일부이다.
현재 작업
2025년 현재, 하울스비는 Google DeepMind에서 계속 근무하며 머신 러닝 모델의 역량을 향상시키는 데 집중하고 있다. 그의 최근 연구 관심사는 트랜스포머 기반 모델의 효율성과 확장성 개선, 멀티모달 이해를 위한 새로운 아키텍처 탐구를 포함한다. 그는 또한 실제 배포에 중요한 AI 시스템의 견고성과 신뢰성을 높이는 노력에도 참여하고 있다.
하울스비의 기여는 주요 컨퍼런스와 워크숍에서의 초청 연설을 통해 인정받았으며, 그의 논문은 수많은 인용을 받았다. 그는 학계와 산업계의 동료들과 협력하며 연구 커뮤니티의 활동적인 구성원으로 남아 있다.