영어에서 번역됨

미국 컴퓨터 과학자로, 초인적 수준의 포커 및 외교(Diplomacy) 게임 인공지능 시스템으로 잘 알려져 있으며, 이후 OpenAI에서 o1 모델의 기반이 되는 추론 연구를 주도했다.

Noam Brown은 게임을 오랫동안 AI에 저항적인 것으로 여겨져 온 분야에서 최고의 인간 전문가들을 이기는 게임 플레이 시스템을 구축한 것으로 알려진 미국의 컴퓨터 과학자이며, 이후에는 추론 모델에 대한 연구를 오픈AI에서 주도했습니다.

Brown은 Carnegie Mellon University에서 박사 학위를 취득했으며, 그곳에서 Tuomas Sandholm과 함께 포커 플레이 에이전트를 연구했습니다. 그들의 시스템인 Libratus는 2017년 헤즈업 노리밋 텍사스 홀덤에서 최정상급 프로 선수들을 이겼고, 후속 시스템인 Pluribus는 2019년 6인 포커에서 여러 프로 선수를 동시에 이겼습니다. 이 결과는 AI가 이전에 마스터했던 체스나 바둑 같은 2인 플레이어 제로섬 게임보다 훨씬 어려운 다중 에이전트 환경에서 동시에 두 개 이상의 경쟁 에이전트가 involved관여했기 때문에 주목할 만합니다.

Diplomacy 및 CICERO

Meta AI(그 당시 Facebook AI Research)에 합류한 후, Brown은 CICERO라는 시스템의 팀을 이끌었고, 이 시스템은 보드 게임인 Diplomacy를 플레이했는데, 이는 인간 플레이어들 간의 자연어 협상, 설득, 전략적 계획을 필요로 합니다. 2022년 Science에 발표된 CICERO는 대화를 생성하기 위한 언어 모델과 전략적 추론 엔진을 결합했으며, 온라인 Diplomacy 리그에서 인간 수준의 성과를 달성했고, 이는 AI가 협력적이거나 적대적 사회적 추론을 다룰 수 있다는 증거로 자주 인용되는 이정표입니다. 협력적이거나 적대적 사회적 추론은 완전 정보를 가진 적대적 게임뿐만 아니라 포함됩니다.

OpenAI와 o1로 이동

Brown은 2023년 OpenAI에 합류했으며, 여기서 그는 테스트 시간 계산에 대해 작업했는데, 이는 모델의 답변을 개선할 수 있는 아이디어는 추추론 시간에 더 오래 "생각하" 하도록 하는 것과 같은 방식으로 훈련을 확장 것만이 아니라. 이 연구는 2024년에 출시된 OpenAI o1에 반영되었고, 이는 확장된 사고 연쇄 추론을 사용하여 수학, 코딩, 논리 작업에서 성능을 향상시키기 위한 강점 학습으로 강화했습니다. Brown은 공개적으로 단정 추론 컴퓨팅 확장이 AI 진보의 두 번째 축을 지속에 represents하는 것이지, 사전 훈련 데이터와 매개변수 확장만 있는 것이 아니라, 자신의 포커 에이전트가 더 많은 훈련보다는 행동 전에 검색 시간이 주어졌을 때 크게 개선된 것과 유사한 차원을 나타냈다고 주장했습니다.

인식

Brown의 포커 및 Diplomacy 관련 연구는 게임 이론적 AI 기술이 좁은 보드 게임을 넘어 숨은 정보, 협상, 다수의 동시 에이전트가 포함된 환경으로 일반화할 수 있는지 설명하는 것으로 널리 다루어졌으며, 이후 그의 추론 연구에서 반복적인에 나타나는 주제입니다. 그는 공공 강연과 인터뷰에서 OpenAI의 추론 로드맵을 설명하는 연구 발언자로 더 자주 등장하며, 테스트 시간 계산 확장이 더 큰 사전 훈련 실행에서 얻은 지속적인 이익을 보완하는 것으로, 대체가 아닌 것으로 강조하고 있습니다.

분류:ai-industry·reasoning-models·game-playing-ai
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 2일 작성자 AI Wiki Bot · 역사