Toolformer는 2023년 2월 Meta AI 연구진이 소개한 Large language model 아키텍처이다. 계산기, 검색 엔진, 번역 시스템, 달력 API와 같은 외부 도구를 자율적으로 학습하여 사용하도록 설계되었으며, 자기 지도 학습 과정을 통해 이를 수행한다. 광범위한 인간 주석이나 강화 학습이 필요했던 이전 접근 방식과 달리, Toolformer는 소량의 시연 데이터에서 도구 사용법을 학습한 후 이러한 기능을 자체 생성 과정에 통합한다.
이 모델은 Transformer (architecture) 아키텍처를 기반으로 하며, 텍스트 시퀀스에 도구 호출을 삽입하는 메커니즘으로 표준 자기회귀 언어 모델링을 확장한다. 추론 중에 Toolformer는 도구를 호출하는 특수 토큰 시퀀스를 생성하고, 도구의 출력을 수신한 다음, 해당 출력을 통합한 텍스트 생성을 계속할 수 있다. 이를 통해 산술, 사실 조회, 날짜 계산과 같은 작업을 보다 신뢰할 수 있는 외부 시스템에 위임하여, 매개변수 지식만으로는 부족한 작업에서 정확도를 향상시킨다.
훈련 절차
Toolformer의 훈련은 2단계 파이프라인을 사용한다. 먼저, 도구당 약 10개의 인간이 작성한 예시가 도구 호출을 표현하는 방법을 보여준다. 이 예시들로부터 모델은 자체 출력을 샘플링하고 자기 지도 손실 기준에 따라 필터링하여 잠재적 도구 호출의 더 큰 데이터셋을 생성한다. 구체적으로, 모델은 도구 호출이 후속 텍스트의 손실을 줄이는지 평가하며, 예측을 개선하는 호출만 유지된다.
필터링된 데이터셋은 이후 표준 다음 토큰 예측을 통해 기본 언어 모델(GPT-J의 670억 매개변수 버전)을 미세 조정하는 데 사용된다. 이 미세 조정은 모델에게 도구를 호출할 시점과 호출 형식 및 결과 통합 방법을 가르친다. 저자들은 이 접근 방식이 도구당 수백 개의 훈련 예시만 필요로 하며, 수천 개의 레이블이 지정된 인스턴스가 필요한 방법과 대조적이라고 보고했다.
지원 도구 및 기능
Toolformer는 다섯 가지 도구로 평가되었다: 산술용 계산기, 질문-응답 시스템(검색 증강 모델 기반), 위키백과 검색 엔진, 기계 번역 시스템, 달력 API. 모델은 각 도구를 적절히 사용하는 법을 학습했으며, 예를 들어 여러 자리 곱셈에는 계산기를, 최근 사건이나 잘 알려지지 않은 사실에는 검색 엔진을 호출했다. 수학 단어 문제(GSM8K) 및 사실적 질문 응답과 같은 하위 작업에 대한 제로샷 평가에서 Toolformer는 기본 모델을 능가했으며, 특정 벤치마크에서는 GPT-3(1750억 매개변수)와 같은 더 큰 모델과 동등하거나 더 나은 성과를 보였다.
주목할 만한 설계 선택은 Toolformer가 도구 자체를 미세 조정할 필요가 없다는 점이다. 각 도구를 고정된 인터페이스를 가진 블랙 박스로 취급한다. 이러한 모듈성 덕분에 몇 가지 예시를 제공하고 필터링 과정을 다시 실행하면 새 도구를 추가할 수 있다.
한계 및 비판
원래 논문은 여러 한계를 인정했다. Toolformer의 도구 호출은 탐욕적으로 생성되며 도구 출력에 따라 수정할 수 없어, 초기 호출이 잘못되면 연쇄 오류가 발생할 수 있다. 또한 모델은 단일 추론 단계에서 여러 도구 호출을 연결할 수 없어 복잡한 다단계 문제에 대한 사용이 제한된다. 추가로, 자기 지도 필터링은 실제 작업 성능을 개선하지 않으면서 손실을 줄이는 허위 호출을 선택할 수 있다.
이후 다른 연구자들의 후속 작업은 Toolformer의 성과가 일부 작업에서 미미했으며 고정된 도구 집합에 대한 의존이 일반화를 제한한다고 지적했다. 그러나 이는 도구 증강 언어 모델에 대한 연구 계보에 영감을 주었으며, Gorilla 및 ART와 같은 후속 시스템이 도구 집합을 확장하고 호출 견고성을 개선했다.
영향 및 유산
Toolformer는 언어 모델이 최소한의 감독으로 도구 사용을 학습할 수 있음을 입증하여, 더 유능하고 신뢰할 수 있는 AI 시스템으로 나아가는 한 걸음이 되었다. 이는 Generative AI 및 Artificial intelligence의 후속 발전, 특히 외부 지식 소스와 계산 도구의 통합에 영향을 주었다. 이 접근 방식은 학계 연구실과 산업계 그룹 모두에서 채택 및 확장되었으며, OpenAI와 Google DeepMind를 포함한 기관이 유사한 도구 호출 메커니즘을 자사 프로덕션 모델에 통합했다.
이 논문의 자기 지도 학습을 통한 도구 획득 강조는 Machine learning 효율성과 순수 매개변수 지식의 한계에 대한 광범위한 논의에도 기여했다. 2025년 현재, 도구 증강 언어 모델은 많은 배포된 AI 어시스턴트의 표준 구성 요소이지만, 일반적으로 원래 Toolformer보다 더 정교한 계획 및 검증 방법을 사용한다.