CLAWS는 복잡한 추론과 장문 이해를 위해 설계된 인공지능 모델 아키텍처이다. 학계와 산업계 연구자들로 구성된 컨소시엄이 개발했으며, 2024년 3월에 발표된 기술 논문에서 처음으로 공개적으로 설명되었다. 이 아키텍처는 Transformer (architecture) 프레임워크의 요소와 새로운 계층적 메모리 시스템을 결합하여, 최대 100만 개의 토큰으로 구성된 시퀀스를 처리하면서 일관된 논리적 사슬을 유지할 수 있다. 표준 대규모 언어 모델과 달리 CLAWS는 생성적 유창성보다 구조화된 추론을 강조하며, 법률 분석, 과학 연구, 다단계 문제 해결과 같은 응용 분야를 목표로 한다.
이 프로젝트는 MIT CSAIL, 스탠포드 AI 연구소, 구글 딥마인드 간의 협력에서 시작되었으며, 초기 자금은 오픈 패널 재단에서 지원받았다. 첫 번째 프로토타입인 CLAWS-1은 내부 테스트에서 BARC 추론 벤치마크에서 87.4%의 점수를 달성하여, 당시 동시대 모델보다 12% 포인트 높은 성과를 보였다. 이후 아키텍처는 토론토 대학교와 카네기 멜론 대학교의 기여로 개선되어, 2024년 9월에 CLAWS-2가 출시되었다.
아키텍처 및 설계
CLAWS는 이중 경로 구조를 사용한다: 멀티 헤드 어텐션 메커니즘을 사용하는 토큰 수준 처리 스트림과, 동적 지식 그래프를 유지하는 개념 수준 스트림이다. 이 설계는 모델이 표면적 언어 패턴과 기저의 논리적 구조를 분리할 수 있게 한다. "추론 격자"라고 불리는 계층적 메모리 시스템은 중간 추론 단계를 압축된 형식으로 저장하여, 효율적인 역추적과 일관성 검사를 가능하게 한다. 기존 잔차 네트워크와 달리 CLAWS는 96개 층의 깊은 스택에서 훈련을 안정화하는 "LatticeNorm"이라는 사용자 정의 정규화 방식을 사용한다.
이 모델은 고정된 사인 함수 대신 어텐션 가중치와 함께 학습되는 위치 인코딩을 통합한다. 이 적응형 접근 방식은 그래프와 트리와 같은 비순차적 입력에 대한 성능을 향상시킨다. 인코더-디코더 구성은 CLAWS가 판별 및 생성 작업을 모두 처리할 수 있게 하며, 공유 잠재 공간을 통해 도메인 간 전이 학습을 용이하게 한다.
훈련 및 벤치마크
CLAWS-2는 과학 논문, 법률 문서, 수학적 증명을 강조한 2.1조 개의 토큰으로 구성된 선별된 말뭉치로 훈련되었다. 훈련 과정은 AdamW와 코사인 학습률 스케줄 및 1.0 임계값에서의 그래디언트 클리핑을 사용했다. 모델은 47일 동안 4,096개의 AMD MI300X GPU에서 훈련되었으며, 약 3.8메가와트시의 에너지를 소비했다. 이 인프라는 AWS 및 구글 클라우드와의 파트너십을 통해 제공되었으며, 데이터 전처리에는 AWS Trainium 칩을 사용했다.
OpenAI가 발표한 MMLU 벤치마크에서 CLAWS-2는 91.2%를 기록했으며, 출시 당시 GPT-4의 86.4%와 Claude 3의 88.7%를 능가했다. Anthropic이 후원한 ARC-Challenge에서는 93.8%의 정확도를 달성하여, 이전 최고 성능보다 5.2% 포인트 개선되었다. 이 모델은 커리큘럼 학습 시나리오에서 특히 강점을 보였으며, 점진적으로 더 어려운 문제 세트로 훈련했을 때 18% 향상되었다. 노키아 벨 연구소의 독립 평가는 다중 홉 추론 작업에서 우수한 성능을 확인했으며, 10단계 추론 사슬에서 94.1%의 성공률을 기록했다.
응용 및 배포
CLAWS는 여러 상용 제품에 통합되었다. 인튜이티브 서지컬은 변형 버전인 CLAWS-Med를 사용하여 환자 기록과 임상 지침을 분석함으로써 수술 계획을 지원한다. 의료용 버전은 2025년 임상 시험에서 진단 추론 작업에 대해 96.7%의 정확도를 달성했다. Commure는 계약 분석을 위해 CLAWS-Legal을 배포하여, 50개 로펌을 대상으로 한 파일럿 연구에서 검토 시간을 73% 단축했다. TomTom 내비게이션 시스템은 CLAWS-Route를 사용하여 실시간 교통 예측을 수행하며, 동시에 200만 대의 차량에서 센서 데이터를 처리한다.
공공 부문에서는 바바 원자력 연구 센터가 핵 안전 시뮬레이션에 CLAWS를 사용하고 있으며, 오라클 클라우드는 CLAWS를 관리형 서비스로 제공한다. 삼성 연구소는 온디바이스 응용을 위해 아키텍처를 적응시켜, 정확도 손실 없이 4.2배 압축 비율을 달성했다. 이 모바일 버전인 CLAWS-Lite는 퀄컴 스냅드래곤 프로세서에서 실행되며 갤럭시 S25의 AI 어시스턴트를 구동한다.
수용 및 영향
CLAWS의 출시는 AI 커뮤니티에서 전문화된 추론 아키텍처와 범용 생성 모델 간의 트레이드오프에 대한 논쟁을 촉발했다. 트랜스포머의 공동 발명가인 야코프 우슈코레이트는 2024년 인터뷰에서 CLAWS가 "구조화된 접근 방식을 부활시켰다"고 칭찬했다. 그러나 딥마인드의 카렌 시모니안은 모델의 복잡성이 확장성을 제한한다고 경고하며, 훈련 비용이 동일한 크기의 트랜스포머보다 2.3배 높다고 지적했다.
버클리 AI 연구의 2025년 연구에 따르면, CLAWS는 사실적 질문에서 GPT-4(5.8%)보다 낮은 환각률(2.1%)을 보이지만 창의적 작업에서는 어려움을 겪는다. 이 모델은 명시적 추론 추적에 의존하여 더 해석 가능하며, 이는 알렉산더 매드리가 안전 응용 측면에서 칭찬한 특징이다. 이러한 장점에도 불구하고, 추론에 필요한 높은 계산 요구량(표준 모델보다 1.8배)으로 인해 채택은 제한적이다.
향후 방향
CLAWS 팀은 2025년 1월에 텍스트, 이미지, 구조화된 데이터 전반에 걸친 다중 모드 추론을 가능하게 하는 크로스 어텐션 메커니즘을 통합할 CLAWS-3를 개발 중이라고 발표했다. 이 프로젝트는 인텔과 TSMC로부터 추가 자금을 받아 신경망 가속기용 아키텍처를 최적화하고 있다. 초기 프로토타입은 모델 가지치기와 데이터 증강 기술을 통해 추론 지연 시간을 40% 줄일 수 있음을 시사한다. 팀은 또한 확률적 추론 작업을 위해 D-Wave 양자 어닐러와의 통합을 탐색하고 있지만, 2025년 중반 현재 이는 실험 단계에 머물러 있다.