2024년 10월, Anthropic은 대규모 언어 모델인 Claude 시리즈에 "컴퓨터 사용" 기능을 도입했다. 이 기능은 애플리케이션이 Claude API를 호출하여 화면 콘텐츠 해석과 키보드 및 마우스 입력 시뮬레이션을 통해 애플리케이션에 대한 탐색 제어를 시도할 수 있게 한다. 이는 Generative AI 분야에서 AI 에이전트가 인간과 유사한 방식으로 그래픽 사용자 인터페이스와 상호작용할 수 있는 방향으로의 중요한 진전을 의미했다.
이 기능은 Anthropic이 Claude를 챗봇 상호작용을 넘어 에이전트 도구로 확장하려는 광범위한 노력의 일부였다. 이는 2023년 3월 AI 기반 챗봇으로서의 Claude 출시와 2024년 6월 아티팩트 도입에 이은 것이었다. 컴퓨터 사용은 Claude가 화면의 시각적 정보와 시뮬레이션된 입력 이벤트만을 사용하여 양식 작성, 웹사이트 탐색, 소프트웨어 작동과 같은 작업을 수행할 수 있도록 설계되었다.
기술적 기반
컴퓨터 사용은 스크린샷을 처리하고 작업을 생성하는 Claude의 능력에 의존한다. 모델은 화면 이미지를 받아 관련 요소를 식별하고 마우스 클릭, 키 입력 또는 스크롤 작업과 같은 명령을 출력한다. 이 접근 방식은 API나 접근성 트리에 의존하는 전통적인 자동화와 다르다. Anthropic은 일반화를 개선하기 위해 다양한 데스크톱 환경에서 모델을 훈련시켰다.
기본 아키텍처는 다른 Large language model 시스템에서도 사용되는 Transformer (architecture) 모델을 기반으로 한다. Claude의 훈련은 Anthropic이 윤리적 및 법적 준수를 개선하기 위해 개발한 기법인 헌법을 사용한다. 컴퓨터 사용 기능은 처음에는 Claude API를 통해 제공되어 개발자가 자신의 애플리케이션에 통합할 수 있게 했다.
기능 및 한계
초기 출시에서 컴퓨터 사용은 웹 검색, 양식 작성, 다단계 워크플로우 탐색과 같은 작업을 수행할 수 있었다. Anthropic은 모델이 간단한 작업을 중간 정도의 정확도로 완료할 수 있지만 복잡하거나 고위험 작업에는 아직 신뢰할 수 없다고 보고했다. 회사는 이 기능이 실험적이며 인간의 감독을 권장한다고 강조했다.
주목할 만한 한계 중 하나는 모델이 익숙하지 않은 인터페이스나 화면 레이아웃이 변경될 때 오류를 범하는 경향이 있다는 점이었다. Anthropic은 또한 컴퓨터 사용이 웹 페이지에 내장된 악의적인 지침이 모델의 작업에 영향을 미칠 수 있는 프롬프트 주입 공격에 취약할 수 있다고 언급했다. 회사는 개발자에게 안전장치를 구현하도록 조언했다.
다른 AI 시스템과의 비교
컴퓨터 사용은 Anthropic을 에이전트 기능을 탐구하는 다른 AI 개발자들과 나란히 위치시켰다. OpenAI와 Google DeepMind도 소프트웨어와 상호작용할 수 있는 모델을 시연했지만, Anthropic의 접근 방식은 API 통합보다는 화면 기반 제어에 초점을 맞췄다. 이는 프로그래밍 방식 인터페이스가 없는 레거시 시스템과 애플리케이션에 적용 가능하게 만들었다.
이 기능은 컴퓨터를 자율적으로 작동할 수 있는 Artificial intelligence 시스템으로의 추세의 일부였다. 텍스트만 생성하는 Machine learning 모델과 달리 컴퓨터 사용은 모델이 공간 레이아웃을 이해하고 순차적 작업을 실행해야 했다. 이는 시각적 이해와 의사 결정의 발전을 요구했다.
개발자 채택 및 생태계
2024년 10월 출시 이후 개발자들은 컴퓨터 사용을 다양한 도구에 통합하기 시작했다. 데이터 입력 자동화, 소프트웨어 테스트, 워크플로우 관리에 사용되었다. 이 기능은 스프레드시트에서 웹 양식으로 데이터를 복사하는 것과 같이 여러 애플리케이션과 상호작용해야 하는 작업에 특히 유용했다.
Anthropic은 개발자가 시작하는 데 도움이 되는 문서와 예제를 제공했다. API는 작업을 일시 중지하고 재개하는 기능을 포함하여 모델의 작업에 대한 세밀한 제어를 허용했다. 일부 개발자는 컴퓨터 사용을 아티팩트와 같은 다른 Claude 기능과 결합하여 더 정교한 애플리케이션을 만들었다.
이후 개발
컴퓨터 사용 기능은 시간이 지남에 따라 진화했다. 2025년 2월, Anthropic은 코딩 작업을 위한 터미널 기반 에이전트 도구인 Claude Code를 출시했다. Claude Code는 텍스트 기반 상호작용에 초점을 맞췄지만, 컴퓨터 사용은 그래픽 환경에서 여전히 관련성이 있었다. 2025년 8월, Anthropic은 사용자를 대신하여 웹사이트를 탐색하고 클릭 및 양식 작성이 가능한 브라우저 확장 프로그램인 Claude for Chrome을 출시했다. 이 확장 프로그램은 유사한 화면 해석 기술을 활용했다.
2026년 1월, Anthropic은 비기술 사용자를 대상으로 한 그래픽 도구인 Claude Cowork를 도입했다. Cowork는 Claude에게 샌드박스 셸과 사용자가 선택한 폴더에 대한 접근 권한을 제공하여 모델이 파일을 읽고, 쓰고, 편집하고, 코드를 실행하고, 다단계 작업을 연결할 수 있게 했다. Cowork는 컴퓨터 사용에만 의존하지 않았지만 사용자 컴퓨터에서 소프트웨어를 작동할 수 있게 하는 공통 목표를 공유했다.
보안 및 윤리적 고려 사항
컴퓨터 사용의 도입은 보안 우려를 제기했다. 모델이 데스크톱 인터페이스를 제어할 수 있기 때문에 승인되지 않은 작업을 수행하는 데 악용될 가능성이 있었다. Anthropic은 민감한 작업에 대한 사용자 확인 요구 및 특정 시스템 기능에 대한 모델 접근 제한과 같은 안전장치를 구현했다.
프롬프트 주입 공격은 특히 우려되는 사항이었다. 2025년 8월, Anthropic은 Claude for Chrome에서 완화 조치 후 이러한 공격이 11.2%의 확률로 성공했다고 보고했다. 회사는 견고성을 개선하는 방법을 계속 연구했다. Deep learning 및 Neural network 안전에 대한 광범위한 영향은 학계와 산업계에서 논의되었다.
영향 및 평가
컴퓨터 사용 출시는 기술 미디어에서 널리 보도되었다. 이는 디지털 세계와 상호작용할 수 있는 AI 에이전트 개발의 이정표로 간주되었다. 일부 관찰자들은 이를 Chess computer 및 AI가 제한된 환경에서 능력을 입증한 다른 분야의 초기 노력과 비교했지만, 컴퓨터 사용이 더 일반적이고 구조화되지 않은 문제를 다룬다고 언급했다.
Anthropic의 움직임은 또한 AI 기업 간의 경쟁을 강화했다. Microsoft와 Google은 운영 체제와 생산성 도구에 AI를 통합하고 있었고, Amazon Web Services 및 기타 클라우드 제공업체는 AI 서비스를 제공했다. 컴퓨터 사용은 에이전트 AI 공간에서 Anthropic에게 독특한 제품을 제공했다.
향후 방향
2026년 현재, 컴퓨터 사용은 계속 개선되고 있다. Anthropic은 모델의 정확도, 속도 및 복잡한 인터페이스 처리 능력을 향상시킬 계획이었다. 회사는 또한 컴퓨터 사용을 Claude Code 및 Cowork와 같은 다른 에이전트 기능과 결합하여 더 원활한 자동화를 만드는 방법을 탐구했다.
컴퓨터 사용의 개발은 텍스트를 생성할 뿐만 아니라 세계에서 행동을 취할 수 있는 Generative AI 시스템으로의 광범위한 운동의 일부였다. MIT CSAIL 및 Stanford AI Lab과 같은 기관의 연구자들은 유사한 접근 방식을 연구했다. 장기적인 목표는 최소한의 인간 개입으로 광범위한 컴퓨터 기반 작업을 처리할 수 있는 AI 어시스턴트를 만드는 것이었다.
Anthropic의 컴퓨터 사용 기능은 AI를 더 실용적이고 상호작용적으로 만드는 데 있어 주목할 만한 진전을 나타냈다. Claude가 데스크톱 인터페이스를 작동할 수 있게 함으로써 자동화와 지원의 새로운 가능성을 열었으며, 동시에 안전과 통제에 관한 중요한 질문을 제기했다.