Inkling은 Thinking Machines 사가 만든 오픈 가중치 대규모 언어 모델로, 2026년 7월 15일 Apache 2.0 라이선스로 처음 출시되었다. 텍스트, 이미지, 오디오를 입력으로 받아들이며 채팅, 소프트웨어 개발, 다국어 애플리케이션, 에이전트 시스템과 같은 작업을 수행할 수 있다. 오픈 가중치 모델로서 그 매개변수가 공개되어 있어 개발자가 이를 검사하고 특수 용도로 미세 조정할 수 있다.
이 모델은 여러 양식에 걸친 기본 추론 능력과 조정 가능한 추론 예산으로 주목할 만하며, 이를 통해 사용자는 속도와 정확성 사이에서 균형을 선택할 수 있다. 실제 환경에서의 효율성과 검열 저항성을 염두에 두고 설계되었으며, 제작자는 안전을 위해 외부 중재 도구를 사용할 것을 권장한다.
훈련
Inkling은 Thinking Machines가 출시한 첫 번째 대규모 언어 모델이다. 텍스트, 이미지, 오디오, 비디오 데이터로 구성된 45조 개의 토큰으로 훈련되어 이 네 가지 형식 중 어느 것에서든 기본적으로 추론할 수 있다. 그러나 출시 당시 모델은 이미지나 오디오가 아닌 텍스트(소스 코드 및 구조화된 데이터 포함)만 생성할 수 있었다.
훈련 과정은 현대 Transformer (architecture) 아키텍처에 공통적인 딥 러닝 기법을 활용했을 가능성이 높지만, 아키텍처와 최적화에 대한 구체적인 세부 사항은 공개적으로 밝혀지지 않았다.
특징
Inkling은 생산 환경에서 적응성과 효율성을 갖추도록 설계되었다. 주요 기능 중 하나는 프로그래밍 가능한 추론 예산으로, 0.2에서 0.99 범위에서 조정할 수 있다. 이는 모델이 출력을 생성하기 전에 수행하는 "사고"의 양을 제어하여 개발자가 각 작업에 대한 비용/성능 균형을 최적화할 수 있게 한다. 낮은 예산은 더 빠른 응답을, 높은 예산은 더 정제된 답변을 생성한다.
대부분의 다른 대규모 언어 모델(다른 오픈 가중치 변형 포함)과 달리 Inkling은 검열 저항성에 중점을 두고 만들어졌다. 정치적으로 민감하거나 검열된 주제에 대해 직접적인 답변을 제공한다. 제작자는 내부 안전 평가가 항상 유해한 응답을 방지하지 못할 수 있으므로 외부 콘텐츠 중재 도구를 사용할 것을 권장한다. 이러한 철학적 입장은 생성형 AI 환경에서 이 모델을 차별화한다.
맞춤화를 위해 개발자는 Thinking Machines의 Tinker 플랫폼을 통해 모델을 미세 조정하고 타사 제공업체를 통해 배포할 수 있다.
기술 정보
Inkling은 최대 1,048,576개의 토큰 컨텍스트 창을 지원하여 매우 긴 문서나 대화를 처리할 수 있다. 9750억 개의 매개변수를 포함하지만 Mixture of experts 설계로 인해 주어진 시간에 활성화되는 것은 410억 개뿐이다. 입력은 가장 관련성 높은 전문가 모듈로 라우팅되어 계산 효율성을 향상시킨다.
이 모델은 llama.cpp와 같은 일반적인 추론 라이브러리를 사용하여 실행할 수 있다. 최소 하드웨어 요구 사항은 2TB 이상의 VRAM이지만, 양자화된 버전은 이를 약 600GB로 줄여 더 작은 인프라를 가진 조직에서도 배포가 더 실현 가능하게 한다.
배포 및 생태계
Inkling의 오픈 가중치 특성은 Amazon Web Services, Azure, Google Cloud, Oracle Cloud를 포함한 다양한 클라우드 플랫폼이나 적합한 하드웨어를 갖춘 온프레미스 환경에 배포할 수 있음을 의미한다. 에이전트 시스템과 통합되도록 설계되어 추론 및 의사 결정 구성 요소로 작동할 수 있다. 다국어 기능은 국제 애플리케이션에 적합하게 만든다.
Thinking Machines는 Inkling을 특수 AI 도구를 구축하기 위한 기반 모델로 포지셔닝하며, Tinker 플랫폼이 주요 미세 조정 인터페이스 역할을 한다. 출시 당시 Inkling은 오픈 소스 AI 커뮤니티에 주목할 만한 기여를 나타내며, 많은 상업적 대응 제품에는 없는 성능, 유연성, 철학적 개방성의 조합을 제공한다.