Grok-1.5V(Grok-1.5 Vision)는 xAI가 개발한 다중 모드 대규모 언어 모델로, 2024년 4월 12일에 발표되었다. 이 모델은 문서, 다이어그램, 그래프, 스크린샷, 사진을 포함한 시각 정보를 처리하는 기능을 추가하여 Grok-1.5 모델을 확장했다. 발표에도 불구하고 Grok-1.5V는 공개적으로 출시되지 않았으며, xAI는 이후 Grok 시리즈의 후속 모델로 전환했다.
이 발표는 Grok-1.5V를 텍스트와 이미지를 모두 이해할 수 있는 더 유능한 AI 시스템으로 가는 단계로 자리매김했으며, 이는 Generative AI 및 Large language model 개발의 광범위한 추세와 일치한다. 이 모델은 OpenAI, Anthropic, Google DeepMind와 같은 다른 AI 연구소와 경쟁하려는 xAI의 노력의 일환이었다.
배경
xAI는 2018년 OpenAI 이사회에서 물러난 후 일론 머스크가 2023년 3월에 설립했다. 머스크는 OpenAI의 공동 창립자 중 한 명이었으며 샘 알트만과 공동 의장을 역임했다. 이탈 후 그는 정치적 편향과 안전성에 대한 우려를 포함한 AI 개발 방향에 대해 우려를 표명했다. 2023년 4월, 머스크는 그가 "우주의 본질을 이해하려는 최대한 진실을 추구하는 AI"라고 설명한 "TruthGPT"라는 챗봇 계획을 발표했다. 이 개념은 로버트 A. 하인라인이 1961년 소설 낯선 땅의 이방인에서 만든 동사에서 이름을 따온 Grok으로 발전했으며, 이는 무언가를 깊고 직관적으로 이해한다는 의미다.
첫 번째 Grok 모델은 2023년 11월에 미리 공개되었으며, 처음에는 X 프리미엄 사용자에게만 제공되었다. Grok-1은 2024년 3월 17일에 Apache-2.0 라이선스로 오픈소스화되어 아키텍처와 가중치를 공개했다. Grok-1.5는 2024년 3월 29일에 이어졌으며, 개선된 추론 능력과 128,000개의 토큰 컨텍스트 길이를 갖추었다.
개발 및 발표
Grok-1.5V는 Grok-1.5 발표 2주 후인 2024년 4월 12일에 발표되었다. xAI에 따르면 이 모델은 "문서, 다이어그램, 그래프, 스크린샷, 사진을 포함한 다양한 시각 정보를 처리"할 수 있다고 한다. 이 기능은 차트 이해, 스크린샷 해석, 실제 이미지 분석과 같은 작업을 가능하게 하기 위한 것이었다. 발표에서는 출시 날짜를 명시하지 않았으며, 공개 베타나 일반 공개는 이어지지 않았다.
Grok-1.5V의 개발은 모델이 텍스트와 이미지 이해를 결합하는 다중 모드 AI로의 업계 전반의 추진력을 반영했다. 유사한 노력이 OpenAI의 GPT-4V, Google DeepMind의 Gemini, Anthropic의 Claude 3에서 진행 중이었다. 이러한 모델들은 시각적 인식과 언어 추론 사이의 격차를 메우고 문서 분석, 교육, 보조 기술과 같은 분야에서의 응용을 가능하게 하는 것을 목표로 했다.
기술적 측면
xAI는 Grok-1.5V에 대한 자세한 기술 사양을 공개하지 않았지만, 이 모델은 Transformer (architecture) 모델과 혼합 전문가 설계를 기반으로 한 Grok-1.5 아키텍처 위에 구축되었다. 비전 구성 요소는 다른 다중 모드 모델에서 사용되는 접근 방식과 유사하게 이미지를 언어 모델이 처리할 수 있는 표현으로 변환하는 인코더를 포함했을 가능성이 높다. 이는 일반적으로 대조 학습 또는 교차 주의 메커니즘과 같은 기술을 사용하여 대규모 이미지-텍스트 쌍 데이터 세트로 훈련하는 것을 포함한다.
문서, 다이어그램, 그래프를 처리하는 모델의 능력은 과학 논문, 차트, 사용자 인터페이스 스크린샷을 포함한 다양한 시각적 입력으로 훈련되었음을 시사한다. 이는 다양한 시각적 형식에 걸친 일반화를 보장하기 위해 강력한 Data Augmentation 및 Curriculum Learning이 필요했을 것이다.
동시대 모델과의 비교
Grok-1.5V 발표 당시 AI 분야는 다중 모드 기능에서 빠르게 발전하고 있었다. OpenAI는 2023년 말에 이미지를 분석하고 질문에 답할 수 있는 GPT-4V를 출시했다. Google DeepMind의 Gemini 모델도 텍스트, 이미지, 오디오, 비디오로 훈련된 기본 다중 모드였다. Anthropic의 Claude 3도 2024년 3월에 출시되어 비전 입력을 지원했다. Grok-1.5V는 이 분야에서 경쟁하는 것을 목표로 했지만, 공개 출시가 없었기 때문에 시장에 직접적인 영향은 없었다.
xAI의 접근 방식은 Grok을 X 소셜 네트워크에 직접 통합하여 사용자가 게시물에서 챗봇을 태그하고 플랫폼에서 공유된 이미지나 문서에 대해 질문할 수 있게 한 점에서 일부 경쟁사와 달랐다. 이 통합은 X의 실시간 데이터와 사용자 참여를 활용하는 독특한 기능이었다.
여파와 유산
발표에도 불구하고 Grok-1.5V는 출시되지 않았다. xAI의 다음 주요 모델은 2024년 8월 14일에 발표된 Grok-2로, Black Forest Labs의 Flux를 사용한 이미지 생성 기능을 포함했다. Grok-2는 2024년 10월 28일에 이미지 이해 기능도 받아 Grok-1.5V의 비전 약속을 이후 버전에서 효과적으로 실현했다.
Grok-1.5V의 짧은 존재는 전략적 변화, 기술적 과제 또는 자원 할당으로 인해 모델이 발표되었지만 대체되거나 보류될 수 있는 AI 개발의 빠른 변화 특성을 강조했다. 또한 AI 연구소들 사이에서 즉시 배포되지 않더라도 기능을 선보이려는 경쟁 압력을 부각시켰다.
반응과 비판
Grok-1.5V의 발표는 AI 커뮤니티에서 관심을 받았지만, xAI의 야심 찬 주장에 대한 실적 때문에 회의적인 시각도 있었다. 일부 비평가들은 Grok-1.5V가 명확한 출시 계획 없이 발표된 것은 주요 AI 기업의 제품으로는 이례적이라고 지적했다. 또한 Grok 시리즈 전체는 음모론 조장, 반유대주의적 비유 사용, 부적절한 이미지 생성에 대한 비판을 받아왔다. 이러한 문제는 이러한 모델을 대규모로 배포할 때의 안전성과 윤리적 영향에 대한 우려를 제기했다.
xAI가 Grok-1을 오픈소스화하기로 한 결정은 일부에서 투명성으로 가는 단계로 칭찬받았지만, 이후 모델은 오픈소스화되지 않아 개방성에 대한 약속에 의문이 제기되었다.
AI 환경에 미친 영향
Grok-1.5V는 출시되지 않았지만, 그 발표는 다중 모드 AI를 Artificial intelligence의 다음 개척지로 삼는 지속적인 서사에 기여했다. 이는 xAI가 이후 Grok-2에서 실현된 비전 기능에 적극적으로 투자하고 있음을 보여주었다. 이 사건은 또한 모델의 성공이 기술적 우수성뿐만 아니라 적시 배포와 사용자 채택에 달려 있는 AI 산업에서 타이밍과 실행의 중요성을 보여주었다.
더 넓은 맥락에서 Grok-1.5V의 개발은 Deep learning, Neural network 아키텍처, Machine learning 기술의 발전을 포함한 혁신의 물결의 일부였다. 모델의 시각적 이해에 대한 초점은 AI 시스템을 더 지각적이고 맥락을 인식하게 만드는 방법을 탐구하는 MIT CSAIL, Stanford AI Lab, BAIR (Berkeley AI Research)와 같은 기관의 연구와 일치했다.
결론
Grok-1.5V는 약속과 함께 발표되었지만 결코 전달되지 않은 모델로 AI 개발 역사에서 각주로 남아 있다. 그 유산은 Grok-2의 후속 비전 기능과 xAI 모델 제품군의 지속적인 진화에 있다. 이 사건은 빠르게 움직이는 AI 분야에서 발표가 보장이 아니며 모델의 진정한 시험은 실제 세계에서의 영향력임을 상기시킨다.