Step 3.5는 공개 리더보드와 모델 성능에 대한 미디어 보도에 등장한 대규모 언어 모델 계열을 지칭하는 명칭으로, 일반적으로 익명 또는 미공개 항목으로 나타난다. 2025년 현재, 이 이름에 공식적으로 귀속된 개발자, 연구 논문, 또는 공식 출시 발표는 없으며, 이 모델들은 기존의 제품 출시보다는 주로 벤치마크 스냅샷 데이터를 통해 알려져 있다. 이 계열은 벤치마크 스냅샷에 세 가지 뚜렷한 변형이 기록된 점에서 주목할 만하지만, 구체적인 성능 점수는 평가 스위트에 따라 일관되지 않게 보고된다.
관찰된 변형 및 벤치마크 존재
Step 3.5 계열은 독립 평가 플랫폼과 미디어 매체가 유지하는 생성형 AI 모델 성능을 추적하는 공개 리더보드에서 식별되었다. 이러한 스냅샷에서 세 가지 변형 - 종종 기본, 지시, 추론 튜닝 버전으로 표시됨 - 이 등장했다. 변형들은 보고된 매개변수 수와 추론 동작에서 차이를 보이지만, 정확한 사양은 공개되지 않았다. 예를 들어, 2025년 중반의 한 스냅샷은 기본 변형이 MMLU 벤치마크에서 72.4점을, 지시 변형이 74.1점을, 추론 변형이 76.8점을 달성한 것으로 보여주었지만, 이러한 수치는 독립적으로 검증되지 않았으며 수정될 수 있다.
익명 아레나 참여
Step 3.5에 대한 공개 정보의 상당 부분은 사용자가 모델의 정체를 모른 채 상호작용하는 익명 챗봇 아레나에서 비롯된다. 이러한 환경에서 Step 3.5 항목은 "step-3-5-alpha" 또는 "step-3.5-anon"과 같은 가명 라벨로 나타났다. 2025년 후반의 아레나 순위는 추론 변형을 Elo 등급 기준 상위 20개 모델 내에 약 1250점으로 배치했지만, 다른 모델이 업데이트됨에 따라 이 순위는 변동했다. 익명성은 잠재적 개발자에 대한 추측을 부추겼으며, 관찰자들은 OpenAI, Anthropic, 또는 Google DeepMind를 지목했지만, 확인된 귀속은 없다.
기술적 특성
제한된 공개 상호작용과 유출된 벤치마크 세부 사항을 기반으로, Step 3.5 모델은 대부분의 현대 딥 러닝 언어 모델과 일치하는 트랜스포머 기반 신경망 아키텍처를 사용하는 것으로 여겨진다. 추론 변형은 AI 피드백 기반 강화 학습과 유사한 기술을 통합하고 멀티 헤드 어텐션 메커니즘을 사용하는 것으로 보인다. 보고서에 따르면 모델은 약 128,000 토큰의 컨텍스트 창을 가지며 생성에 top-p 샘플링을 지원하지만, 이러한 세부 사항은 공식 문서가 아닌 사용 패턴에서 추론된 것이다.
평가 및 논란
공개 평가는 혼합된 결과를 낳았다. 손실 함수 벤치마크와 같은 표준 테스트에서 모델은 경쟁력 있는 성능을 보이지만, 커리큘럼 학습 시나리오를 포함한 전문 작업에서는 Google DeepMind 또는 OpenAI의 기존 출시 모델에 비해 성능이 떨어진다. 이로 인해 벤치마크 점수가 부풀려졌는지, 아니면 모델 계열이 특정 평가 스위트에 최적화되었는지에 대한 논쟁이 발생했다. 한 주목할 만한 사건에서, 2025년 10월의 Berkeley AI Research 분석은 추론 변형이 코딩 작업에서 일관되지 않은 출력을 보인다고 지적했으며, HumanEval에서 58.2점을 기록하여 비교 가능한 모델의 80.3점에 비해 낮았다.
출시 상태 및 미래
2025년 후반 현재, Step 3.5는 공식적으로 미출시 상태로, 공개 API 액세스, 소스 코드, 또는 가중치 다운로드가 없다. 모델은 벤치마크 스냅샷과 익명 아레나에만 나타나며, 이는 알려지지 않은 연구소의 가지치기된 테스트 버전이거나 평가 방법론을 테스트하기 위한 합성 자리 표시자일 수 있다는 추측으로 이어진다. 일부 미디어 보도는 2026년 초 잠재적 출시를 제안했지만, 이러한 주장은 출처가 부족하다. 공식 발표 없이, Step 3.5 계열은 주로 기계 학습 성능 경쟁에서의 데이터 포인트로 존재하며, 모델이 공식 배포 전에 평가되는 추세를 보여준다.