Step 3.5 é uma designação para uma família de modelos de linguagem de grande porte que apareceu em leaderboards públicos e na cobertura da mídia sobre o desempenho de modelos, tipicamente como uma entrada anônima ou não lançada. Até 2025, nenhum desenvolvedor oficial, artigo de pesquisa ou anúncio formal de lançamento foi publicamente atribuído ao nome, e os modelos são conhecidos principalmente por dados de snapshots de benchmarks, em vez de lançamentos convencionais de produtos. A família é notável por ter três variantes distintas registradas em snapshots de benchmarks, embora as pontuações específicas de desempenho permaneçam inconsistentemente relatadas em diferentes suítes de avaliação.
Variantes Observadas e Presença em Benchmarks
A família Step 3.5 foi identificada em leaderboards públicos que rastreiam as capacidades de modelos de IA generativa, como aqueles mantidos por plataformas de avaliação independentes e veículos de mídia. Nesses snapshots, três variantes - frequentemente rotuladas como base, instruct e uma versão ajustada para raciocínio - apareceram. As variantes diferem em contagens de parâmetros relatadas e comportamento de inferência, mas especificações exatas não foram divulgadas. Por exemplo, um snapshot de meados de 2025 mostrou a variante base alcançando uma pontuação de 72,4 no benchmark MMLU, enquanto a variante instruct pontuou 74,1 e a variante de raciocínio 76,8, embora esses números não tenham sido verificados de forma independente e estejam sujeitos a revisão.
Participação Anônima em Arenas
Uma parte significativa da informação pública sobre Step 3.5 vem de arenas de chatbots anônimos, onde usuários interagem com modelos sem saber sua identidade. Nesses ambientes, entradas Step 3.5 apareceram sob rótulos pseudônimos como "step-3-5-alpha" ou "step-3.5-anon". Rankings de arenas do final de 2025 colocaram a variante de raciocínio entre os 20 principais modelos por rating Elo, com uma pontuação aproximada de 1250, mas esse ranking flutuou conforme outros modelos são atualizados. O anonimato alimentou especulações sobre possíveis desenvolvedores, com observadores apontando para OpenAI, Anthropic ou Google DeepMind, mas nenhuma atribuição confirmada existe.
Características Técnicas
Com base em interações públicas limitadas e detalhes vazados de benchmarks, acredita-se que os modelos Step 3.5 empreguem uma arquitetura de rede neural baseada em transformadores, consistente com a maioria dos modelos de linguagem contemporâneos de aprendizado profundo. A variante de raciocínio parece incorporar técnicas semelhantes ao aprendizado por reforço a partir de feedback de IA e usa mecanismos de atenção multi-cabeça. Relatos sugerem que os modelos têm uma janela de contexto de aproximadamente 128.000 tokens e suportam amostragem top-p para geração, mas esses detalhes são inferidos de padrões de uso, em vez de documentação oficial.
Avaliação e Controvérsia
Avaliações públicas produziram resultados mistos. Em testes padrão como benchmarks de funções de perda, os modelos mostram desempenho competitivo, mas em tarefas especializadas envolvendo cenários de aprendizado curricular, eles têm desempenho inferior em comparação com lançamentos estabelecidos do Google DeepMind ou OpenAI. Isso levou a um debate sobre se as pontuações de benchmarks são infladas ou se a família de modelos é otimizada para suítes de avaliação específicas. Em um incidente notável, uma análise da Berkeley AI Research em outubro de 2025 sinalizou a variante de raciocínio por saídas inconsistentes em tarefas de codificação, pontuando apenas 58,2 no HumanEval em comparação com 80,3 para modelos comparáveis.
Status de Lançamento e Futuro
Até o final de 2025, Step 3.5 permanece oficialmente não lançado, sem acesso público a API, código-fonte ou download de pesos. Os modelos aparecem apenas em snapshots de benchmarks e arenas anônimas, levando a especulações de que são ou uma versão de teste poda de modelo de um laboratório desconhecido ou um espaço reservado sintético usado para testar metodologias de avaliação. Alguns relatos da mídia sugeriram um possível lançamento no início de 2026, mas essas alegações carecem de fontes. Sem um anúncio oficial, a família Step 3.5 existe principalmente como um ponto de dados na corrida contínua de desempenho em aprendizado de máquina, ilustrando a tendência de modelos serem avaliados antes do deploy formal.