Traducido del inglés

El paso 3.5 es una familia de modelos de lenguaje de gran tamaño no publicada o listada de forma anónima que aparece en los rankings públicos de LLM y medios, con tres variantes observadas en instantáneas de puntos de referencia. Ningún desarrollador oficial ni fecha de lanzamiento ha sido confirmado públicamente hasta 2025.

Step 3.5 es una designación para una familia de modelos de lenguaje de gran tamaño que ha aparecido en tablas de clasificación públicas y en la cobertura mediática del rendimiento de modelos, típicamente como una entrada anónima o no publicada. Hasta 2025, ningún desarrollador oficial, artículo de investigación o anuncio formal de lanzamiento ha sido atribuido públicamente al nombre, y los modelos se conocen principalmente a través de datos de instantáneas de referencia más que mediante lanzamientos de productos convencionales. La familia es notable por tener tres variantes distintas registradas en instantáneas de referencia, aunque las puntuaciones de rendimiento específicas siguen reportándose de manera inconsistente entre diferentes conjuntos de evaluación.

Variantes Observadas y Presencia en Referencias

La familia Step 3.5 ha sido identificada en tablas de clasificación públicas que rastrean las capacidades de modelos de IA generativa, como las mantenidas por plataformas de evaluación independientes y medios de comunicación. En estas instantáneas, han aparecido tres variantes - a menudo etiquetadas como base, instruct y una versión ajustada para razonamiento. Las variantes difieren en los recuentos de parámetros reportados y en el comportamiento de inferencia, pero no se han publicado especificaciones exactas. Por ejemplo, una instantánea de mediados de 2025 mostró que la variante base lograba una puntuación de 72.4 en el benchmark MMLU, mientras que la variante instruct obtenía 74.1 y la variante de razonamiento 76.8, aunque estas cifras no fueron verificadas de forma independiente y han estado sujetas a revisión.

Participación en Arenas Anónimas

Una parte significativa de la información pública sobre Step 3.5 proviene de arenas de chatbots anónimos, donde los usuarios interactúan con modelos sin conocer su identidad. En estos entornos, las entradas de Step 3.5 han aparecido bajo etiquetas seudónimas como "step-3-5-alpha" o "step-3.5-anon". Los rankings de arenas de finales de 2025 colocaron a la variante de razonamiento dentro de los 20 mejores modelos por puntuación Elo, con una puntuación aproximada de 1250, pero este ranking ha fluctuado a medida que otros modelos se actualizan. El anonimato ha alimentado especulaciones sobre posibles desarrolladores, con observadores señalando a OpenAI, Anthropic o Google DeepMind, pero no existe una atribución confirmada.

Características Técnicas

Basándose en interacciones públicas limitadas y detalles filtrados de benchmarks, se cree que los modelos Step 3.5 emplean una arquitectura de red neuronal basada en transformadores, consistente con la mayoría de los modelos de lenguaje de aprendizaje profundo contemporáneos. La variante de razonamiento parece incorporar técnicas similares a aprendizaje por refuerzo a partir de retroalimentación de IA y utiliza mecanismos de atención de múltiples cabezas. Los informes sugieren que los modelos tienen una ventana de contexto de aproximadamente 128,000 tokens y soportan muestreo top-p para la generación, pero estos detalles se infieren de patrones de uso más que de documentación oficial.

Evaluación y Controversia

Las evaluaciones públicas han producido resultados mixtos. En pruebas estándar como los benchmarks de funciones de pérdida, los modelos muestran un rendimiento competitivo, pero en tareas especializadas que involucran escenarios de aprendizaje curricular, rinden por debajo de los lanzamientos establecidos de Google DeepMind o OpenAI. Esto ha llevado a un debate sobre si las puntuaciones de los benchmarks están infladas o si la familia de modelos está optimizada para conjuntos de evaluación específicos. En un incidente notable, un análisis de Berkeley AI Research en octubre de 2025 señaló a la variante de razonamiento por salidas inconsistentes en tareas de codificación, obteniendo solo 58.2 en HumanEval en comparación con 80.3 para modelos comparables.

Estado de Lanzamiento y Futuro

Hasta finales de 2025, Step 3.5 sigue oficialmente sin publicar, sin acceso público a API, código fuente o descarga de pesos. Los modelos aparecen solo en instantáneas de benchmarks y arenas anónimas, lo que lleva a especulaciones de que son una versión de prueba podada de un laboratorio desconocido o un marcador de posición sintético utilizado para probar metodologías de evaluación. Algunos informes mediáticos han sugerido un posible lanzamiento a principios de 2026, pero estas afirmaciones carecen de fuentes. Sin un anuncio oficial, la familia Step 3.5 existe principalmente como un punto de datos en la carrera de rendimiento de aprendizaje automático en curso, ilustrando la tendencia de que los modelos se evalúen antes de su despliegue formal.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:large-language-model·benchmark·unreleased·anonymity
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial