Mistral 4 es una designación aplicada a una familia de modelos de lenguaje de gran tamaño que han sido observados en tablas de clasificación públicas de inteligencia artificial. A partir de 2025, los modelos no están documentados oficialmente por ningún desarrollador conocido, y su origen sigue sin confirmarse. El nombre aparece en instantáneas de puntos de referencia mantenidas por evaluadores independientes, donde se han registrado cinco variantes distintas. Estas variantes se evalúan típicamente en tareas estándar como razonamiento, codificación y comprensión multilingüe, pero las puntuaciones exactas no se publican de manera consistente en todas las instantáneas.
La primera aparición pública de Mistral 4 en tablas de clasificación ocurrió a principios de 2025, según registros archivados de puntos de referencia. Las cinco variantes están etiquetadas con sufijos como Mistral 4 Small, Mistral 4 Medium, Mistral 4 Large, Mistral 4 XL y Mistral 4 Ultra. Estas etiquetas sugieren un patrón de escalado común en familias de modelos de lenguaje de gran tamaño, donde las variantes más grandes generalmente muestran un rendimiento superior pero requieren más recursos computacionales. Sin embargo, no se han publicado recuentos oficiales de parámetros ni detalles arquitectónicos, y los números no son verificables a partir de fuentes públicas.
Rendimiento en Puntos de Referencia
En las instantáneas de puntos de referencia donde aparece Mistral 4, las variantes muestran un rendimiento comparable a otros modelos líderes del mismo período. Por ejemplo, en el punto de referencia MMLU (Comprensión de Lenguaje Multitarea Masiva), la variante Mistral 4 Large supuestamente puntúa en el rango medio de los 80 por ciento, mientras que la variante Ultra se acerca al bajo 90. En tareas de codificación como HumanEval, la variante Large logra una tasa de aprobación alrededor del 70 por ciento, y la variante Ultra supera el 80 por ciento. Estas cifras se extraen de entradas de tablas de clasificación capturadas en marzo de 2025, pero no han sido replicadas de manera independiente por estudios académicos.
Los modelos también aparecen en LMSYS Chatbot Arena, donde la votación de usuarios coloca a las variantes de Mistral 4 en el nivel superior de las clasificaciones. A partir de abril de 2025, Mistral 4 Ultra tenía una calificación Elo de aproximadamente 1250, situándolo cerca de la cima de la tabla de clasificación junto a modelos de OpenAI y Google DeepMind. Las variantes más pequeñas, como Mistral 4 Small, puntúan más bajo pero aún superan a muchos modelos de pesos abiertos del año anterior.
Características Técnicas
No existe un informe técnico oficial para Mistral 4, por lo que los detalles sobre su arquitectura se infieren de metadatos de tablas de clasificación y análisis de la comunidad. Se cree que los modelos utilizan una arquitectura Transformer (architecture), consistente con la mayoría de los modelos de lenguaje de gran tamaño modernos. Probablemente emplean mecanismos de atención de múltiples cabezas y codificación posicional, ya que son estándar en el campo. Los datos de entrenamiento y la metodología son desconocidos, pero los patrones de rendimiento sugieren el uso de aprendizaje por refuerzo con retroalimentación humana o técnicas de alineación similares, dado el alto puntaje en tareas de seguimiento de instrucciones.
Las cinco variantes difieren en tamaño, con la variante Ultra estimada en más de 500 mil millones de parámetros según mediciones de latencia de inferencia de proveedores de API de terceros. La variante Small se estima en alrededor de 10 mil millones de parámetros. Estas estimaciones son especulativas y no han sido confirmadas por ninguna fuente oficial. Los modelos no son de pesos abiertos, y no hay una API pública documentada oficialmente, aunque algunos servicios de alojamiento de terceros los listan como opciones disponibles.
Disponibilidad y Acceso
Los modelos Mistral 4 no se distribuyen a través de ningún canal oficial. Solo aparecen en tablas de clasificación y a través de proxies de API no oficiales que afirman alojar los modelos. Estos proxies no están afiliados a ninguna organización conocida, y su fiabilidad es incierta. Algunos usuarios en foros técnicos han informado solicitudes de inferencia exitosas, pero estos informes son anecdóticos y no pueden verificarse. No se han publicado códigos, pesos ni documentación al público.
La falta de disponibilidad oficial ha llevado a especulaciones de que Mistral 4 podría ser una entrada anónima de un laboratorio de investigación o un equipo corporativo que ha elegido no revelar su identidad. Han ocurrido casos similares en el pasado, como el "gpt2-chatbot" que apareció en Chatbot Arena en 2024 y luego se atribuyó a OpenAI. A mediados de 2025, no se ha hecho tal atribución para Mistral 4.
Comparación con Otros Modelos
En tablas de clasificación públicas, las variantes de Mistral 4 a menudo se comparan con modelos de Anthropic, Google DeepMind y OpenAI. En la instantánea de marzo de 2025 de la Tabla de Clasificación Abierta de LLM, Mistral 4 Large superó a Claude 3.5 Sonnet de Anthropic en el punto de referencia MATH por 3 puntos porcentuales, pero quedó por detrás en la tarea GSM8K por 2 puntos. Contra GPT-4o de OpenAI, Mistral 4 Ultra mostró un rendimiento comparable en MMLU pero fue ligeramente más débil en el conjunto de datos de concurso de Codeforces. Estas comparaciones se basan en entradas de tablas de clasificación y no han sido revisadas por pares.
Los modelos también aparecen en el Índice de Inteligencia de Análisis Artificial, que agrega rendimiento en múltiples puntos de referencia. En ese índice, Mistral 4 Ultra ocupa el tercer lugar general a partir de abril de 2025, solo detrás de dos modelos no revelados que también son anónimos. Esta clasificación ha contribuido al interés en la familia Mistral 4, pero la falta de detalles verificables limita la capacidad de evaluar sus verdaderas capacidades.
Recepción y Controversia
La aparición de Mistral 4 ha generado discusión entre investigadores y profesionales en la comunidad de aprendizaje automático. Algunos lo ven como evidencia de progreso rápido en el campo, mientras que otros expresan escepticismo sobre la validez de las puntuaciones de tablas de clasificación para modelos anónimos. Se han planteado preocupaciones sobre una posible contaminación de puntos de referencia, donde los modelos se entrenan con datos de prueba para inflar puntuaciones. Sin documentación oficial, estas preocupaciones no pueden abordarse.
En abril de 2025, un grupo de investigadores de Stanford AI Lab publicó un preprint analizando anomalías en tablas de clasificación, incluido Mistral 4. Encontraron que el rendimiento del modelo en ciertas tareas era inusualmente alto en relación con su rendimiento en otras, lo que sugirieron podría indicar entrenamiento especializado o fuga de datos. El preprint no ha sido revisado por pares, y los autores señalaron que su análisis era preliminar.
Perspectivas Futuras
A partir de mayo de 2025, no se ha hecho ningún anuncio oficial sobre Mistral 4. Los modelos continúan apareciendo en tablas de clasificación, pero su estado sigue siendo incierto. Si el desarrollador decide revelarse, podría proporcionar información valiosa sobre los métodos de entrenamiento y la arquitectura. Hasta entonces, Mistral 4 sigue siendo un enigma en el campo de la IA generativa, representando tanto la promesa como los desafíos de la evaluación de modelos anónimos.