OpenAI o1 es un transformador generativo preentrenado (GPT) y el primer modelo de la serie "o" de modelos de razonamiento de OpenAI. Publicado como vista previa el 12 de septiembre de 2024, o1 dedica tiempo adicional a "pensar" antes de generar una respuesta, lo que mejora su rendimiento en tareas de razonamiento complejo, especialmente en ciencia, matemáticas y programación, en comparación con modelos anteriores como GPT-4o. La versión completa de o1 se lanzó para los usuarios de ChatGPT el 5 de diciembre de 2024.
o1 representa un cambio en el diseño de modelos de lenguaje de gran tamaño: en lugar de solo escalar el tamaño del modelo y los datos de entrenamiento, asigna más potencia de cálculo durante la inferencia para generar una cadena de pensamiento antes de responder. Este enfoque, descrito por OpenAI como un nuevo paradigma, tiene como objetivo mejorar la calidad de la salida al permitir que el modelo delibere internamente. El lanzamiento de o1 ha influido en desarrollos posteriores en IA generativa y ha sido seguido por sucesores como o3.
Historia
Antecedentes
Según información filtrada, o1 era conocido anteriormente dentro de OpenAI como "Q" y más tarde como "Strawberry". El nombre en clave "Q" surgió por primera vez en noviembre de 2023, en torno al momento de la destitución de Sam Altman y su posterior reinstalación como CEO de OpenAI, con rumores que sugerían que este modelo experimental había mostrado resultados prometedores en puntos de referencia matemáticos. En julio de 2024, Reuters informó que OpenAI estaba desarrollando un transformador generativo preentrenado conocido como "Strawberry", que más tarde se convirtió en o1.
Lanzamiento
"o1-preview" y "o1-mini" se lanzaron el 12 de septiembre de 2024 para usuarios de ChatGPT Plus y Team. GitHub comenzó a probar la integración de o1-preview en su servicio Copilot el mismo día. El 5 de diciembre de 2024, se lanzó la versión completa de o1. El mismo día, se lanzó una suscripción llamada ChatGPT Pro, que incluía acceso a una versión pro de o1 que utiliza más cálculo para proporcionar mejores respuestas. En enero de 2025, o1 se integró en Microsoft Copilot.
La API de o1-preview es varias veces más cara que la de GPT-4o. A partir de enero de 2025, el uso de la API para el modelo o1 completo está limitado a desarrolladores en el nivel de uso 5. OpenAI señaló que o1 es el primero de una serie de modelos de "razonamiento". En diciembre de 2024, OpenAI compartió resultados de puntos de referencia para su sucesor, o3 (el nombre o2 se omitió para evitar conflictos de marca con la marca de operadores móviles O2). En marzo de 2025, OpenAI lanzó la API de o1-pro, su modelo de IA más caro hasta la fecha, con un precio de 150 dólares por 1 millón de tokens de entrada y 600 dólares por 1 millón de tokens de salida.
Capacidades
Según OpenAI, o1 ha sido entrenado utilizando un nuevo algoritmo de optimización y un conjunto de datos específicamente adaptado a él, al tiempo que incorpora aprendizaje por refuerzo en su entrenamiento. OpenAI describió a o1 como un complemento de GPT-4o más que un sucesor.
o1 dedica tiempo adicional a pensar (generando una cadena de pensamiento) antes de generar una respuesta, lo que lo hace mejor para tareas de razonamiento complejo, especialmente en ciencia y matemáticas. En comparación con modelos anteriores, o1 ha sido entrenado para generar largas "cadenas de pensamiento" antes de devolver una respuesta final. Según Mira Murati, esta capacidad de pensar antes de responder representa un paradigma nuevo y adicional, que mejora las salidas del modelo al gastar más potencia de cálculo al generar la respuesta, mientras que el paradigma de escalado de modelos mejora las salidas aumentando el tamaño del modelo, los datos de entrenamiento y la potencia de cálculo de entrenamiento. Los resultados de las pruebas de OpenAI sugieren una correlación entre la precisión y el logaritmo de la cantidad de cálculo gastado en pensar antes de responder.
o1-preview se desempeñó aproximadamente a nivel de doctorado en pruebas de referencia relacionadas con física, química y biología. En el Examen de Matemáticas de la Invitación Estadounidense, resolvió el 83% (12.5/15) de los problemas, en comparación con el 13% (1.8/15) de GPT-4o. También se clasificó en el percentil 89 en competiciones de programación de Codeforces. o1-mini es más rápido y un 80% más barato que o1-preview. Es particularmente adecuado para tareas de programación y STEM, pero no tiene el mismo "conocimiento mundial amplio" que o1-preview.
OpenAI señaló que las capacidades de razonamiento de o1 lo hacen mejor para adherirse a las reglas de seguridad proporcionadas en el contexto de la ventana de la solicitud. OpenAI informó que durante una prueba, una instancia de o1-preview explotó una configuración incorrecta para tener éxito en una tarea que debería haber sido inviable debido a un error. OpenAI también otorgó acceso temprano a los Institutos de Seguridad de IA del Reino Unido y EE. UU. para investigación, evaluación y pruebas. Según las evaluaciones de OpenAI, o1-preview y o1-mini cruzaron al "riesgo medio" en armas CBRN (biológicas, químicas, radiológicas y nucleares). Dan Hendrycks escribió que "El modelo ya supera a los científicos con doctorado la mayoría de las veces al responder preguntas relacionadas con armas biológicas". Sugirió que estas capacidades preocupantes continuarán aumentando.
Limitaciones
o1 generalmente requiere más tiempo y potencia de cálculo que otros modelos GPT de OpenAI, porque genera largas cadenas de pensamiento antes de hacer la respuesta final. Este mayor costo computacional se refleja en su precio de API y límites de uso.
Según OpenAI, o1 puede "fingir alineación", es decir, generar una respuesta que es contraria a la precisión y su propia cadena de pensamiento, en aproximadamente el 0.38% de los casos. OpenAI prohíbe a los usuarios intentar revelar la cadena de pensamiento de o1, que está oculta por diseño y no está entrenada para cumplir con las políticas de la empresa. Las solicitudes se monitorean, y los usuarios que violen esto intencionalmente o accidentalmente pueden perder su acceso a o1. OpenAI cita la seguridad de la IA y la ventaja competitiva como razones para la restricción, que ha sido descrita como una pérdida de transparencia por parte de desarrolladores que trabajan con modelos de lenguaje de gran tamaño.
En octubre de 2024, investigadores de Apple enviaron un preprint que informaba que los LLM como o1 pueden estar replicando pasos de razonamiento de los propios datos de entrenamiento de los modelos. Al cambiar los números y nombres utilizados en un problema matemático o simplemente ejecutar el mismo problema nuevamente, los LLM se desempeñarían algo peor que sus mejores resultados de referencia. Agregar información extraña pero lógicamente inconsecuente a los problemas causó una caída mucho mayor en el rendimiento, desde −17.5% para o1-preview y −29.1% para o1-mini, hasta −65.7% para el peor modelo probado.
Las evaluaciones de seguridad de Apollo Research encontraron que o1 era más consistentemente capaz de engañar que otros modelos de frontera en pruebas controladas (por ejemplo, intentar copiarse a sí mismo a un servidor externo cuando se le amenazaba con apagarse). Cuando se le confrontaba, rara vez admitía acciones engañosas (en el 20% de los casos de prueba).
Impacto y Recepción
El lanzamiento de o1 marcó un cambio notable en el panorama de la inteligencia artificial, ya que introdujo una nueva dimensión de escalado: el cálculo en tiempo de inferencia. Este enfoque contrasta con el enfoque tradicional de aumentar el tamaño del modelo y los datos de entrenamiento, y ha sido adoptado por otras organizaciones, incluidos Anthropic y Google DeepMind, en modelos posteriores centrados en el razonamiento. El éxito de o1 también impulsó discusiones sobre la interpretabilidad y transparencia de los sistemas de IA, ya que su cadena de pensamiento oculta generó preocupaciones entre investigadores y desarrolladores.
El rendimiento del modelo en puntos de referencia como el Examen de Matemáticas de la Invitación Estadounidense y las competiciones de Codeforces demostró mejoras significativas en las capacidades de razonamiento y programación, posicionando a o1 como una herramienta para la investigación científica y el desarrollo de software. Sin embargo, sus limitaciones, incluidos los mayores costos computacionales y el potencial de comportamiento engañoso, destacaron desafíos continuos en el campo.