GPT-4 Turbo es un modelo de lenguaje de gran tamaño desarrollado por OpenAI, anunciado en noviembre de 2023 como una versión mejorada del modelo anterior GPT-4. Sus mejoras más notables incluyen una ventana de contexto de 128K tokens, que permite al modelo procesar entradas significativamente más largas, y una estructura de precios de API más baja. El lanzamiento también introdujo GPT-4 Turbo con Visión, una variante capaz de procesar tanto texto como imágenes. GPT-4 Turbo fue sucedido por GPT-4o en mayo de 2024, que ofrecía procesamiento multimodal en tiempo real y acceso gratuito para los usuarios de ChatGPT.
Antecedentes
OpenAI presentó el primer modelo GPT en 2018, basado en la arquitectura Transformer (architecture) y entrenado con un gran corpus de libros. Las iteraciones posteriores, GPT-2 en 2019 y GPT-3 en 2020, ampliaron los parámetros y mejoraron la generación de texto. GPT-3.5 impulsó el lanzamiento inicial de ChatGPT en noviembre de 2022, lo que llevó los modelos de lenguaje de gran tamaño a la atención general. GPT-4, lanzado en marzo de 2023, añadió capacidades multimodales, aceptando entradas tanto de texto como de imagen. La versión predeterminada tenía una ventana de contexto de 8K, con una variante especial de API que admitía hasta 32K tokens. GPT-4 Turbo se desarrolló para abordar las limitaciones en la longitud del contexto y el costo, basándose en los cimientos de su predecesor.
Anuncio y Lanzamiento
OpenAI anunció GPT-4 Turbo el 6 de noviembre de 2023, en su primera conferencia de desarrolladores, DevDay, celebrada en San Francisco. El modelo se puso a disposición a través de la API de OpenAI, con un precio de $0.01 por cada 1,000 tokens de entrada y $0.03 por cada 1,000 tokens de salida, aproximadamente tres veces más barato que GPT-4. La ventana de contexto de 128K permitía procesar documentos que superaban las 300 páginas de texto en una sola solicitud. OpenAI también presentó una versión actualizada de GPT-4 Turbo con Visión, que podía analizar imágenes junto con texto. El anuncio destacó mejoras en el seguimiento de instrucciones, el modo JSON y la llamada a funciones, lo que hacía que el modelo fuera más adecuado para aplicaciones de desarrolladores.
Capacidades
GPT-4 Turbo conservó las capacidades de entrada multimodal de GPT-4, permitiendo a los usuarios proporcionar tanto texto como imágenes. Podía interactuar con herramientas externas mediante la llamada a funciones, lo que habilitaba tareas como búsquedas web, llamadas a API y generación de imágenes. La ventana de contexto ampliada permitía al modelo mantener coherencia en conversaciones más largas y procesar libros completos o bases de código. En un artículo de 2023 en Nature, los programadores informaron que GPT-4 Turbo ayudaba en tareas de codificación, como identificar errores y sugerir optimizaciones, aunque era propenso a cometer errores. En una prueba de 89 escenarios de seguridad, GPT-4 produjo código vulnerable a ataques de inyección SQL el 5% de las veces, una mejora respecto a GitHub Copilot de 2021, que tenía una tasa de vulnerabilidad del 40%.
Rendimiento en Pruebas Estandarizadas
Los estudios sobre el rendimiento de GPT-4 Turbo en pruebas estandarizadas fueron limitados, pero las evaluaciones anteriores de GPT-4 mostraron resultados sólidos. En las Pruebas de Pensamiento Creativo de Torrance, GPT-4 obtuvo puntuaciones dentro del 1% superior en originalidad y fluidez, con puntuaciones de flexibilidad que oscilaban entre el percentil 93 y el 99. Los investigadores advirtieron que ejecutar chatbots en tales pruebas puede no ser fiable, ya que los modelos pueden generar respuestas plausibles pero incorrectas.
Aplicaciones Médicas
Investigadores de Microsoft probaron GPT-4 en problemas médicos y descubrieron que superaba la puntuación de aprobación del Examen de Licencia Médica de los Estados Unidos por más de 20 puntos, superando a modelos anteriores como GPT-3.5 y a modelos especializados como Med-PaLM. Sin embargo, advirtieron sobre riesgos significativos, incluidos recomendaciones inexactas y alucinaciones con errores fácticos importantes. En abril de 2023, Microsoft y Epic Systems anunciaron planes para proporcionar a los proveedores de atención médica sistemas impulsados por GPT-4 para responder preguntas de pacientes y analizar registros médicos, una tendencia que continuó con GPT-4 Turbo.
Limitaciones
Al igual que sus predecesores, GPT-4 Turbo podía alucinar, produciendo salidas que contradecían la solicitud del usuario o contenían información fabricada. También carecía de transparencia en la toma de decisiones; cuando se le pedía explicar su razonamiento, el modelo generaba explicaciones post hoc que no podían verificarse como reflejo del proceso real. En 2023, los investigadores probaron GPT-4 contra el punto de referencia ConceptARC, diseñado para medir el razonamiento abstracto, y descubrieron que obtenía menos del 33% en todas las categorías, mientras que los modelos especializados obtenían el 60% en la mayoría y los humanos al menos el 91%. Sam Bowman, no involucrado en la investigación, señaló que la naturaleza visual de la prueba podría desfavorecer a un modelo de lenguaje.
Sesgo
GPT-4 Turbo se entrenó en dos etapas: primero, en grandes conjuntos de datos de texto de internet para predecir el siguiente token, y segundo, utilizando aprendizaje por refuerzo con retroalimentación humana para alinearse con las pautas de seguridad. Investigadores de Microsoft sugirieron que GPT-4 exhibía sesgos cognitivos como el sesgo de confirmación, el anclaje y el descuido de la tasa base. El proceso de entrenamiento tenía como objetivo reducir salidas dañinas, pero los sesgos aún podían emerger.
Entrenamiento
OpenAI no reveló detalles técnicos del entrenamiento de GPT-4 Turbo, incluidos el tamaño del modelo, la arquitectura o el hardware. El informe técnico de GPT-4, que probablemente se aplicaba a Turbo, citaba preocupaciones competitivas y de seguridad para este secretismo. Sam Altman declaró que entrenar GPT-4 costó más de $100 millones. El entrenamiento utilizó aprendizaje supervisado seguido de aprendizaje por refuerzo con retroalimentación tanto humana como de IA, pero los detalles específicos como los hiperparámetros y la construcción del conjunto de datos no se revelaron.
Recepción e Impacto
GPT-4 Turbo fue bien recibido por los desarrolladores debido a su menor costo y su ventana de contexto más grande, lo que habilitó nuevas aplicaciones como el análisis de documentos largos y flujos de trabajo de agentes complejos. Reforzó la posición de OpenAI en el panorama competitivo de los modelos de lenguaje de gran tamaño, enfrentándose a rivales como Anthropic y Google DeepMind. El lanzamiento también destacó la tendencia hacia modelos de IA más eficientes y accesibles, influyendo en desarrollos posteriores en el campo. GPT-4 Turbo permaneció disponible en la API de OpenAI hasta que finalmente fue reemplazado por modelos más nuevos, aunque GPT-4 en sí fue eliminado de ChatGPT en 2025.