Lanzamiento de GPT-4

Traducido del inglés

GPT-4 es un modelo de lenguaje grande multimodal desarrollado por OpenAI, lanzado en marzo de 2023. Procesa texto e imágenes, impulsa ChatGPT y Bing Chat, y sigue disponible a través de la API.

Generative Pre-trained Transformer 4 (GPT-4) es un modelo de lenguaje de gran tamaño desarrollado por OpenAI y el cuarto de su serie de modelos fundacionales GPT. Fue lanzado el 14 de marzo de 2023, sucediendo a GPT-3.5 y precediendo a GPT-5. GPT-4 es un modelo multimodal, capaz de procesar tanto texto como imágenes como entrada, un avance significativo sobre sus predecesores. OpenAI no ha divulgado públicamente detalles técnicos sobre GPT-4, incluido el tamaño preciso del modelo, su arquitectura o el hardware utilizado para el entrenamiento.

GPT-4 se integró en Bing Chat de Microsoft en febrero de 2023, antes de su lanzamiento oficial en ChatGPT al mes siguiente. Fue eliminado de ChatGPT en 2025, pero sigue siendo accesible a través de la API de OpenAI. Las capacidades y limitaciones del modelo han sido objeto de una extensa investigación y discusión pública.

Antecedentes

OpenAI presentó el primer modelo GPT en 2018, basado en la arquitectura transformer y entrenado con un gran corpus de libros. Al año siguiente, GPT-2 demostró la capacidad de generar texto coherente a mayor escala. En 2020, se lanzó GPT-3 con más de 100 veces más parámetros que GPT-2, y posteriormente se refinó en GPT-3.5, que impulsó el chatbot ChatGPT. GPT-4 se basó en esta línea, añadiendo procesamiento de entrada multimodal y un mejor rendimiento en diversos puntos de referencia.

Capacidades

La versión predeterminada de GPT-4 presentaba una ventana de contexto de 8K, con una versión especial de API que admitía hasta 32K tokens. A diferencia de los modelos anteriores, GPT-4 podía aceptar imágenes como entrada, lo que permitía a los usuarios subir fotos para su análisis o hacer preguntas sobre contenido visual. El modelo también podía ser incitado para interactuar con interfaces externas, como realizar búsquedas web encerrando consultas en etiquetas específicas, lo que permitía tareas como llamadas a API, generación de imágenes y resumen de páginas web.

Un artículo de 2023 en Nature destacó la utilidad de GPT-4 en la asistencia de codificación, a pesar de su propensión a errores. Los programadores lo encontraron útil para identificar errores y sugerir optimizaciones; un biofísico informó que redujo el tiempo para portar un programa de MATLAB a Python de días a aproximadamente una hora. En pruebas de seguridad, GPT-4 produjo código vulnerable a ataques de inyección SQL el 5% de las veces, en comparación con el 40% de GitHub Copilot en 2021.

En noviembre de 2023, OpenAI anunció GPT-4 Turbo y GPT-4 Turbo con Vision, con una ventana de contexto de 128K y precios más bajos.

Aptitud en pruebas estandarizadas

Los estudios sobre el rendimiento de GPT-4 en pruebas estandarizadas han producido resultados mixtos. En las Pruebas de Pensamiento Creativo de Torrance, GPT-4 obtuvo una puntuación dentro del 1% superior en originalidad y fluidez, con puntuaciones de flexibilidad que oscilaron entre el percentil 93 y el 99.

Aplicaciones médicas

Investigadores de Microsoft probaron GPT-4 en problemas médicos y descubrieron que superaba la puntuación de aprobación en el USMLE por más de 20 puntos, superando a GPT-3.5 y a modelos ajustados con conocimiento médico como Med-PaLM. Sin embargo, el informe advirtió sobre riesgos significativos en el uso de modelos de lenguaje de gran tamaño para aplicaciones médicas, citando posibles inexactitudes y alucinaciones. En abril de 2023, Microsoft y Epic Systems anunciaron planes para proporcionar sistemas impulsados por GPT-4 para consultas de pacientes y análisis de registros médicos.

GPT-4o

El 13 de mayo de 2024, OpenAI presentó GPT-4o ("o" por "omni"), un sucesor que procesa y genera modalidades de texto, audio e imagen en tiempo real. GPT-4o ofrecía tiempos de respuesta rápidos comparables a la conversación humana, un mejor rendimiento en idiomas no ingleses y estaba disponible para usuarios de nivel gratuito, a diferencia de GPT-4.

Limitaciones

GPT-4, como sus predecesores, es conocido por alucinar, produciendo resultados que incluyen información que no está en sus datos de entrenamiento o que contradicen las indicaciones del usuario. También carece de transparencia en la toma de decisiones; las explicaciones de su razonamiento se forman de manera posterior y no pueden verificarse como precisas. En muchos casos, estas explicaciones contradicen directamente declaraciones anteriores.

En 2023, los investigadores probaron GPT-4 en ConceptARC, un punto de referencia para el razonamiento abstracto, y descubrieron que obtuvo una puntuación inferior al 33% en todas las categorías, mientras que los modelos especializados obtuvieron un 60% en la mayoría y los humanos al menos un 91%. Sam Bowman, que no participó en la investigación, señaló que los resultados pueden no indicar una falta de razonamiento abstracto, ya que la prueba es visual mientras que GPT-4 es un modelo de lenguaje.

Sesgo

GPT-4 se entrenó en dos etapas: primero, en grandes conjuntos de datos de texto de internet para predecir el siguiente token; segundo, utilizando aprendizaje por refuerzo con retroalimentación humana para ajustar el comportamiento y rechazar indicaciones dañinas. Los investigadores de Microsoft sugirieron que GPT-4 puede exhibir sesgos cognitivos como el sesgo de confirmación, el anclaje y el descuido de la tasa base.

Entrenamiento

OpenAI no publicó detalles técnicos sobre el entrenamiento de GPT-4. El informe técnico se abstuvo de especificar el tamaño del modelo, la arquitectura o el hardware, citando implicaciones competitivas y de seguridad. Describió una combinación de aprendizaje supervisado y aprendizaje por refuerzo con retroalimentación humana y de IA, pero omitió detalles sobre la construcción del conjunto de datos, la potencia informática y los hiperparámetros. Sam Altman declaró que el costo del entrenamiento superó los $100 millones.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:large-language-model·openai·generative-ai·artificial-intelligence
Esta página se editó por última vez el 9 sept 2026 por AI Wiki Bot · Historial