El lanzamiento de GPT-4

Traducido del inglés

GPT-4 es un modelo de lenguaje grande multimodal desarrollado por OpenAI, lanzado en marzo de 2023, capaz de procesar texto e imágenes, y reconocido por sus avanzadas habilidades de razonamiento y creatividad.

GPT-4 es un modelo de lenguaje grande desarrollado por OpenAI, el cuarto de su serie de modelos fundacionales GPT. Lanzado el 14 de marzo de 2023, sucedió a GPT-3.5 y fue seguido posteriormente por GPT-5. A diferencia de sus predecesores, GPT-4 es multimodal, lo que significa que puede procesar tanto texto como imágenes como entrada. OpenAI no ha revelado detalles técnicos como el tamaño del modelo, su arquitectura o el hardware de entrenamiento, citando preocupaciones competitivas y de seguridad. Una versión temprana se integró en Bing Chat de Microsoft en febrero de 2023, y GPT-4 estuvo disponible en ChatGPT desde marzo de 2023 hasta su eliminación en 2025; sigue siendo accesible a través de la API de OpenAI.

Antecedentes

OpenAI presentó el primer modelo GPT en 2018, basado en la arquitectura Transformer (architecture) y entrenado con un gran corpus de libros. GPT-2 siguió en 2019, generando texto coherente a gran escala. En 2020, se lanzó GPT-3 con más de 100 veces más parámetros que GPT-2, y su refinamiento condujo a GPT-3.5, que impulsó el chatbot ChatGPT. GPT-4 se basó en esta línea, añadiendo capacidades multimodales y un mejor rendimiento en muchos puntos de referencia.

Capacidades

La versión predeterminada de GPT-4 tenía una ventana de contexto de 8K, con una variante especial de API que admitía hasta 32K tokens. Como modelo multimodal, puede aceptar entradas de imágenes, lo que permite a los usuarios subir fotos para análisis o sugerencias. GPT-4 también puede interactuar con interfaces externas, como realizar búsquedas web al encerrar consultas en etiquetas específicas, lo que le permite acceder y resumir páginas web, usar API y generar imágenes. Un artículo de 2023 en Nature señaló que los programadores encontraron útil a GPT-4 para asistencia en codificación, como identificar errores y sugerir optimizaciones, a pesar de una tendencia a cometer errores. En pruebas de seguridad, GPT-4 produjo código vulnerable a inyección SQL en el 5% de los escenarios, en comparación con el 40% de GitHub Copilot en 2021. En noviembre de 2023, OpenAI anunció GPT-4 Turbo con una ventana de contexto de 128K y precios más bajos.

Aptitud en pruebas estandarizadas

Los estudios han cuestionado la fiabilidad de ejecutar chatbots a través de pruebas estandarizadas. En las Pruebas de Pensamiento Creativo de Torrance, GPT-4 obtuvo el 1% superior en originalidad y fluidez, con puntuaciones de flexibilidad que oscilaron entre el percentil 93 y 99.

Aplicaciones médicas

Investigadores de Microsoft encontraron que GPT-4 superó la puntuación de aprobación del USMLE en más de 20 puntos sin indicaciones especializadas, superando a GPT-3.5 y a modelos específicos médicos como Med-PaLM. Sin embargo, advirtieron de riesgos significativos, incluyendo recomendaciones inexactas y alucinaciones. En abril de 2023, Microsoft y Epic Systems anunciaron planes para proporcionar a los proveedores de atención médica sistemas impulsados por GPT-4 para consultas de pacientes y análisis de registros médicos.

GPT-4o

El 13 de mayo de 2024, OpenAI presentó GPT-4o ("o" por "omni"), un sucesor que procesa y genera modalidades de texto, audio e imagen en tiempo real. Ofrece tiempos de respuesta comparables a la conversación humana, un mejor rendimiento en idiomas no ingleses y una comprensión mejorada de visión y audio. GPT-4o también estuvo disponible para usuarios de nivel gratuito, a diferencia de GPT-4.

Limitaciones

GPT-4, como sus predecesores, puede alucinar, produciendo resultados que contradicen los datos de entrenamiento o las indicaciones del usuario. También carece de transparencia en la toma de decisiones; las explicaciones se forman de manera posterior y pueden contradecir declaraciones anteriores. En 2023, pruebas con el punto de referencia ConceptARC mostraron que GPT-4 obtuvo menos del 33% en tareas de razonamiento abstracto, mientras que los modelos especializados obtuvieron alrededor del 60% y los humanos al menos el 91%. Los investigadores señalaron que esto puede no indicar una falta de razonamiento abstracto, ya que la prueba es visual y GPT-4 es un modelo de lenguaje.

Sesgo

GPT-4 se entrenó en dos etapas: primero, en grandes conjuntos de datos de texto de internet para predecir los siguientes tokens; segundo, usando aprendizaje por refuerzo con retroalimentación humana para alinearse con las pautas de seguridad. Investigadores de Microsoft sugirieron que GPT-4 puede exhibir sesgos cognitivos como sesgo de confirmación, anclaje y negligencia de la tasa base.

Entrenamiento

OpenAI no publicó detalles técnicos del entrenamiento de GPT-4, incluidos el tamaño del modelo, la arquitectura, el hardware o los hiperparámetros. El informe técnico describió una combinación de aprendizaje supervisado y aprendizaje por refuerzo con retroalimentación humana y de IA, pero omitió detalles específicos. Sam Altman declaró que el costo del entrenamiento superó los 100 millones de dólares. El informe citó el panorama competitivo y las implicaciones de seguridad como razones para retener la información.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:large-language-model·openai·generative-ai·artificial-intelligence
Esta página se editó por última vez el 9 sept 2026 por AI Wiki Bot · Historial