Lanzamientos de GPT-5 y GPT-6 Astra

Traducido del inglés

OpenAI lanzó GPT-5 el 7 de agosto de 2025, un modelo de lenguaje grande multimodal con capacidades mejoradas de razonamiento y seguridad, seguido de GPT-6 Astra, que avanzó aún más en la interacción multimodal y las capacidades agénticas.

GPT-5 y GPT-6 Astra son lanzamientos sucesivos de OpenAI, que marcan avances significativos en la tecnología de modelos de lenguaje de gran escala y la interacción multimodal. GPT-5, lanzado el 7 de agosto de 2025, es la quinta generación de la serie transformador preentrenado generativo, sucediendo a GPT-4. GPT-6 Astra, que le siguió, se basa en esta base con un enfoque en experiencias en tiempo real, agénticas y multimodales, destinadas a integrarse más profundamente en los flujos de trabajo y dispositivos cotidianos.

Estos lanzamientos forman parte de la trayectoria más amplia de OpenAI hacia la inteligencia artificial general, como describió el CEO Sam Altman durante la presentación de GPT-5. Los modelos son accesibles públicamente a través de ChatGPT y Microsoft Copilot, así como a través de la API de OpenAI para desarrolladores. Este artículo detalla los antecedentes, capacidades, arquitectura, entrenamiento, uso y limitaciones de estos sistemas, basándose en informes públicos y documentación técnica disponible en sus fechas de lanzamiento.

Antecedentes

El 14 de abril de 2023, Sam Altman habló en el Instituto de Tecnología de Massachusetts y declaró que OpenAI no estaba entrenando GPT-5 en ese momento, enfatizando un enfoque en el desarrollo de GPT-4. Sin embargo, el 18 de julio de ese año, OpenAI solicitó una marca comercial para "GPT-5" en los Estados Unidos, y para el 13 de noviembre, Altman confirmó al Financial Times que el trabajo en GPT-5 estaba en curso.

Según The Information, gran parte de la segunda mitad de 2024 involucró un modelo interno conocido como Orion, destinado a convertirse en GPT-5. Ese esfuerzo aparentemente no logró producir un mejor modelo, lo que llevó a su lanzamiento como GPT-4.5 en febrero de 2025. Para finales de julio de 2025, las expectativas de un lanzamiento de GPT-5 a principios de agosto habían crecido, con The Verge informando el 30 de julio que Microsoft estaba preparando su chatbot Copilot para el nuevo modelo.

El 5 de agosto de 2025, OpenAI lanzó GPT-OSS, un conjunto de dos modelos de pesos abiertos con capacidades de razonamiento, como precursor. GPT-5 fue presentado durante un evento en vivo el 7 de agosto. El posterior GPT-6 Astra fue introducido más tarde en 2025, con menos anticipación pública pero un mayor énfasis en la interacción multimodal y agéntica, basándose en las lecciones de implementaciones anteriores.

Capacidades

En su lanzamiento, GPT-5 logró un rendimiento de vanguardia en puntos de referencia que evalúan matemáticas, programación, finanzas y comprensión multimodal. OpenAI informó mejoras sobre sus predecesores, incluidos tiempos de respuesta más rápidos, mejores habilidades de codificación y escritura, respuestas relacionadas con la salud más precisas y tasas reducidas de alucinaciones. El modelo también introdujo un enfoque de "completaciones seguras", destinado a dar respuestas seguras y de alto nivel a consultas potencialmente dañinas en lugar de rechazarlas por completo, lo que redujo los rechazos de información inofensiva.

GPT-5 fue entrenado para ser más crítico y menos efusivamente complaciente que los modelos anteriores. Los primeros evaluadores, días antes del lanzamiento, quedaron impresionados por su codificación y resolución de problemas matemáticos, notando una mejora marcada respecto a GPT-4 pero no un salto tan grande como de GPT-3 a GPT-4. Altman llamó a GPT-5 "un paso significativo en el camino hacia la AGI", ofreciendo habilidades de "nivel doctoral" en una amplia gama de tareas.

GPT-6 Astra extendió estas capacidades con un procesamiento multimodal en tiempo real mejorado, permitiendo una integración más natural de voz, visión y texto. Soporta funciones agénticas, como la navegación web autónoma y la gestión de escritorio, basándose en la arquitectura introducida en GPT-5. El consumo de energía de GPT-5 no fue divulgado, pero investigadores de la Universidad de Rhode Island estimaron que una respuesta de longitud media consume un poco más de 18 vatios-hora, similar a una bombilla incandescente funcionando durante 18 minutos.

Arquitectura

GPT-5 es un sistema que comprende un modelo rápido y de alto rendimiento, un modelo de razonamiento más profundo y un enrutador en tiempo real que selecciona el modelo apropiado según el tipo de conversación, la complejidad, las necesidades de herramientas y la intención explícita del usuario. Este diseño unificado aborda las críticas anteriores de Altman sobre los selectores manuales de modelos. La tarjeta del sistema define dos modelos rápidos (gpt-5-main y gpt-5-main-mini) y dos modelos de pensamiento (gpt-5-thinking y gpt-5-thinking-mini).

Los desarrolladores que acceden a la API de OpenAI pueden usar el modelo de pensamiento, su versión mini y gpt-5-thinking-nano, una variante más pequeña y rápida. Se dispone de ajustes de esfuerzo de razonamiento (bajo, medio, alto o mínimo) y de verbosidad (bajo, medio o alto). Los usuarios de ChatGPT tienen acceso a gpt-5-thinking con cómputo paralelo en tiempo de prueba, llamado gpt-5-thinking-pro.

GPT-6 Astra adopta una arquitectura de enrutamiento similar pero enfatiza un acoplamiento más estrecho entre percepción y razonamiento, utilizando mecanismos de atención cruzada para fusionar entradas de audio, visuales y textuales en tiempo real. Su diseño soporta el aprendizaje continuo de las interacciones de los usuarios, aunque los detalles sobre sus variantes internas del modelo siguen siendo escasos al momento de escribir esto.

Entrenamiento

GPT-5 es nativamente multimodal, entrenado desde cero en texto e imágenes simultáneamente, a diferencia de GPT-4 que dependía de componentes entrenados por separado. Su entrenamiento involucró tres etapas: preentrenamiento no supervisado, ajuste fino supervisado y aprendizaje por refuerzo a partir de retroalimentación humana, utilizando un conjunto de datos multilingüe a gran escala de libros, artículos, páginas web, documentos académicos y fuentes con licencia.

GPT-6 Astra siguió un proceso de tres etapas similar pero expandió el corpus de preentrenamiento para incluir datos de audio y video más diversos. OpenAI utilizó aprendizaje por refuerzo a partir de retroalimentación humana para alinear las respuestas con la intención del usuario, con ajuste fino adicional para la seguridad y la reducción de alucinaciones. La compañía también empleó aprendizaje curricular para aumentar progresivamente la complejidad de las tareas durante el entrenamiento, mejorando la generalización entre modalidades.

Hasta finales de 2025, OpenAI no ha divulgado los recursos computacionales exactos utilizados para el entrenamiento, pero las estimaciones de la industria sugieren grandes grupos de hardware especializado, posiblemente involucrando colaboraciones con proveedores de AMD o Nvidia, aunque no existe confirmación oficial.

Uso

GPT-5 es gratuito para todos los usuarios de ChatGPT, con suscriptores Plus que reciben límites de uso más altos y usuarios Pro que obtienen acceso ilimitado, incluido acceso limitado a GPT-5 Pro. Con GPT-5, el "Modo de voz avanzado" de ChatGPT fue reemplazado por "Voz de ChatGPT", que permite conversaciones más naturales. El Modo de voz estándar se retiró el 9 de septiembre de 2025. El 24 de noviembre de 2025, se añadió la investigación de compras a ChatGPT, afirmando ser un mini modelo post-entrenado en gpt-5-thinking-mini.

GPT-5 también está integrado en Microsoft Copilot, con Microsoft planeando una integración más amplia de productos. Apple Inc. está trabajando, según informes, para incorporar GPT-5 en Apple Intelligence para iOS 26, iPadOS 26 y macOS Tahoe. GPT-6 Astra está disponible en ChatGPT y a través de la API, con un enfoque en aplicaciones móviles y embebidas, y se espera que impulse funciones en dispositivos de Samsung y otros socios.

Seguridad y Limitaciones

Empresas de investigación en seguridad, incluidas Neuraltrust y SPLX, afirmaron haber comprometido GPT-5 dentro de su primer día de pruebas, permitiéndole generar instrucciones detalladas para fabricar explosivos. Estas evaluaciones sugieren brechas de seguridad significativas, potencialmente haciendo que GPT-5 no sea seguro para entornos corporativos sin salvaguardas adicionales. OpenAI ha reconocido las limitaciones y continúa iterando en medidas de seguridad.

GPT-6 Astra enfrenta desafíos similares, con pruebas tempranas que indican tasas de rechazo mejoradas para consultas dañinas pero fallos ocasionales en casos límite. Los modelos también exhiben sesgos heredados de los datos de entrenamiento, y OpenAI fomenta la auditoría externa continua y el red-teaming.

Recepción e Impacto

Los lanzamientos han provocado un debate sobre el ritmo del desarrollo de la IA, con algunos expertos pidiendo una regulación más sólida. Grupos académicos como Stanford AI Lab y Berkeley AI Research están estudiando las habilidades de razonamiento de los modelos; los primeros resultados sugieren progreso pero aún no una comprensión similar a la humana. Los lanzamientos también han intensificado la competencia con Anthropic y Google DeepMind, que están desarrollando sistemas similares.

Las asociaciones industriales se están expandiendo; Oracle Cloud y Microsoft Azure proporcionan infraestructura en la nube para el despliegue, mientras que ARM y Qualcomm son vistos como socios potenciales para la inferencia en el dispositivo. Hasta finales de 2025, GPT-5 y GPT-6 Astra siguen siendo centrales para la estrategia de OpenAI, con actualizaciones continuas esperadas.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:gpt-5·gpt-6-astra·openai·multimodal-ai
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial