GPT-5 et lancement d’Astra

Traduit de l'anglais

GPT-5, le modèle de langage multimodal d'OpenAI, lancé le 7 août 2025, fait progresser l'IA en temps réel avec des modèles rapides et de raisonnement. Astra de Google (Gemini Live) a également été lancé en 2025, concurrençant dans le domaine de l'IA multimodale.

GPT-5 est un modèle de langage multimodal de grande taille développé par OpenAI et le cinquième de sa série de modèles de fondation génératifs pré-entraînés par transformeur (GPT). Précédé dans la série par GPT-4, il a été lancé le 7 août 2025. Il est accessible au public via les produits de chatbot ChatGPT et Microsoft Copilot, ainsi qu'aux développeurs via l'API OpenAI. Ce lancement a marqué une étape importante dans l'évolution de l'IA générative, avec un accent sur la compréhension multimodale en temps réel et les capacités agentiques.

La même année, Google DeepMind a lancé Astra, également connu sous le nom de Gemini Live, un assistant IA multimodal en temps réel qui concurrence directement GPT-5 sur les marchés grand public et entreprise. Le lancement d'Astra, survenu en 2025, a mis l'accent sur une interaction fluide avec les entrées visuelles et auditives, le positionnant comme un rival clé de l'offre d'OpenAI. Cet article se concentre principalement sur GPT-5, avec des références à Astra lorsque cela est pertinent pour le paysage plus large.

Contexte

Le 14 avril 2023, Sam Altman, le directeur général d'OpenAI, a pris la parole lors d'un événement au Massachusetts Institute of Technology et a déclaré que l'entreprise ne formait pas GPT-5 à ce moment-là. Il a affirmé qu'OpenAI « priorisait le développement de GPT-4 » et que « nous ne publierons pas GPT-5, et pas avant un certain temps ». Le 18 juillet, OpenAI a déposé une demande de marque pour « GPT-5 » aux États-Unis. Le 13 novembre, Altman a confirmé au Financial Times que l'entreprise travaillait au développement de GPT-5.

Selon The Information, « pendant une grande partie de la seconde moitié de 2024, OpenAI développait un modèle connu en interne sous le nom d'Orion et destiné à devenir GPT-5 », « mais l'effort Orion n'a pas réussi à produire un meilleur modèle, et l'entreprise l'a plutôt publié sous le nom de GPT-4.5 en février [2025] ». Fin juillet 2025, il était largement anticipé qu'OpenAI prévoyait de publier GPT-5 début août. Le 30 juillet, The Verge a rapporté que « Microsoft se prépare pour GPT-5 » alors que « des sources familières avec les plans IA de Microsoft » ont informé un éditeur que l'entreprise testait un nouveau mode pour son chatbot Copilot qui offrirait un modèle qui « réfléchit profondément ou rapidement selon la tâche ». Le 5 août, dans la perspective de la sortie de GPT-5, OpenAI a publié GPT-OSS, un ensemble de deux modèles à poids ouverts dotés de capacités de raisonnement. GPT-5 a ensuite été dévoilé lors d'un événement en direct le 7 août.

Capacités

Au moment de sa sortie, GPT-5 avait des performances de pointe sur les benchmarks testant les mathématiques, la programmation, la finance et la compréhension multimodale. Selon OpenAI, les améliorations par rapport à ses modèles prédécesseurs incluent des temps de réponse plus rapides, de meilleures compétences en codage et en écriture, des réponses plus précises aux questions de santé et des niveaux d'hallucination plus faibles. De plus, par rapport aux modèles précédents, GPT-5 vise à fournir des réponses sûres et de haut niveau aux requêtes potentiellement nuisibles plutôt que de les refuser catégoriquement, une approche qu'OpenAI appelle « complétions sûres », visant à « permettre à GPT-5 de refuser plus de questions dangereuses, tout en offrant moins de rejets aux utilisateurs cherchant des informations inoffensives ». En outre, GPT-5 a été formé pour donner des réponses plus critiques et « moins effusivement agréables » par rapport à ses modèles prédécesseurs.

Quelques jours avant le lancement de GPT-5, deux testeurs précoces du modèle ont déclaré être « impressionnés » par sa capacité à coder et à résoudre des problèmes mathématiques et scientifiques. Ils ont suggéré que le modèle montre une grande amélioration par rapport à GPT-4, mais pas un gain aussi important que celui de GPT-3 à GPT-4. Un jour avant la sortie de GPT-5, lors d'un briefing de presse, Sam Altman, le directeur général d'OpenAI, a qualifié GPT-5 de « étape significative sur le chemin de l'AGI », faisant référence à l'intelligence artificielle générale, le niveau hypothétique d'intelligence qu'OpenAI définit comme la capacité à effectuer toute tâche économiquement précieuse qu'un humain peut accomplir. Selon Altman, GPT-5 est « significativement meilleur » que ses prédécesseurs, offrant des capacités de « niveau doctorat » dans un large éventail de tâches.

La consommation énergétique exacte de l'utilisation de GPT-5 n'a pas été divulguée par OpenAI. Des chercheurs de l'Université de Rhode Island ont estimé qu'une réponse de longueur moyenne consomme un peu plus de 18 wattheures, équivalent à l'utilisation d'une ampoule à incandescence pendant 18 minutes.

Architecture

GPT-5 est un système qui contient un modèle rapide à haut débit, un modèle de raisonnement plus profond et un routeur en temps réel qui décide quel modèle utiliser en fonction du type de conversation, de la complexité, des besoins en outils et de l'intention explicite de l'utilisateur. Altman avait précédemment critiqué le sélecteur de modèle manuel pour être trop complexe, suggérant un besoin d'unification. GPT-5 inclut également des fonctionnalités agentiques grâce auxquelles il peut configurer son propre bureau et utiliser son navigateur pour rechercher de manière autonome des sources liées à sa tâche. La carte système de GPT-5 définit deux modèles rapides à haut débit - gpt-5-main et gpt-5-main-mini - et deux modèles de réflexion - gpt-5-thinking et gpt-5-thinking-mini. Dans l'API OpenAI, les développeurs peuvent accéder au modèle de réflexion, à sa version mini et à gpt-5-thinking-nano, une version nano encore plus petite et plus rapide du modèle de réflexion. La version de GPT-5 accessible via l'API a un effort de raisonnement réglable (faible, moyen, élevé ou minimal) et une verbosité (faible, moyenne ou élevée). De plus, ChatGPT donne accès à gpt-5-thinking avec un paramètre qui utilise le calcul parallèle au moment du test, appelé gpt-5-thinking-pro.

Sécurité et limites

Neuraltrust, une entreprise de recherche en sécurité, a affirmé avoir réussi à compromettre GPT-5 dès le premier jour de test du modèle. Selon son rapport, elle a permis à GPT-5 de générer des instructions détaillées pour fabriquer des dispositifs explosifs. SPLX, une autre entreprise, a mené des tests similaires et est arrivée à des conclusions similaires sur la sécurité de GPT-5. Leurs évaluations suggèrent que GPT-5 présente des lacunes de sécurité importantes, le rendant potentiellement dangereux pour une utilisation en environnement d'entreprise.

Malgré ces préoccupations, OpenAI a mis l'accent sur ses mesures de sécurité, notamment l'approche des « complétions sûres » et des techniques d'alignement telles que le apprentissage par renforcement à partir de retours humains. Cependant, les vulnérabilités de sécurité signalées par des chercheurs externes indiquent des défis persistants pour garantir une sécurité robuste des systèmes d'IA avancés.

Formation

Selon AIMultiple, GPT-5 est nativement multimodal, ce qui signifie qu'il a été formé à partir de zéro sur plusieurs modalités (comme le texte et les images) en même temps, sans s'appuyer sur des modèles de langage ou de vision déjà entraînés. Son processus de formation a impliqué trois étapes : pré-entraînement non supervisé, ajustement fin supervisé et apprentissage par renforcement à partir de retours humains. Le pré-entraînement a utilisé un ensemble de données multilingue à grande échelle comprenant des livres, des articles, des pages web, des articles académiques et des sources sous licence. Les capacités visuelles et textuelles de GPT-5 ont été décrites comme ayant été développées en parallèle tout au long de la formation, contrairement à GPT-4.

Le processus de formation a tiré parti des avancées dans les architectures de transformeurs et les techniques de modèles de langage de grande taille, y compris l'attention multi-têtes et l'encodage positionnel. L'utilisation de l'augmentation de données et de l'élagage de modèles a également contribué à l'efficacité et aux performances du modèle.

Utilisation et intégration

GPT-5 est utilisé dans ChatGPT. Bien que GPT-5 soit gratuit pour tous les utilisateurs de ChatGPT, les utilisateurs Plus bénéficient de limites d'utilisation plus élevées, tandis que les utilisateurs Pro ont un accès illimité à GPT-5 ainsi qu'un accès limité à GPT-5 Pro. Des limites standard pour les utilisateurs de niveaux inférieurs sur les réponses par heure s'appliquent toujours. De plus, avec l'introduction de GPT-5, le « Mode vocal avancé » de ChatGPT a été remplacé par « ChatGPT Voice », censé permettre des conversations plus naturelles. OpenAI a déclaré que « le Mode vocal standard prendra sa retraite le 9 septembre 2025, unifiant tous les utilisateurs sur ChatGPT Voice ». Le 24 novembre 2025, la fonctionnalité de recherche d'achats a été ajoutée à ChatGPT, prétendument un mini modèle post-entraîné sur gpt-5-thinking-mini.

GPT-5 est également disponible dans Microsoft Copilot, et Microsoft a déclaré qu'il intégrerait GPT-5 dans une large gamme de ses produits. Selon 9to5Mac, Apple Inc. prévoit d'intégrer le modèle dans la fonctionnalité Apple Intelligence de ses systèmes d'exploitation iOS 26, iPadOS 26 et macOS Tahoe. Il est également accessible via l'API OpenAI, permettant aux développeurs de créer des applications basées sur le modèle.

En comparaison, Astra de Google (Gemini Live) est intégré à l'écosystème de Google, y compris Android et Google Assistant, et offre des capacités multimodales en temps réel similaires. La concurrence entre OpenAI et Google DeepMind a accéléré l'innovation dans le domaine, les deux entreprises repoussant les limites de ce que les assistants IA peuvent faire.

Impact et réception

Le lancement de GPT-5 a eu un impact significatif sur l'industrie de l'IA. Ses performances de pointe sur les benchmarks ont établi de nouvelles normes pour les systèmes d'intelligence artificielle. La capacité du modèle à gérer des tâches complexes dans plusieurs domaines a été saluée par les testeurs précoces, bien que certains aient noté que l'amélioration par rapport à GPT-4 n'est pas aussi spectaculaire que le saut de GPT-3 à GPT-4.

Les critiques ont soulevé des préoccupations concernant la sécurité de GPT-5, en particulier à la lumière des vulnérabilités signalées par Neuraltrust et SPLX. Ces problèmes soulignent la nécessité de poursuivre la recherche sur la sécurité et l'alignement de l'IA, un domaine qui implique des experts comme Joshua Tenenbaum et Melanie Mitchell.

Malgré ces défis, GPT-5 devrait stimuler une adoption généralisée de l'IA dans divers secteurs, notamment l'éducation, la santé et le développement de logiciels. Son intégration dans des produits comme Microsoft Copilot et Apple Intelligence suggère qu'il deviendra un outil omniprésent pour les consommateurs et les entreprises.

Conclusion

GPT-5 représente une étape majeure dans le développement de l'IA générative et des modèles de langage de grande taille. Son lancement le 7 août 2025, aux côtés d'Astra de Google, marque une nouvelle ère d'assistants IA multimodaux en temps réel. Bien que des défis subsistent en matière de sécurité et de consommation énergétique, les capacités de GPT-5 démontrent les progrès rapides réalisés dans le domaine. Alors que l'IA continue d'évoluer, des modèles comme GPT-5 joueront probablement un rôle central dans la formation de l'avenir de la technologie et de la société.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:artificial-intelligence·large-language-model·openai·google-deepmind
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique