Sortie d’OpenAI GPT-4

Traduit de l'anglais

GPT-4 est un grand modèle de langage multimodal publié par OpenAI le 14 mars 2023, capable de traiter du texte et des images. Il a amélioré ses prédécesseurs en matière de raisonnement, de codage et de tests standardisés, bien qu'OpenAI ait retenu les détails techniques.

GPT-4 est un grand modèle de langage développé par OpenAI, publié le 14 mars 2023, comme quatrième modèle de sa série de modèles de fondation GPT. Il s'agit d'un modèle multimodal, acceptant à la fois du texte et des images en entrée, et il est reconnu pour ses performances solides sur divers benchmarks, notamment les tests standardisés et les tâches de codage. OpenAI n'a pas divulgué de détails techniques tels que la taille du modèle, l'architecture ou le matériel d'entraînement, invoquant des préoccupations concurrentielles et de sécurité. GPT-4 est précédé par GPT-3.5 et suivi par GPT-5 ; une version nommée GPT-4V gère les entrées d'images, et le modèle ultérieur GPT-4o (mai 2024) étend le traitement à l'audio et à la vidéo en temps réel. GPT-4 a été intégré à Bing Chat de Microsoft en février 2023, publié dans ChatGPT en mars 2023, et retiré de ChatGPT en 2025, bien qu'il reste disponible via l'API d'OpenAI.

Contexte et Développement

OpenAI a introduit le premier modèle GPT en 2018, basé sur l'architecture de transformeur, entraîné sur des corpus de livres pour la compréhension du langage. GPT-2 (2019) était un modèle plus grand capable de générer du texte cohérent, et GPT-3 (2020) a multiplié les paramètres par plus de 100 par rapport à GPT-2. GPT-3.5 a alimenté le chatbot ChatGPT lancé fin 2022. GPT-4 a été construit sur cette lignée, intégrant des améliorations en apprentissage multimodal, en apprentissage par renforcement et en alignement de sécurité. Une version précoce a été testée dans Bing Chat à partir de février 2023, offrant aux utilisateurs de Microsoft un accès anticipé avant la publication publique.

Capacités et Fonctionnalités

Le modèle GPT-4 par défaut avait une fenêtre de contexte de 8K tokens, avec une version API spéciale prenant en charge jusqu'à 32K tokens. Contrairement à ses prédécesseurs, il pouvait traiter des images, permettant aux utilisateurs de télécharger des photos pour analyse ou questions. Le modèle pouvait être invité à interagir avec des outils externes, tels que des recherches web utilisant des balises <search>, lui permettant de récupérer des informations en temps réel et d'effectuer des tâches au-delà de la prédiction de texte, y compris des appels API et la génération d'images. En novembre 2023, OpenAI a annoncé GPT-4 Turbo et GPT-4 Turbo avec Vision, offrant une fenêtre de contexte de 128K à moindre coût.

Performances sur les Tests Standardisés

GPT-4 a démontré une grande aptitude sur divers examens. Dans les Tests de Pensée Créative de Torrance, il a obtenu un score dans le top 1% pour l'originalité et la fluidité, avec des scores de flexibilité allant du 93e au 99e percentile. Des chercheurs de Microsoft ont constaté que GPT-4 dépassait le score de réussite à l'USMLE de plus de 20 points, surpassant GPT-3.5 et des modèles médicaux spécialisés comme Med-PaLM, sans aucun ingénierie de prompt. Cependant, la même étude a averti de risques significatifs dans les applications médicales en raison d'inexactitudes potentielles et d'hallucinations.

Applications et Impact

Un article de Nature de 2023 a souligné l'utilité de GPT-4 dans le codage, comme le débogage et l'optimisation. Un biophysicien a rapporté que le portage d'un programme MATLAB en Python prenait des heures au lieu de jours. Dans les tests de sécurité, GPT-4 a généré du code vulnérable aux injections SQL 5% du temps, contre 40% pour GitHub Copilot en 2021. Dans le secteur de la santé, Microsoft et Epic Systems ont annoncé en avril 2023 des plans pour utiliser GPT-4 pour les réponses aux requêtes des patients et l'analyse des dossiers médicaux, bien que la prudence ait été conseillée.

Limites et Risques

GPT-4 est connu pour halluciner, produisant des sorties non fondées sur les données d'entraînement ou contredisant les invites de l'utilisateur. Sa prise de décision est opaque ; les explications sont générées après coup et peuvent entrer en conflit avec des déclarations antérieures. En 2023, le benchmark ConceptARC a montré que GPT-4 obtenait un score inférieur à 33% sur des tâches de raisonnement abstrait, tandis que des modèles spécialisés et des humains obtenaient des scores plus élevés, bien que des sceptiques aient noté que la nature visuelle du test pourrait désavantager un modèle de langage.

Biais et Alignement

L'entraînement de GPT-4 a impliqué deux étapes : un apprentissage non supervisé initial sur du texte internet, suivi d'un apprentissage par renforcement à partir de retours humains pour réduire les sorties nuisibles. Des chercheurs de Microsoft ont suggéré qu'il pourrait présenter des biais cognitifs comme le biais de confirmation, l'ancrage et la négligence des taux de base, soulevant des préoccupations sur l'équité dans le déploiement.

Entraînement et Secret Technique

Le rapport technique d'OpenAI pour GPT-4 a omis la taille du modèle, l'architecture, le matériel, la construction de l'ensemble de données d'entraînement, la puissance de calcul et les hyperparamètres comme le taux d'apprentissage ou les optimiseurs. L'entreprise a cité le « paysage concurrentiel et les implications de sécurité » comme raisons. Le PDG Sam Altman a déclaré que le coût d'entraînement dépassait 100 millions de dollars, avec des rapports de Semafor indiquant des chiffres plus élevés, bien que les chiffres exacts restent non vérifiés.

Successeurs et Évolution

GPT-4o, introduit le 13 mai 2024, traite le texte, l'audio et les images en temps réel avec des temps de réponse semblables à ceux des humains. Il a amélioré les performances en langues non anglaises et a été rendu disponible aux utilisateurs du niveau gratuit, contrairement à GPT-4. GPT-4V, lancé plus tôt, a spécifiquement ajouté l'entrée d'images à GPT-4. L'héritage du modèle inclut l'avancement de l'IA multimodale et le déclenchement de débats sur la transparence et la sécurité dans les grands modèles de langage.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:artificial-intelligence·large-language-model·openai·event
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique