Generative Pre-trained Transformer 4 (GPT-4) est un grand modèle de langage développé par OpenAI et le quatrième de sa série de modèles de fondation GPT. Il a été publié le 14 mars 2023, succédant à GPT-3.5 et précédant GPT-5. GPT-4 est un modèle multimodal, capable de traiter à la fois du texte et des images en entrée, une avancée significative par rapport à ses prédécesseurs. OpenAI n'a pas divulgué publiquement les détails techniques de GPT-4, y compris la taille précise du modèle, son architecture ou le matériel utilisé pour l'entraînement.
GPT-4 a été intégré à Bing Chat de Microsoft en février 2023, avant sa sortie officielle dans ChatGPT le mois suivant. Il a été retiré de ChatGPT en 2025, mais reste accessible via l'API d'OpenAI. Les capacités et les limites du modèle ont fait l'objet de recherches approfondies et de discussions publiques.
Contexte
OpenAI a introduit le premier modèle GPT en 2018, basé sur l'architecture transformer et entraîné sur un vaste corpus de livres. L'année suivante, GPT-2 a démontré la capacité de générer du texte cohérent à plus grande échelle. En 2020, GPT-3 a été publié avec plus de 100 fois plus de paramètres que GPT-2, puis il a été affiné en GPT-3.5, qui alimentait le chatbot ChatGPT. GPT-4 s'est appuyé sur cette lignée, ajoutant le traitement d'entrées multimodales et des performances améliorées sur divers benchmarks.
Capacités
La version par défaut de GPT-4 présentait une fenêtre de contexte de 8K, avec une version spéciale de l'API prenant en charge jusqu'à 32K jetons. Contrairement aux modèles précédents, GPT-4 pouvait accepter des images en entrée, permettant aux utilisateurs de télécharger des photos pour analyse ou de poser des questions sur le contenu visuel. Le modèle pouvait également être invité à interagir avec des interfaces externes, comme effectuer des recherches web en encadrant les requêtes dans des balises spécifiques, ce qui permettait des tâches telles que des appels API, la génération d'images et la synthèse de pages web.
Un article de 2023 dans Nature a souligné l'utilité de GPT-4 pour l'assistance au codage, malgré sa propension aux erreurs. Les programmeurs l'ont trouvé utile pour identifier des bogues et suggérer des optimisations ; un biophysicien a rapporté avoir réduit le temps de portage d'un programme de MATLAB à Python de plusieurs jours à environ une heure. Lors de tests de sécurité, GPT-4 a produit du code vulnérable aux attaques par injection SQL dans 5 % des cas, contre 40 % pour GitHub Copilot en 2021.
En novembre 2023, OpenAI a annoncé GPT-4 Turbo et GPT-4 Turbo avec Vision, avec une fenêtre de contexte de 128K et des prix plus bas.
Aptitude aux tests standardisés
Les études sur les performances de GPT-4 dans les tests standardisés ont produit des résultats mitigés. Dans les tests de pensée créative de Torrance, GPT-4 a obtenu un score dans le top 1 % pour l'originalité et la fluidité, avec des scores de flexibilité allant du 93e au 99e percentile.
Applications médicales
Des chercheurs de Microsoft ont testé GPT-4 sur des problèmes médicaux et ont constaté qu'il dépassait le score de réussite à l'USMLE de plus de 20 points, surpassant GPT-3.5 et des modèles affinés sur des connaissances médicales comme Med-PaLM. Cependant, le rapport a averti de risques significatifs liés à l'utilisation de grands modèles de langage pour des applications médicales, citant des inexactitudes et des hallucinations potentielles. En avril 2023, Microsoft et Epic Systems ont annoncé leur intention de fournir des systèmes propulsés par GPT-4 pour les demandes des patients et l'analyse des dossiers médicaux.
GPT-4o
Le 13 mai 2024, OpenAI a introduit GPT-4o (« o » pour « omni »), un successeur qui traite et génère des modalités texte, audio et image en temps réel. GPT-4o offrait des temps de réponse rapides comparables à une conversation humaine, des performances améliorées sur les langues non anglaises, et était disponible pour les utilisateurs du niveau gratuit, contrairement à GPT-4.
Limites
GPT-4, comme ses prédécesseurs, est connu pour halluciner, produisant des sorties qui incluent des informations absentes de ses données d'entraînement ou contredisant les invites de l'utilisateur. Il manque également de transparence dans la prise de décision ; les explications de son raisonnement sont formées a posteriori et ne peuvent pas être vérifiées comme exactes. Dans de nombreux cas, ces explications contredisent directement des déclarations précédentes.
En 2023, des chercheurs ont testé GPT-4 sur ConceptARC, un benchmark de raisonnement abstrait, et ont constaté qu'il obtenait un score inférieur à 33 % dans toutes les catégories, tandis que des modèles spécialisés obtenaient 60 % dans la plupart et que les humains obtenaient au moins 91 %. Sam Bowman, non impliqué dans la recherche, a noté que les résultats pourraient ne pas indiquer un manque de raisonnement abstrait, car le test est visuel alors que GPT-4 est un modèle de langage.
Biais
GPT-4 a été entraîné en deux étapes : d'abord, sur de grands ensembles de données textuelles d'Internet pour prédire le jeton suivant ; ensuite, en utilisant l'apprentissage par renforcement à partir de retours humains pour affiner le comportement et refuser les invites nuisibles. Des chercheurs de Microsoft ont suggéré que GPT-4 pourrait présenter des biais cognitifs tels que le biais de confirmation, l'ancrage et la négligence du taux de base.
Entraînement
OpenAI n'a pas publié les détails techniques de l'entraînement de GPT-4. Le rapport technique s'est abstenu de préciser la taille du modèle, l'architecture ou le matériel, citant des implications concurrentielles et de sécurité. Il a décrit une combinaison d'apprentissage supervisé et d'apprentissage par renforcement avec des retours humains et d'IA, mais a omis les détails sur la construction des ensembles de données, la puissance de calcul et les hyperparamètres. Sam Altman a déclaré que le coût de l'entraînement dépassait 100 millions de dollars.