GPT-4 Turbo est un grand modèle de langage développé par OpenAI, annoncé en novembre 2023 comme une version améliorée du modèle GPT-4 précédent. Ses améliorations les plus notables incluent une fenêtre de contexte de 128 000 jetons, permettant au modèle de traiter des entrées nettement plus longues, et une structure de tarification API plus basse. La sortie a également introduit GPT-4 Turbo avec Vision, une variante capable de traiter à la fois du texte et des images. GPT-4 Turbo a été succédé par GPT-4o en mai 2024, qui offrait un traitement multimodal en temps réel et un accès gratuit aux utilisateurs de ChatGPT.
Contexte
OpenAI a introduit le premier modèle GPT en 2018, basé sur l'architecture transformateur et entraîné sur un vaste corpus de livres. Les itérations suivantes, GPT-2 en 2019 et GPT-3 en 2020, ont augmenté les paramètres et amélioré la génération de texte. GPT-3.5 a alimenté la sortie initiale de ChatGPT en novembre 2022, ce qui a porté les grands modèles de langage à l'attention du grand public. GPT-4, publié en mars 2023, a ajouté des capacités multimodales, acceptant à la fois des entrées de texte et d'images. La version par défaut avait une fenêtre de contexte de 8 000 jetons, avec une variante API spéciale prenant en charge jusqu'à 32 000 jetons. GPT-4 Turbo a été développé pour remédier aux limitations de longueur de contexte et de coût, en s'appuyant sur les fondations de son prédécesseur.
Annonce et sortie
OpenAI a annoncé GPT-4 Turbo le 6 novembre 2023, lors de sa première conférence de développeurs, DevDay, tenue à San Francisco. Le modèle a été rendu disponible via l'API OpenAI, avec un prix fixé à 0,01 $ pour 1 000 jetons d'entrée et 0,03 $ pour 1 000 jetons de sortie, environ trois fois moins cher que GPT-4. La fenêtre de contexte de 128 000 jetons permettait de traiter des documents dépassant 300 pages de texte en une seule requête. OpenAI a également introduit une version mise à jour de GPT-4 Turbo avec Vision, capable d'analyser des images en plus du texte. L'annonce a mis en évidence des améliorations dans le suivi des instructions, le mode JSON et l'appel de fonctions, rendant le modèle plus adapté aux applications de développeurs.
Capacités
GPT-4 Turbo a conservé les capacités d'entrée multimodales de GPT-4, permettant aux utilisateurs de fournir à la fois du texte et des images. Il pouvait interagir avec des outils externes via l'appel de fonctions, permettant des tâches telles que des recherches web, des appels API et la génération d'images. La fenêtre de contexte élargie permettait au modèle de maintenir une cohérence sur des conversations plus longues et de traiter des livres entiers ou des bases de code. Dans un article de 2023 dans Nature, des programmeurs ont rapporté que GPT-4 Turbo assistait dans des tâches de codage, comme l'identification d'erreurs et la suggestion d'optimisations, bien qu'il fût sujet à des erreurs. Lors d'un test de 89 scénarios de sécurité, GPT-4 a produit du code vulnérable aux attaques par injection SQL dans 5 % des cas, une amélioration par rapport à GitHub Copilot de 2021, qui avait un taux de vulnérabilité de 40 %.
Performance aux tests standardisés
Les études sur la performance de GPT-4 Turbo aux tests standardisés étaient limitées, mais des évaluations antérieures de GPT-4 ont montré des résultats solides. Dans les tests de pensée créative de Torrance, GPT-4 a obtenu des scores dans le top 1 % pour l'originalité et la fluidité, avec des scores de flexibilité allant du 93e au 99e percentile. Les chercheurs ont averti que faire passer des chatbots à travers de tels tests pourrait ne pas être fiable, car les modèles peuvent générer des réponses plausibles mais incorrectes.
Applications médicales
Des chercheurs de Microsoft ont testé GPT-4 sur des problèmes médicaux et ont constaté qu'il dépassait le score de réussite à l'examen de licence médicale des États-Unis de plus de 20 points, surpassant des modèles antérieurs comme GPT-3.5 et des modèles spécialisés tels que Med-PaLM. Cependant, ils ont averti de risques significatifs, notamment des recommandations inexactes et des hallucinations d'erreurs factuelles majeures. En avril 2023, Microsoft et Epic Systems ont annoncé des plans pour fournir aux prestataires de soins de santé des systèmes alimentés par GPT-4 pour répondre aux questions des patients et analyser les dossiers médicaux, une tendance qui s'est poursuivie avec GPT-4 Turbo.
Limitations
Comme ses prédécesseurs, GPT-4 Turbo pouvait halluciner, produisant des sorties qui contredisent la demande de l'utilisateur ou contiennent des informations fabriquées. Il manquait également de transparence dans la prise de décision ; lorsqu'on lui demandait d'expliquer son raisonnement, le modèle générait des explications post-hoc qui ne pouvaient pas être vérifiées comme reflétant le processus réel. En 2023, des chercheurs ont testé GPT-4 contre le benchmark ConceptARC, conçu pour mesurer le raisonnement abstrait, et ont constaté qu'il obtenait un score inférieur à 33 % dans toutes les catégories, tandis que des modèles spécialisés obtenaient 60 % dans la plupart et que les humains obtenaient au moins 91 %. Sam Bowman, non impliqué dans la recherche, a noté que la nature visuelle du test pourrait désavantager un modèle de langage.
Biais
GPT-4 Turbo a été entraîné en deux étapes : d'abord, sur de grands ensembles de données textuelles internet pour prédire le prochain jeton, puis, en utilisant l'apprentissage par renforcement à partir de retours humains pour s'aligner sur les directives de sécurité. Des chercheurs de Microsoft ont suggéré que GPT-4 présentait des biais cognitifs tels que le biais de confirmation, l'ancrage et la négligence du taux de base. Le processus d'entraînement visait à réduire les sorties nuisibles, mais des biais pouvaient encore émerger.
Entraînement
OpenAI n'a pas divulgué les détails techniques de l'entraînement de GPT-4 Turbo, y compris la taille du modèle, l'architecture ou le matériel. Le rapport technique de GPT-4, qui s'appliquait probablement à Turbo, citait des préoccupations concurrentielles et de sécurité pour ce secret. Sam Altman a déclaré que l'entraînement de GPT-4 avait coûté plus de 100 millions de dollars. L'entraînement utilisait un apprentissage supervisé suivi d'un apprentissage par renforcement avec des retours humains et IA, mais des spécificités telles que les hyperparamètres et la construction des ensembles de données n'ont pas été révélées.
Réception et impact
GPT-4 Turbo a été bien accueilli par les développeurs en raison de son coût plus bas et de sa fenêtre de contexte plus large, ce qui a permis de nouvelles applications telles que l'analyse de documents longs et des flux de travail d'agents complexes. Il a renforcé la position d'OpenAI dans le paysage concurrentiel des grands modèles de langage, face à des rivaux comme Anthropic et Google DeepMind. La sortie a également mis en évidence la tendance vers des modèles d'IA plus efficaces et accessibles, influençant les développements ultérieurs dans le domaine. GPT-4 Turbo est resté disponible dans l'API OpenAI jusqu'à ce qu'il soit finalement remplacé par des modèles plus récents, bien que GPT-4 lui-même ait été retiré de ChatGPT en 2025.