, que 55 000 prompts révèlent sur l'utilisation de l'IA
Un aperçu de ce que vous pouvez apprendre en analysant le jeu de données public de Wikiprompt : quels modèles dominent, comment les prompts d'image, de vidéo et de texte diffèrent, et comment exécuter votre propre analyse sur le corpus.

Ce que 55 000 Prompts Révèlent sur la Façon dont les Gens Utilisent l'IA
Chaque prompt sur Wikiprompt a commencé comme une demande réelle faite à un modèle réel, puis a été jugé digne d'être partagé. Multipliez cela par plus de 55 000 et vous cessez d'avoir une liste d'exemples pour commencer à avoir un corpus : un recensement approximatif de la façon dont les gens parlent réellement à l'IA lorsqu'ils en attendent quelque chose de spécifique. Nous avons construit le jeu de données pour que chacun puisse extraire ce corpus entier et chercher les tendances par lui-même, au lieu de se fier à notre résumé.
Ce post est ce résumé, mais présenté comme une invitation. Tout ce qui suit est une hypothèse de départ, pas une conclusion que nous vous demandons de prendre pour argent comptant. Les données se trouvent sur /dataset/prompts, elles sont gratuites, et il faut environ dix lignes de code pour les récupérer.
Ce qu'il y a réellement dans un enregistrement
Chaque entrée du dump contient slug, url, title, description, content (le texte du prompt lui-même), category, tags, media, model, un objet metadata avec des champs structurés comme le ratio d'aspect et le style, author, original_source, et les deux horodatages. Cela suffit pour mener trois types d'analyse différents sans toucher au site en direct : analyse textuelle sur content et title, analyse catégorielle sur category/tags/model/metadata, et analyse de séries temporelles sur created_at si vous voulez voir comment la formulation ou le choix du modèle a évolué au fil de la vie du catalogue.
Le paysage des modèles
Regroupez les enregistrements par le champ model et vous obtenez quelque chose qui ressemble à un classement de ce que les gens utilisent réellement, pas de ce qui est le plus récent ou le plus médiatisé. Les générateurs d'images et de vidéos (Midjourney, GPT Image, Seedance, Veo, Kling, Nano Banana) côtoient les modèles de texte et de raisonnement (Claude, GPT, Gemini, Grok) dans le même tableau, car Wikiprompt ne sépare pas les "prompts de chat" des "prompts d'image" comme des produits différents. Cela vaut la peine d'être exploré en soi : un modèle donné attire-t-il un éventail de catégories plus étroit ou plus large ? Certains modèles se regroupent-ils autour de certains styles dans metadata ? Les champs metadata.model et metadata.style existent précisément pour que vous n'ayez pas à utiliser une expression régulière sur le texte du prompt pour répondre à cela.
Image, vidéo et texte ne sont pas répartis de manière égale
metadata.media_type étiquette chaque enregistrement comme image, vidéo ou texte, et le ratio entre les trois est en soi un signal sur où se passe l'ingénierie de prompts intéressante en ce moment. Les prompts de texte (prompts système, personas, modèles structurés) ont tendance à être plus longs et plus structurés. Les prompts d'image s'appuient sur un vocabulaire visuel dense condensé en une ou deux phrases. Les prompts vidéo, la tranche la plus récente et la plus petite, ressemblent davantage à des listes de plans, avec mouvement de caméra, durée et rythme explicitement détaillés. Si vous essayez de comprendre comment le "prompting" en tant que compétence diffère selon les modalités, filtrer le dump par media_type avant toute autre chose vous évitera de faire la moyenne de trois disciplines différentes.
Catégories et styles, avec des exemples concrets
Le catalogue regroupe tout en neuf catégories (créatif, marketing, personnel, productivité, codage, éducation, affaires, recherche, autre), et la catégorie créative est un bon endroit pour voir le vocabulaire de style en action. Prenez une affiche éditoriale minimaliste en noir et blanc sur le tabagisme : le prompt fait beaucoup de travail avec la retenue, l'espace négatif et une tradition photographique nommée plutôt qu'en accumulant des adjectifs. Comparez cela à un portrait souverain de créature préhistorique, qui s'appuie sur un langage de fusion de genres (régale, mythique, souverain) pour forcer un ton spécifique du modèle, ou à un portrait fantastique pastel d'une jeune femme, qui est presque entièrement une description de couleur et d'éclairage. Trois prompts, trois stratégies complètement différentes pour obtenir de la spécificité d'un modèle d'image, et les trois se trouvent dans le même compartiment category: creative. Les tags et metadata.style sont les champs qui vous permettent de diviser "créatif" en quelque chose de plus granulaire que ce que la catégorie de premier niveau montrerait seule.
Tendances de formulation qui valent la peine d'être recherchées
Quelques éléments méritent d'être testés sur le corpus entier plutôt que de se fier à des anecdotes : certaines constructions d'ouverture (verbes impératifs, "tu es un...", clauses de mise en scène) corrèlent-elles avec les scores quality/assessment dans les métadonnées ; les prompts ciblant un modèle nommé spécifique utilisent-ils un vocabulaire différent de ceux qui sont indépendants du modèle ; la co-occurrence des tags révèle-t-elle des catégories qui se comportent comme des semblables même si elles sont étiquetées différemment (les prompts marketing et affaires, par exemple, tendent à partager beaucoup de tags). Rien de tout cela ne nécessite plus sophistiqué que de compter des n-grammes et de regrouper par champ. C'est le genre de jeu de données où un après-midi tranquille avec pandas ou une feuille de calcul fait ressortir quelque chose de réel.
Le récupérer vous-même
Le manifeste sur le jeu de données vous indique le nombre total, la forme des enregistrements et comment fonctionne la pagination avant que vous ne récupériez un seul enregistrement. Les données réelles sont paginées par clé, jusqu'à 500 enregistrements par page :
curl "https://www.wikiprompt.org/dataset/prompts?limit=500"
Chaque réponse inclut une URL next ; suivez-la jusqu'à ce que next revienne null. Une boucle minimale ressemble à ceci :
import requests
url = "https://www.wikiprompt.org/dataset/prompts?limit=500"
records = []
while url:
res = requests.get(url).json()
records.extend(res["records"])
url = res.get("next")
print(len(records), "prompts récupérés")
Pas de clé API, CORS activé, et le tout se trouve derrière un cache périphérique, donc une extraction complète est rapide et ne pèse pas sur nos serveurs. Si vous préférez interroger plutôt que télécharger en masse, l'API de recherche couvre les recherches ponctuelles, et llms.txt documente tout ce qui est lisible par machine en un seul endroit.
Attribution, et ce que nous aimerions voir
Chaque enregistrement remonte à un auteur réel via original_source, donc toute analyse, graphique ou article qui découle de ces données devrait créditer à la fois wikiprompt.org et les créateurs originaux qu'il agrège. Nous ne détenons pas de licence formelle sur les prompts sous-jacents ; nous sommes le catalogue, pas le détenteur des droits d'auteur, et le jeu de données est offert sur cette base : libre à explorer, veuillez attribuer.
Si vous exécutez quelque chose d'intéressant sur le corpus, d'un graphique d'adoption des modèles à une taxonomie de styles en passant par une étude sur la corrélation entre la longueur des prompts et les scores de qualité, nous voulons le voir. Cinquante-cinq mille prompts, c'est assez de signal pour dire quelque chose de réel sur la façon dont les gens utilisent réellement l'IA en ce moment, et la réponse honnête est que nous n'avons pas non plus exécuté toutes les analyses nous-mêmes.
Related Articles
- Laya vs. Jev: Die Open-Source-Antwort auf die Entscheidungsmodell-Welle
Sep 22, 2026 · 5 min read
- Laya contre Jev : La réponse open-source à la vague des modèles de décision
Sep 22, 2026 · 5 min read
- Laya vs Jev: La respuesta de código abierto a la ola de modelos de decisión
Sep 22, 2026 · 5 min read
- Laya vs Jev: 오픈소스로 답하는 의사결정 모델 물결
Sep 22, 2026 · 5 min read
- लाया बनाम जेव: निर्णय-मॉडल लहर का ओपन-सोर्स उत्तर
Sep 22, 2026 · 5 min read