Le plus grand jeu de données ouvert de prompts d'images et de vidéos IA
Le jeu de données public de Wikiprompt couvre plus de 55 000 prompts d'images, de vidéos et de texte pour GPT Image, Midjourney, Seedance, Veo, Kling, ChatGPT, et plus encore, chacun étant fourni avec son média de résultat réel et ses métadonnées structurées.

Le Plus Grand Jeu de Données Ouvert de Prompts d'IA pour Images et Vidéos
La plupart des collections de prompts que vous trouvez en ligne couvrent un seul modèle, un seul type de média, et vous offrent une page à parcourir manuellement. Une galerie de prompts Midjourney par-ci, un gist de prompts système ChatGPT par-là, un cours payant regroupant "50 prompts Veo" derrière une page de paiement. Aucune d'elles ne vous permet réellement de travailler avec les données.
Wikiprompt est différent d'une manière facile à énoncer et qui mérite d'être explicitée : c'est un catalogue ouvert et unique de plus de 55 000 prompts couvrant la génération d'images, la génération vidéo et le texte, incluant les modèles que les gens utilisent réellement en ce moment - GPT Image, Midjourney, Seedance, Veo, Kling, Nano Banana, ChatGPT, Claude, Grok, et plus encore - et, depuis ce mois-ci, tout cela est téléchargeable sous forme d'un jeu de données JSON simple. Pas de connexion, pas de clé API, pas de silo par modèle. Un seul flux.
La largeur est le point clé
La plupart des sites de "bibliothèque de prompts" choisissent une voie. Une galerie uniquement Midjourney ne peut pas vous dire en quoi un prompt Kling pour le même concept diffère, et un dépôt de prompts texte pour ChatGPT n'a rien à dire sur le ratio d'aspect ou les balises de style. Le catalogue de Wikipédia est organisé de sorte que les prompts image, vidéo et texte vivent dans le même schéma, consultables via la même catégorie prompts créatifs et recherchables via la même API de recherche.
Concrètement, cela signifie que vous pouvez extraire :
Cette largeur est la thèse entière. Si vous évaluez des ressources de prompts pour construire un outil, entraîner un classificateur, ou simplement comprendre à quoi ressemble un bon prompting à travers les modalités, une liste à modèle unique vous force à aller collecter le reste vous-même. Le jeu de données de Wikipédia l'a déjà en un seul endroit.
Chaque prompt est livré avec son résultat, pas seulement son texte
L'autre lacune dans les collections de prompts éparpillées est que le prompt est généralement tout ce que vous obtenez. Vous voyez le texte, peut-être une capture d'écran collée dans un tweet, et vous êtes seul pour juger s'il fonctionne réellement.
Chaque enregistrement dans le jeu de données de Wikipédia porte le texte du prompt ainsi que le média réel qu'il a produit, plus des métadonnées structurées : le modèle utilisé, le ratio d'aspect, la résolution, les balises de style, et une évaluation de qualité éditoriale (créativité, utilité, qualité technique, et pour image/vidéo, l'adhérence au prompt et le "facteur wow"). C'est la différence entre une liste de chaînes de prompts et un jeu de données que vous pouvez réellement utiliser pour étudier ce qui fonctionne. Vous ne devinez pas si un prompt est bon, vous pouvez voir la sortie qu'il a générée et comment il a été noté.
Comment il se compare à ce qui existe ailleurs
Récupérer des prompts sur X ou Reddit vous-même signifie gérer des limites de taux, des formats incohérents, et des publications qui disparaissent. Les produits "pack de prompts" payants vous donnent une tranche sélectionnée mais vous verrouillent hors du reste et incluent rarement le média généré réel. Les communautés à modèle unique sont utiles mais structurellement ne peuvent pas répondre aux questions inter-modèles, comme si un style de cadrage particulier se traduit de Midjourney à Kling.
Le jeu de données de Wikipédia contourne ces trois problèmes : il est gratuit, il n'est pas limité à un seul modèle, et chaque enregistrement vient déjà avec sa source originale liée au créateur (le champ original_source), donc l'attribution est intégrée plutôt que ajoutée après coup.
Récupérer les données
Le manifeste vit à le jeu de données, qui renvoie le nombre total de prompts, le schéma des enregistrements, et le schéma de pagination. Le catalogue réel est à /dataset/prompts, paginé avec un curseur de clé, jusqu'à 500 enregistrements par page :
curl "https://www.wikiprompt.org/dataset/prompts?limit=500"
Chaque réponse inclut une URL next. Suivez-la jusqu'à ce que next revienne null et vous avez le catalogue complet. Une boucle de pagination minimale ressemble à ceci :
import requests
url = "https://www.wikiprompt.org/dataset/prompts?limit=500"
records = []
while url:
resp = requests.get(url).json()
records.extend(resp["prompts"])
url = resp.get("next")
print(len(records), "prompts collected")
Pas de clé API, CORS activé, et le tout est derrière le cache de bord de Vercel, donc tirer l'ensemble complet est rapide et ne met pas de charge sur le site en direct comme le ferait le scraping.
Champs structurés, pas de texte libre
Chaque enregistrement inclut slug, url, title, description, content (le prompt réel), category, tags, media, model, metadata, author, original_source, created_at, et updated_at. Les catégories couvrent créatif, marketing, personnel, productivité, codage, éducation, affaires, recherche, et autres, donc filtrer par cas d'usage est une recherche de champ, pas un classificateur de texte que vous devez entraîner vous-même.
Seuls les prompts actifs et nettoyés entrent dans l'export, ce qui signifie que vous ne téléchargez pas de spam, de doublons, ou de brouillons à moitié finis à côté du vrai.
Si vous en avez besoin en direct plutôt qu'en masse
Le jeu de données est pour l'analyse en masse. Si vous préférez interroger à la demande, l'API de recherche renvoie du JSON pour une requête en direct, le serveur MCP permet à un agent IA de rechercher et de récupérer des prompts directement dans une conversation, et llms.txt donne à tout LLM une carte de la structure du site. Tous les trois pointent vers le même catalogue sous-jacent que le jeu de données.
Attribution
Chaque prompt dans Wikipédia a été agrégé à partir d'une publication publique par son auteur original. Lorsque vous réutilisez un prompt ou un export de jeu de données dans quelque chose que vous publiez, créditez wikiprompt.org et le lien original_source de l'enregistrement vers le créateur qui l'a écrit. Ce n'est pas une licence formelle, c'est la courtoisie de base dont tout le catalogue dépend.
Si vous avez été en train de coudre ensemble des exemples de prompts à partir de tweets mis en signet et de packs payants, voici le raccourci : un seul téléchargement, chaque modalité, des sorties réelles attachées, mis à jour à mesure que le catalogue grandit.
Related Articles
- Laya vs. Jev: Die Open-Source-Antwort auf die Entscheidungsmodell-Welle
Sep 22, 2026 · 5 min read
- Laya contre Jev : La réponse open-source à la vague des modèles de décision
Sep 22, 2026 · 5 min read
- Laya vs Jev: La respuesta de código abierto a la ola de modelos de decisión
Sep 22, 2026 · 5 min read
- Laya vs Jev: 오픈소스로 답하는 의사결정 모델 물결
Sep 22, 2026 · 5 min read
- लाया बनाम जेव: निर्णय-मॉडल लहर का ओपन-सोर्स उत्तर
Sep 22, 2026 · 5 min read