) télécharger 55 000 invites IA (gratuit, sans scraping)
Un guide étape par étape pour extraire l’intégralité du catalogue de Wikipédia via le point de terminaison de jeu de données public, en suivant le curseur de pagination par jeu de clés jusqu’à ce qu’il ne reste plus rien, sans avoir besoin de scraping.

Comment Télécharger 55 000 Prompts IA (Gratuit, Sans Scraping)
Si vous avez déjà essayé de construire un jeu de données de prompts en scannant des fils Twitter, en capturant des serveurs Discord, ou en paginant à travers le HTML d'un site avec un navigateur headless, vous savez déjà à quel point c'est fragile. Les sélecteurs changent, les limites de taux s'activent, et la moitié des "prompts" que vous collectez s'avèrent être des réponses à propos du prompt, pas le prompt lui-même.
Wikiprompt vient d'éliminer le besoin de tout cela. Le catalogue, plus de 55 000 prompts IA soigneusement sélectionnés couvrant la génération d'images, de vidéos et de texte sur des modèles comme Midjourney, GPT Image, Veo, Kling, Nano Banana et Claude, est désormais disponible sous forme de jeu de données JSON simple que vous pouvez parcourir avec curl. Pas de clé API, pas de connexion, pas de scraping. Ce post est le chemin le plus rapide de "je veux les données" à un fichier local avec 55 000 enregistrements dedans.
Étape 1 : accédez au manifeste
Avant de récupérer des enregistrements, vérifiez le manifeste pour que votre script sache à quoi il a affaire :
curl "https://www.wikiprompt.org/dataset"
Cela renvoie un petit document JSON décrivant le jeu de données : total_prompts (le nombre actuel, 55 000+), record_fields (le schéma ci-dessous), et le schéma de pagination. Traitez ce point de terminaison comme la source de vérité pour le total, ne codez pas en dur un nombre dans votre pipeline.
Étape 2 : récupérez votre première page
Les enregistrements réels se trouvent à /dataset/prompts. La pagination est basée sur des clés (un curseur, pas des numéros de page), ce qui la rend rapide et stable même à la page 200. La taille de page par défaut est de 200 enregistrements ; vous pouvez demander jusqu'à 500 à la fois :
curl "https://www.wikiprompt.org/dataset/prompts?limit=500"
La réponse est un objet JSON avec une liste d'enregistrements et un champ next. next est une URL complète, prête à être récupérée telle quelle, qui porte un curseur after pointant vers le dernier enregistrement que vous venez de recevoir. Quand il n'y a plus rien à parcourir, next est null. Ce seul champ est votre condition de boucle entière.
Étape 3 : suivez `next` jusqu'à ce qu'il soit null
Voici la boucle de pagination complète en Python. Elle écrit chaque enregistrement dans un fichier local et s'arrête d'elle-même :
import json
import time
import urllib.request
url = "https://www.wikiprompt.org/dataset/prompts?limit=500"
out = open("wikiprompt_dataset.jsonl", "w")
count = 0
while url:
with urllib.request.urlopen(url) as resp:
data = json.loads(resp.read())
for record in data["records"]:
out.write(json.dumps(record) + "\n")
count += 1
url = data.get("next")
time.sleep(0.2)
out.close()
print(f"Téléchargé {count} prompts")
La même boucle en Node, si c'est votre stack :
let url = "https://www.wikiprompt.org/dataset/prompts?limit=500";
const fs = require("fs");
const out = fs.createWriteStream("wikiprompt_dataset.jsonl");
let count = 0;
while (url) {
const res = await fetch(url);
const data = await res.json();
for (const record of data.records) {
out.write(JSON.stringify(record) + "\n");
count++;
}
url = data.next;
}
console.log(Téléchargé ${count} prompts);
Exécutez l'un ou l'autre et éloignez-vous. Chaque réponse est mise en cache en périphérie et compatible CORS (Access-Control-Allow-Origin: *), donc cela fonctionne depuis un serveur, une console de navigateur, un notebook, ou une fonction serverless sans en-têtes spéciaux. Sur une connexion normale, récupérer tous les 55 000+ enregistrements à limit=500 prend bien moins de deux minutes.
Ce que vous obtenez réellement par enregistrement
Chaque objet JSON dans le jeu de données a la même forme, ce qui le rend utile pour tout sauf une navigation ponctuelle :
slug et url, la page canonique pour ce prompt sur wikiprompt.orgtitle et descriptioncontent, le texte du prompt réel que vous copieriez dans un modèlecategory (creative, marketing, personnel, productivité, codage, éducation, affaires, recherche, autre) et tagsmedia, URLs d'images ou de vidéos quand le prompt a produit une sortie visuellemodel, le modèle IA pour lequel le prompt a été écrit ou avec lequel il a été générémetadata, un bloc structuré couvrant le type de média, le ratio d'aspect, le style et une évaluation de qualitéauthor et original_source, un lien retour vers le tweet ou le post original d'où vient le promptcreated_at et updated_atCe champ content est le point central : c'est le texte du prompt prêt à l'emploi, pas un résumé, ce qui est ce que la plupart des jeux de données scrapés ratent.
Quelques enregistrements à regarder en premier
Plutôt que de croire le schéma sur parole, ouvrez quelques entrées réelles. Titan: Engineering Blueprint of a Transforming Robot est un bon exemple de prompt d'image détaillé avec un bloc de métadonnées complet. Data Physicalization montre comment category et tags sont assignés pour un prompt plus conceptuel et orienté design. Et Pastel Fantasy Portrait of a Young Woman est un prompt compact axé sur le style qui vaut la peine d'être comparé au champ style dans ses métadonnées. Récupérer ces trois slugs depuis votre fichier JSONL local est un moyen rapide de vérifier votre parseur avant de lui faire confiance sur les 55 000.
Si vous préférez interroger plutôt que télécharger
Le jeu de données en masse est pour quand vous voulez tout, localement, une fois. Si vous n'avez besoin que d'une tranche, l'API de recherche répond aux requêtes à la demande en JSON, le serveur MCP expose le même catalogue comme outils pour Claude et d'autres agents, et llms.txt donne aux crawlers une carte du site. L'export du jeu de données et ces points de terminaison en direct partagent les mêmes données sous-jacentes, donc passer de l'un à l'autre plus tard ne vous coûte rien.
Une règle si vous réutilisez cela
Wikiprompt agrège des prompts provenant de posts publics de leurs auteurs originaux ; il n'est pas le détenteur des droits d'auteur. Si vous publiez quelque chose construit sur ce jeu de données, créditez wikiprompt.org et le lien original_source sur les enregistrements spécifiques que vous avez utilisés. C'est la seule condition attachée à tout cela.
Téléchargez-le, parcourez-le, et construisez quelque chose. Le manifeste et le curseur next sont les seules deux choses dont vous devez vous souvenir.
Related Articles
- Laya vs. Jev: Die Open-Source-Antwort auf die Entscheidungsmodell-Welle
Sep 22, 2026 · 5 min read
- Laya contre Jev : La réponse open-source à la vague des modèles de décision
Sep 22, 2026 · 5 min read
- Laya vs Jev: La respuesta de código abierto a la ola de modelos de decisión
Sep 22, 2026 · 5 min read
- Laya vs Jev: 오픈소스로 답하는 의사결정 모델 물결
Sep 22, 2026 · 5 min read
- लाया बनाम जेव: निर्णय-मॉडल लहर का ओपन-सोर्स उत्तर
Sep 22, 2026 · 5 min read