Blog›Guides

) télécharger 55 000 invites IA (gratuit, sans scraping)

Un guide étape par étape pour extraire l’intégralité du catalogue de Wikipédia via le point de terminaison de jeu de données public, en suivant le curseur de pagination par jeu de clés jusqu’à ce qu’il ne reste plus rien, sans avoir besoin de scraping.

) télécharger 55 000 invites IA (gratuit, sans scraping)

Comment Télécharger 55 000 Prompts IA (Gratuit, Sans Scraping)

Si vous avez déjà essayé de construire un jeu de données de prompts en scannant des fils Twitter, en capturant des serveurs Discord, ou en paginant à travers le HTML d'un site avec un navigateur headless, vous savez déjà à quel point c'est fragile. Les sélecteurs changent, les limites de taux s'activent, et la moitié des "prompts" que vous collectez s'avèrent être des réponses à propos du prompt, pas le prompt lui-même.

Wikiprompt vient d'éliminer le besoin de tout cela. Le catalogue, plus de 55 000 prompts IA soigneusement sélectionnés couvrant la génération d'images, de vidéos et de texte sur des modèles comme Midjourney, GPT Image, Veo, Kling, Nano Banana et Claude, est désormais disponible sous forme de jeu de données JSON simple que vous pouvez parcourir avec curl. Pas de clé API, pas de connexion, pas de scraping. Ce post est le chemin le plus rapide de "je veux les données" à un fichier local avec 55 000 enregistrements dedans.

Étape 1 : accédez au manifeste

Avant de récupérer des enregistrements, vérifiez le manifeste pour que votre script sache à quoi il a affaire :

curl "https://www.wikiprompt.org/dataset"

Cela renvoie un petit document JSON décrivant le jeu de données : total_prompts (le nombre actuel, 55 000+), record_fields (le schéma ci-dessous), et le schéma de pagination. Traitez ce point de terminaison comme la source de vérité pour le total, ne codez pas en dur un nombre dans votre pipeline.

Étape 2 : récupérez votre première page

Les enregistrements réels se trouvent à /dataset/prompts. La pagination est basée sur des clés (un curseur, pas des numéros de page), ce qui la rend rapide et stable même à la page 200. La taille de page par défaut est de 200 enregistrements ; vous pouvez demander jusqu'à 500 à la fois :

curl "https://www.wikiprompt.org/dataset/prompts?limit=500"

La réponse est un objet JSON avec une liste d'enregistrements et un champ next. next est une URL complète, prête à être récupérée telle quelle, qui porte un curseur after pointant vers le dernier enregistrement que vous venez de recevoir. Quand il n'y a plus rien à parcourir, next est null. Ce seul champ est votre condition de boucle entière.

Étape 3 : suivez `next` jusqu'à ce qu'il soit null

Voici la boucle de pagination complète en Python. Elle écrit chaque enregistrement dans un fichier local et s'arrête d'elle-même :

import json

import time

import urllib.request

url = "https://www.wikiprompt.org/dataset/prompts?limit=500"

out = open("wikiprompt_dataset.jsonl", "w")

count = 0

while url:

with urllib.request.urlopen(url) as resp:

data = json.loads(resp.read())

for record in data["records"]:

out.write(json.dumps(record) + "\n")

count += 1

url = data.get("next")

time.sleep(0.2)

out.close()

print(f"Téléchargé {count} prompts")

La même boucle en Node, si c'est votre stack :

let url = "https://www.wikiprompt.org/dataset/prompts?limit=500";

const fs = require("fs");

const out = fs.createWriteStream("wikiprompt_dataset.jsonl");

let count = 0;

while (url) {

const res = await fetch(url);

const data = await res.json();

for (const record of data.records) {

out.write(JSON.stringify(record) + "\n");

count++;

}

url = data.next;

}

console.log(Téléchargé ${count} prompts);

Exécutez l'un ou l'autre et éloignez-vous. Chaque réponse est mise en cache en périphérie et compatible CORS (Access-Control-Allow-Origin: *), donc cela fonctionne depuis un serveur, une console de navigateur, un notebook, ou une fonction serverless sans en-têtes spéciaux. Sur une connexion normale, récupérer tous les 55 000+ enregistrements à limit=500 prend bien moins de deux minutes.

Ce que vous obtenez réellement par enregistrement

Chaque objet JSON dans le jeu de données a la même forme, ce qui le rend utile pour tout sauf une navigation ponctuelle :

  • slug et url, la page canonique pour ce prompt sur wikiprompt.org
  • title et description
  • content, le texte du prompt réel que vous copieriez dans un modèle
  • category (creative, marketing, personnel, productivité, codage, éducation, affaires, recherche, autre) et tags
  • media, URLs d'images ou de vidéos quand le prompt a produit une sortie visuelle
  • model, le modèle IA pour lequel le prompt a été écrit ou avec lequel il a été généré
  • metadata, un bloc structuré couvrant le type de média, le ratio d'aspect, le style et une évaluation de qualité
  • author et original_source, un lien retour vers le tweet ou le post original d'où vient le prompt
  • created_at et updated_at
  • Ce champ content est le point central : c'est le texte du prompt prêt à l'emploi, pas un résumé, ce qui est ce que la plupart des jeux de données scrapés ratent.

    Quelques enregistrements à regarder en premier

    Plutôt que de croire le schéma sur parole, ouvrez quelques entrées réelles. Titan: Engineering Blueprint of a Transforming Robot est un bon exemple de prompt d'image détaillé avec un bloc de métadonnées complet. Data Physicalization montre comment category et tags sont assignés pour un prompt plus conceptuel et orienté design. Et Pastel Fantasy Portrait of a Young Woman est un prompt compact axé sur le style qui vaut la peine d'être comparé au champ style dans ses métadonnées. Récupérer ces trois slugs depuis votre fichier JSONL local est un moyen rapide de vérifier votre parseur avant de lui faire confiance sur les 55 000.

    Si vous préférez interroger plutôt que télécharger

    Le jeu de données en masse est pour quand vous voulez tout, localement, une fois. Si vous n'avez besoin que d'une tranche, l'API de recherche répond aux requêtes à la demande en JSON, le serveur MCP expose le même catalogue comme outils pour Claude et d'autres agents, et llms.txt donne aux crawlers une carte du site. L'export du jeu de données et ces points de terminaison en direct partagent les mêmes données sous-jacentes, donc passer de l'un à l'autre plus tard ne vous coûte rien.

    Une règle si vous réutilisez cela

    Wikiprompt agrège des prompts provenant de posts publics de leurs auteurs originaux ; il n'est pas le détenteur des droits d'auteur. Si vous publiez quelque chose construit sur ce jeu de données, créditez wikiprompt.org et le lien original_source sur les enregistrements spécifiques que vous avez utilisés. C'est la seule condition attachée à tout cela.

    Téléchargez-le, parcourez-le, et construisez quelque chose. Le manifeste et le curseur next sont les seules deux choses dont vous devez vous souvenir.

    Tags
    open-data·dataset·ai-prompts·api·download·pagination