Blog›Guides

Création d'une application IA sur le jeu de données Wikiprompt

Un guide pas à pas pour les développeurs afin de créer une interface de recherche de prompts, un bot de prompt du jour, une extension de navigateur ou un bot Discord basé sur le jeu de données public de plus de 55 000 prompts de Wikiprompt, avec du code d'ingestion et des notes d'attribution.

Création d'une application IA sur le jeu de données Wikiprompt

Construire une application IA sur le jeu de données Wikiprompt

Chaque développeur indépendant qui a essayé de créer une application de « bibliothèque de prompts » se heurte au même mur dès le premier jour : vous avez besoin de contenu d'amorçage, et le scraping est lent, fragile et irrespectueux envers le serveur que vous sollicitez. Wikiprompt vient de retirer ce mur. Le catalogue complet, plus de 55 000 prompts couvrant ChatGPT, Claude, Gemini, Midjourney, GPT Image, Veo, Kling, Seedance, Nano Banana, Grok et bien plus, est désormais disponible sous forme de jeu de données public en masse. Pas de clé, pas de danse de limites de débit, pas de scraping. Juste du JSON.

Ce billet est un journal de construction, pas un communiqué de presse. Quatre petites applications que vous pourriez livrer ce week-end, et la plomberie exacte pour y arriver.

Ce avec quoi vous travaillez réellement

Commencez par le manifeste :

curl "https://www.wikiprompt.org/dataset"

Il renvoie total_prompts, les record_fields que vous pouvez attendre sur chaque ligne, et le schéma de pagination. Les vraies données se trouvent sur /dataset/prompts, paginées avec un curseur de clé : chaque page vous donne une URL next, vous la suivez jusqu'à ce que next revienne null. Jusqu'à 500 enregistrements par page.

curl "https://www.wikiprompt.org/dataset/prompts?limit=500"

Chaque enregistrement est un objet petit et utile : slug, url, title, description, content (le texte du prompt réel que vous colleriez dans un modèle), category, tags, media (URLs d'images/vidéos lorsque le prompt en a produit une), model (pour quoi il a été conçu ou exécuté), metadata (champs structurés comme le type de média, le ratio d'aspect, le style et une évaluation de qualité), author, original_source (le tweet ou le post original d'où il vient), et des horodatages. C'est suffisant pour construire une vraie interface utilisateur sans un seul appel API supplémentaire.

Voici la boucle d'ingestion complète en Python, environ 15 lignes vers un cache SQLite local :

import requests, sqlite3

db = sqlite3.connect("wikiprompt.db")

db.execute("""create table if not exists prompts(

slug text primary key, title text, description text,

content text, category text, model text, url text)""")

url = "https://www.wikiprompt.org/dataset/prompts?limit=500"

while url:

data = requests.get(url).json()

for p in data["records"]:

db.execute(

"insert or replace into prompts values (?,?,?,?,?,?,?)",

(p["slug"], p["title"], p["description"],

p["content"], p["category"], p.get("model"), p["url"]),

)

db.commit()

url = data.get("next")

Exécutez cela une fois, et vous avez une copie locale et interrogable de tout le catalogue. CORS est ouvert en grand (Access-Control-Allow-Origin: *) et les réponses sont mises en cache en périphérie, donc c'est aussi convivial à exécuter depuis un navigateur, pas seulement depuis un travail backend.

Quatre choses qui valent la peine d'être construites

Une interface de recherche à facettes. Le jeu de données vous donne category, tags, model et metadata gratuitement, ce qui signifie que la recherche à facettes est essentiellement une clause SQL WHERE : « prompts Midjourney tagués portrait » ou « prompts de codage pour Claude » se résolvent en un filtre, pas en un projet de recherche. Si vous ne voulez pas construire l'index vous-même, wikiprompt en gère déjà un : l'API de recherche prend ?q= et renvoie du JSON classé, assez bon pour prototyper une boîte de recherche avant d'avoir écrit une seule ligne de code de récupération.

Un bot « prompt du jour ». Tâche cron, choisissez une ligne aléatoire dans votre cache local (ou filtrez par category=creative pour un fil thématique), publiez title + content + le url vers l'original. Le champ media signifie que vous pouvez joindre l'image ou la vidéo de sortie réelle au post, pas seulement du texte. C'est environ 40 lignes de code et ça fonctionne aussi bien comme bot Slack, bot Telegram, ou un post cron vers X.

Une extension de navigateur. Cliquez sur n'importe quel champ de texte, « insérer un prompt », recherchez dans votre cache local par catégorie ou modèle, collez content. Comme les données sont locales après la synchronisation initiale, cela fonctionne hors ligne et instantanément, sans aller-retour réseau à chaque frappe.

Un bot Discord. Commande slash /prompt image midjourney, filtrez votre cache par category et model, répondez avec title, content et le média en tant qu'embed. Si quelqu'un veut voir la source, liez original_source dans le pied de page, c'est l'attribution couverte dans le même message.

Utiliser les métadonnées pour autre chose que du filtrage

metadata est l'endroit où vivent les choses intéressantes pour tout ce qui concerne les médias : ratio d'aspect, tags de style, évaluation de qualité. Si vous construisez quelque chose qui classe ou recommande des prompts (plutôt que de simplement les lister), c'est votre signal. Un filtre « meilleurs prompts Midjourney pour portraits, ratio 3:4, score de qualité élevé » est une question de clauses WHERE supplémentaires une fois le champ ingéré, aucune pipeline de scoring séparée requise.

Pour un aperçu de ce à quoi ressemble un bon enregistrement de prompt de bout en bout, parcourez quelques pages en direct : un prompt d'image de data physicalization, une transformation de personnage arachnide futuriste, et un voyageur nomade mystérieux. Ce sont aussi des enregistrements complets dans le jeu de données, avec les mêmes champs que vous copieriez dans un modèle.

Utiliser le champ metadata pour de vrai

metadata est là que se trouve l'intérêt pour tout ce qui touche aux médias : type de média, ratio d'aspect, style, évaluation de qualité. Si vous construisez quelque chose qui classe ou recommande des prompts (plutôt que de simplement les lister), c'est votre signal. Un filtre « meilleurs prompts Midjourney pour portraits, ratio 3:4, score de qualité élevé » est une question de quelques clauses WHERE supplémentaires une fois le champ ingéré, aucune pipeline de scoring séparée requise.

Pour un aperçu de ce à quoi ressemble un bon enregistrement de prompt de bout en bout, parcourez quelques pages en direct : un prompt d'image de physicalisation de données, une transformation de personnage arachnide futuriste, et un design de personnage voyageur nomade mystérieux. Chacun d'eux est aussi un enregistrement complet dans le jeu de données, mêmes champs, même content que vous copieriez dans un modèle.

L'attribution n'est pas négociable, et ce n'est pas difficile non plus

Wikiprompt agrège des prompts provenant de publications publiques de leurs auteurs d'origine ; ce n'est pas le détenteur de licence, c'est le bibliothécaire. Si votre application affiche un prompt, montrez original_source à côté et créditez wikiprompt.org comme source du catalogue. C'est l'accord, et le jeu de données le rend facile à honorer puisque original_source est déjà là dans chaque enregistrement. Ne le supprimez pas lors de l'ingestion juste parce que vous n'avez pas encore de colonne pour lui.

Si vous ne voulez pas gérer votre propre index

Trois options existent. Exécutez le jeu de données en masse via votre propre pipeline pour un contrôle total. Appelez l'API de recherche directement si vous voulez juste des résultats, pas une infrastructure. Ou, si vous construisez un agent plutôt qu'une application, pointez-le vers le serveur MCP, qui expose la recherche, les catégories et les prompts individuels comme outils que Claude et d'autres agents peuvent appeler nativement. Il y a aussi llms.txt si vous voulez qu'un modèle comprenne toute la surface en un seul fetch.

Commencez ici

curl "https://www.wikiprompt.org/dataset/prompts?limit=500" | head -c 2000

Regardez ce qui revient, choisissez l'une des quatre idées ci-dessus, et vous aurez quelque chose qui fonctionne avant la fin du week-end. La partie difficile - 55 000+ prompts curatés à travers une douzaine de modèles - est déjà faite. Ce que vous construisez avec est la partie amusante.

Tags
open-data·dataset·api·developers·tutorial·discord-bot·ai-prompts