Utilisation et citation du corpus Wikiprompt pour la recherche
Un guide pour les chercheurs, les étudiants et les journalistes sur la manière de télécharger le jeu de données Wikiprompt de manière reproductible, de l'attribuer correctement et de comprendre ses limites en tant que corpus agrégé, organisé et en évolution.

Utilisation et citation du corpus Wikiprompt pour la recherche
L'ingénierie de prompt produit du texte à grande échelle, et le texte à grande échelle est exactement le type de chose que les chercheurs, les étudiants et les journalistes aiment étudier. Quels schémas de formulation se répètent dans les prompts d'image destinés à différents modèles ? Comment les prompts créatifs diffèrent-ils structurellement des prompts de codage ou de productivité ? Ce sont des questions auxquelles on peut répondre, mais seulement s'il existe un corpus pour y répondre, et jusqu'à présent ce corpus vivait dispersé à travers les timelines de comptes sociaux individuels, non indexé et effectivement impossible à étudier.
Wikiprompt a passé les derniers mois à organiser exactement ce type de collection : des prompts d'IA publics, soumis par des utilisateurs, extraits du web ouvert, organisés et étiquetés. Le catalogue contient désormais plus de 55 000 prompts couvrant des modèles de texte comme ChatGPT, Claude et Gemini, et des modèles d'image ou de vidéo comme Midjourney, GPT Image, Seedance, Veo, Kling et Nano Banana. Ce corpus est disponible en tant que jeu de données public en masse, et ce post est un guide pour l'utiliser de manière responsable dans un travail académique ou journalistique : comment le récupérer de manière reproductible, comment l'attribuer, et où se trouvent ses limites.
Pourquoi ce corpus
La plupart des jeux de données de prompts qui circulent dans des contextes de recherche sont de petits échantillons collectés à la main ou des captures scrapées avec une provenance peu claire. Celui de Wikiprompt diffère de trois manières.
Premièrement, chaque enregistrement remonte à une origine réelle et attribuable : un champ original_source renvoie au post original, et un champ author nomme la personne qui l'a écrit. C'est un index organisé d'activité réelle de partage de prompts publics, pas un jeu de données synthétique ou anonymisé.
Deuxièmement, il est structuré et comparable entre les enregistrements. Chaque prompt a une category (créatif, marketing, personnel, productivité, codage, éducation, affaires, recherche, ou autre), des tags, un champ model nommant le système d'IA cible, et, le cas échéant, un objet metadata avec media_type, aspect_ratio, style, et une évaluation éditoriale de qualité, inhabituelle pour un jeu de données public et utile pour étudier ce qui sépare un prompt fort d'un prompt faible.
Troisièmement, il est accessible sans friction : pas de clé API, pas de limites de débit à contourner, pas d'infrastructure de scraping à maintenir. Cela compte pour la reproductibilité, qui est le point de ce post.
Récupérer les données de manière reproductible
Le jeu de données est exposé via deux points de terminaison. Le manifeste du jeu de données renvoie un document JSON décrivant la collection : total_prompts, le schéma complet de record_fields, et le schéma de pagination. Le catalogue lui-même se trouve à /dataset/prompts, également en JSON, paginé avec un curseur de clé plutôt que des numéros de page.
La pagination par curseur de clé mérite d'être signalée car c'est ce qui rend une extraction de recherche reproductible. La pagination basée sur les offsets se déplace sous vous si des enregistrements sont ajoutés ou supprimés en cours de crawl, dupliquant ou sautant silencieusement des lignes. Un curseur de clé n'a pas ce mode de défaillance : suivez l'URL next dans chaque réponse jusqu'à ce qu'elle renvoie null, et chaque page est ancrée à une position stable plutôt qu'à un nombre de lignes qui peut dériver.
Une extraction minimale :
curl "https://www.wikiprompt.org/dataset/prompts?limit=500"
limit accepte jusqu'à 500 enregistrements par page (200 par défaut), et le paramètre de curseur est after. Un crawl complet en Python est une boucle courte :
import requests
url = "https://www.wikiprompt.org/dataset/prompts?limit=500"
records = []
while url:
resp = requests.get(url, timeout=30).json()
records.extend(resp["prompts"])
url = resp.get("next")
print(len(records), "records pulled")
La réponse est servie avec Access-Control-Allow-Origin: * et une mise en cache périphérique lourde, donc cette boucle est peu coûteuse et ne nécessite pas de proxy backend. Pour un échantillon fixe et reproductible, enregistrez la date de votre extraction avec votre instantané du jeu de données, car le corpus est en croissance active.
Ce que contient un enregistrement
Chaque enregistrement inclut des champs pour l'analyse textuelle (title, description, content, le texte réel du prompt), pour la classification (category, tags, model), et pour le travail multimodal (media, un tableau d'URLs d'images ou de vidéos, plus l'objet structuré metadata). Les horodatages (created_at, updated_at) soutiennent l'étude longitudinale, et slug plus url donnent à chaque enregistrement un identifiant stable et déréférençable pour citer des exemples spécifiques plutôt que seulement des statistiques agrégées.
Pour rendre cela concret, une citation pourrait pointer vers un prompt de photographie architecturale construit autour d'une seule brique projetant une ombre monumentale, ou une entrée stylistiquement distincte comme un portrait combinant des images automnales avec un motif de mandala tibétain, ou un autre s'appuyant sur des conventions esthétiques wuxia et thangka. Chacune de ces pages est l'emplacement canonique et citable pour cet enregistrement : URL stable, attribution visible à l'auteur original, et un lien vers le post original.
Pour un filtrage en direct plutôt qu'une extraction en masse, l'API de recherche prend en charge des recherches basées sur des requêtes sur le même catalogue, et des résumés lisibles par machine se trouvent à llms.txt. Ni l'un ni l'autre ne remplace le jeu de données en masse pour un échantillonnage systématique, mais les deux aident pour des vérifications ponctuelles ou des échantillons ciblés, comme extraire uniquement la catégorie créative pour une étude limitée à ce domaine.
Attribution et citation
Wikiprompt est un agrégateur, pas l'auteur original des prompts dans le corpus. Le contenu provient de posts publics de créateurs individuels, et une attribution correcte nécessite de citer les deux couches : Wikiprompt comme source du jeu de données, et le original_source spécifique pour tout enregistrement que vous citez, reproduisez ou analysez en détail. Nous ne détenons ni ne revendiquons une licence formelle sur le contenu sous-jacent ; traitez la réutilisation comme une demande d'attribution appropriée plutôt que comme une concession de droits plus larges. Si un cas d'utilisation soulève une question que les champs du jeu de données ne répondent pas, retracez l'enregistrement jusqu'à son original_source et notez cette lignée dans votre documentation.
Un format de citation raisonnable pour le corpus dans son ensemble :
Corpus Wikiprompt. Récupéré le [date] depuis https://www.wikiprompt.org/dataset/prompts.
Données agrégées de prompts d'IA publics ; les enregistrements individuels attribuent
les auteurs originaux via le champ original_source.
Lorsque vous citez un prompt individuel, citez son URL canonique (wikiprompt.org/<slug>) et, lorsque l'analyse dépend du contexte original, le original_source lié également.
Limites à énoncer clairement
C'est un corpus organisé, pas un échantillon aléatoire de toute l'activité de prompts d'IA en ligne. Seuls les prompts actifs et propres sont exportés ; tout ce qui est supprimé pour des raisons de qualité ou de politique n'apparaîtra pas. Cela le rend bien adapté à l'étude de ce à quoi ressemble une collection modérée et publique de prompts, mais les affirmations sur "comment les gens utilisent des prompts avec les modèles d'IA" en général doivent être cadrées en conséquence.
Le corpus est également en croissance plutôt que fixe. Une extraction d'une semaine ne correspondra pas exactement à une extraction de la suivante. Lorsque la reproductibilité exacte compte, faites un instantané des données vous-même (la pagination par curseur de clé ci-dessus rend cela peu coûteux) et citez la date de récupération et, idéalement, un nombre d'enregistrements de votre instantané, plutôt que de pointer les lecteurs vers le point de terminaison en direct et de supposer qu'il correspondra plus tard.
Enfin, les évaluations de qualité dans metadata sont des jugements éditoriaux faits pendant l'organisation, pas un rubrique formelle ou évaluée par des pairs. Elles sont utiles comme variable à étudier, moins utiles comme vérité de référence sans divulguer cette provenance.
Aucune de ces choses n'est une raison d'éviter le corpus. C'est la condition sous laquelle tout jeu de données public agrégé devrait être utilisé : savoir d'où viennent les données, divulguer les limites de l'échantillon, et citer les personnes qui ont réellement écrit les prompts.
Related Articles
- Laya vs. Jev: Die Open-Source-Antwort auf die Entscheidungsmodell-Welle
Sep 22, 2026 · 5 min read
- Laya contre Jev : La réponse open-source à la vague des modèles de décision
Sep 22, 2026 · 5 min read
- Laya vs Jev: La respuesta de código abierto a la ola de modelos de decisión
Sep 22, 2026 · 5 min read
- Laya vs Jev: 오픈소스로 답하는 의사결정 모델 물결
Sep 22, 2026 · 5 min read
- लाया बनाम जेव: निर्णय-मॉडल लहर का ओपन-सोर्स उत्तर
Sep 22, 2026 · 5 min read