Blog›Guides

Usando e Citando o Corpus Wikiprompt para Pesquisa

Um guia para pesquisadores, estudantes e jornalistas sobre como extrair o conjunto de dados do Wikiprompt de forma reproduzível, atribuí-lo corretamente e entender seus limites como um corpus agregado, curado e em evolução.

Usando e Citando o Corpus Wikiprompt para Pesquisa

Usando e Citando o Corpus Wikiprompt para Pesquisa

A engenharia de prompts produz texto em escala, e texto em escala é exatamente o tipo de coisa que pesquisadores, estudantes e jornalistas gostam de estudar. Quais padrões de fraseado se repetem em prompts de imagem direcionados a diferentes modelos? Como prompts criativos diferem estruturalmente de prompts de codificação ou produtividade? Essas são perguntas respondíveis, mas apenas se houver um corpus para respondê-las, e até agora esse corpus vivia espalhado pelas linhas do tempo de contas sociais individuais, não indexado e efetivamente impossível de estudar.

Wikiprompt passou os últimos meses selecionando exatamente esse tipo de coleção: prompts de IA públicos, enviados por usuários, extraídos da web aberta, organizados e etiquetados. O catálogo agora contém mais de 55.000 prompts abrangendo modelos de texto como ChatGPT, Claude e Gemini, e modelos de imagem ou vídeo como Midjourney, GPT Image, Seedance, Veo, Kling e Nano Banana. Esse corpus está disponível como um conjunto de dados públicos em massa, e este post é um guia para usá-lo de forma responsável em trabalho acadêmico ou jornalístico: como puxá-lo de forma reproduzível, como atribuí-lo e onde estão seus limites.

Por que este corpus

A maioria dos conjuntos de dados de prompts que circulam em contextos de pesquisa são amostras pequenas coletadas manualmente ou instantâneos raspados com proveniência pouco clara. O do Wikiprompt difere de três maneiras.

Primeiro, cada registro rastreia uma origem real e atribuível: um campo original_source liga ao post original, e um campo author nomeia a pessoa que o escreveu. Este é um índice selecionado de atividade real de compartilhamento de prompts públicos, não um conjunto de dados sintético ou anonimizado.

Segundo, é estruturado e comparável entre registros. Cada prompt tem uma category (criativo, marketing, pessoal, produtividade, codificação, educação, negócios, pesquisa ou outro), tags, um campo model nomeando o sistema de IA alvo e, quando aplicável, um objeto metadata com media_type, aspect_ratio, style e uma avaliação editorial de qualidade, incomum para um conjunto de dados público e útil para estudar o que separa um prompt forte de um fraco.

Terceiro, é acessível sem fricção: sem chave de API, sem limites de taxa para contornar, sem infraestrutura de raspagem para manter. Isso importa para a reprodutibilidade, que é o ponto deste post.

Puxando os dados de forma reproduzível

O conjunto de dados é exposto como dois endpoints. O manifesto do conjunto de dados retorna um documento JSON descrevendo a coleção: total_prompts, o esquema completo de record_fields e o esquema de paginação. O catálogo em si vive em /dataset/prompts, também JSON, paginado com um cursor de keyset em vez de números de página.

A paginação por keyset vale a pena destacar porque é o que torna uma puxada de pesquisa reproduzível. A paginação baseada em offset muda sob você se registros são adicionados ou removidos no meio do rastreamento, duplicando ou pulando linhas silenciosamente. Um cursor de keyset não tem esse modo de falha: siga a URL next em cada resposta até que ela retorne null, e cada página é ancorada a uma posição estável em vez de uma contagem de linhas que pode derivar.

Uma puxada mínima:

curl "https://www.wikiprompt.org/dataset/prompts?limit=500"

limit aceita até 500 registros por página (200 por padrão), e o parâmetro de cursor é after. Um rastreamento completo em Python é um loop curto:

import requests

url = "https://www.wikiprompt.org/dataset/prompts?limit=500"

records = []

while url:

resp = requests.get(url, timeout=30).json()

records.extend(resp["prompts"])

url = resp.get("next")

print(len(records), "records pulled")

A resposta é servida com Access-Control-Allow-Origin: * e cache de borda pesado, então este loop é barato e não requer um proxy de backend. Para uma amostra fixa e reproduzível, registre a data da sua puxada junto com seu instantâneo do conjunto de dados, já que o corpus está crescendo ativamente.

O que está em um registro

Cada registro inclui campos para análise de texto (title, description, content, o texto real do prompt), para classificação (category, tags, model) e para trabalho multimodal (media, um array de URLs de imagem ou vídeo, além do objeto estruturado metadata). Timestamps (created_at, updated_at) suportam estudo longitudinal, e slug mais url dão a cada registro um identificador estável e dereferenciável para citar exemplos específicos em vez de apenas estatísticas agregadas.

Para tornar isso concreto, uma citação pode apontar para um prompt de fotografia arquitetônica construído em torno de um único tijolo lançando uma sombra monumental, ou uma entrada estilisticamente distinta como um retrato combinando imagens de outono com um motivo de mandala tibetana, ou um que se baseia em convenções estéticas de wuxia e thangka. Cada uma dessas páginas é o local canônico e citável para aquele registro: URL estável, atribuição visível ao autor original e um link de volta ao post original.

Para filtragem ao vivo em vez de uma puxada em massa, a API de busca suporta consultas baseadas em busca sobre o mesmo catálogo, e resumos legíveis por máquina vivem em llms.txt. Nenhum substitui o conjunto de dados em massa para amostragem sistemática, mas ambos ajudam com verificações pontuais ou amostras escopadas, como puxar apenas a categoria criativa para um estudo limitado a esse domínio.

Atribuição e citação

Wikiprompt é um agregador, não o autor original dos prompts no corpus. O conteúdo vem de posts públicos de criadores individuais, e a atribuição correta requer citar ambas as camadas: Wikiprompt como a fonte do conjunto de dados, e o original_source específico para qualquer registro que você cite, reproduza ou analise em detalhe. Não detemos ou reivindicamos uma licença formal sobre o conteúdo subjacente; trate a reutilização como um pedido para atribuir corretamente em vez de uma concessão de direitos mais amplos. Se um caso de uso levantar uma pergunta que os campos do conjunto de dados não respondem, rastreie o registro de volta ao seu original_source e note essa linhagem em sua documentação.

Um formato de citação razoável para o corpus como um todo:

Corpus Wikiprompt. Recuperado em [data] de https://www.wikiprompt.org/dataset/prompts.

Dados agregados de prompts de IA públicos; registros individuais atribuem autores originais

via o campo original_source.

Ao citar um prompt individual, cite sua URL canônica (wikiprompt.org/<slug>) e, onde a análise depender do contexto original, o original_source vinculado também.

Limites que valem a pena declarar claramente

Este é um corpus selecionado, não uma amostra aleatória de toda a atividade de prompts de IA online. Apenas prompts ativos e limpos são exportados; qualquer coisa removida por razões de qualidade ou política não aparecerá. Isso o torna bem adequado para estudar como uma coleção moderada e voltada ao público de prompts se parece, mas afirmações sobre "como as pessoas fazem prompts em modelos de IA" em geral devem ser escopadas de acordo.

O corpus também está crescendo em vez de fixo. Uma puxada de uma semana não corresponderá exatamente a uma puxada da próxima. Onde a reprodutibilidade exata importa, faça um instantâneo dos dados você mesmo (a paginação por keyset acima torna isso barato) e cite a data de recuperação e, idealmente, uma contagem de registros do seu instantâneo, em vez de apontar leitores para o endpoint ao vivo e assumir que ele corresponderá depois.

Finalmente, as avaliações de qualidade em metadata são julgamentos editoriais feitos durante a curadoria, não um rubric formal ou revisado por pares. Elas são úteis como uma variável para estudar, menos úteis como verdade absoluta sem divulgar essa proveniência.

Nada disso é uma razão para evitar o corpus. É a condição sob a qual qualquer conjunto de dados públicos agregado deve ser usado: saiba de onde os dados vieram, divulgue os limites da amostra e cite as pessoas que realmente escreveram os prompts.

Tags
open-data·dataset·research·citation·reproducibility·academic·api