Blog›Guides

O Maior Conjunto de Dados Aberto de Prompts de Imagem e Vídeo com IA

O conjunto de dados público de Wikiprompt abarca mais de 55.000 prompts de imagem, vídeo e texto em GPT Image, Midjourney, Seedance, Veo, Kling, ChatGPT e outros, cada um acompanhado de seu media de resultado real e metadados estruturados.

O Maior Conjunto de Dados Aberto de Prompts de Imagem e Vídeo com IA

ic O Maior Conjunto de Dados Abertos de Prompts de Imagem e Vídeo com IA

A maioria das coleções de prompts que você encontra online cobre um modelo, um tipo de mídia e oferece uma página para você navegar manualmente. Uma galeria de prompts do Midjourney aqui, um gist de prompts de sistema do ChatGPT ali, um curso pago que empacota "50 prompts do Veo" atrás de uma página de checkout. Nenhum deles permite que você realmente trabalhe com os dados.

O Wikiprompt é diferente de uma forma que é fácil de afirmar e vale a pena detalhar: é um catálogo aberto e único com mais de 55.000 prompts que abrangem geração de imagens, geração de vídeos e texto, cobrindo os modelos que as pessoas estão realmente usando agora: GPT Image, Midjourney, Seedance, Veo, Kling, Nano Banana, ChatGPT, Claude, Grok e mais. E, a partir deste mês, tudo isso pode ser baixado como um conjunto de dados JSON simples. Sem login, sem chave de API, sem silos por modelo. Um único feed.

A amplitude é o ponto central

A maioria dos sites de "biblioteca de prompts" escolhe um nicho. Uma galeria exclusiva do Midjourney não consegue te dizer como um prompt do Kling para o mesmo conceito difere, e um repositório de prompts de texto para o ChatGPT não tem nada a dizer sobre proporção de aspecto ou tags de estilo. O catálogo do Wikiprompt é organizado para que prompts de imagem, vídeo e texto vivam no mesmo esquema, possam ser navegados pela mesma categoria de prompts criativos e pesquisados pela mesma API de busca.

Concretamente, isso significa que você pode obter:

  • Prompts de imagem para GPT Image, Midjourney, Nano Banana e ferramentas similares, como um retrato de fantasia pastel de uma jovem ou um pôster de viagem em linogravura cortado à mão.
  • Prompts de vídeo para Seedance, Veo e Kling, incluindo peças dirigidas por cena como um espírito de cobra branca derrotado na chuva.
  • Prompts de texto para ChatGPT, Claude e Gemini, cobrindo casos de uso de codificação, escrita, negócios e pesquisa.
  • Essa amplitude é a tese central. Se você está avaliando recursos de prompts para construir uma ferramenta, treinar um classificador ou apenas entender como são os bons prompts entre modalidades, uma lista de modelo único força você a coletar o resto sozinho. O conjunto de dados do Wikiprompt já tem tudo em um só lugar.

    Cada prompt vem com seu resultado, não apenas o texto

    Outra lacuna nas coleções de prompts espalhadas é que, geralmente, você só recebe o prompt. Você vê o texto, talvez um print colado em um tweet, e fica por sua conta julgar se realmente funciona.

    Cada registro no conjunto de dados do Wikiprompt carrega o texto do prompt junto com a mídia real que ele produziu, além de metadados estruturados: o modelo usado, proporção de aspecto, resolução, tags de estilo e uma avaliação editorial de qualidade (criatividade, utilidade, qualidade técnica e, para imagem/vídeo, aderência ao prompt e "fator uau"). Essa é a diferença entre uma lista de strings de prompt e um conjunto de dados que você pode realmente usar para estudar o que funciona. Você não está adivinhando se um prompt é bom; você pode ver a saída que ele gerou e como foi avaliado.

    Como se compara ao que mais existe por aí

    Raspar o X ou o Reddit em busca de prompts por conta própria significa lidar com limites de taxa, formatação inconsistente e posts que desaparecem. Produtos de "pacotes de prompts" pagos oferecem uma fatia selecionada, mas te trancam para fora do resto e raramente incluem a mídia gerada. Comunidades de modelo único são úteis, mas estruturalmente não conseguem responder perguntas entre modelos, como se um determinado estilo de enquadramento se traduz do Midjourney para o Kling.

    O conjunto de dados do Wikiprompt contorna esses três problemas: é gratuito, não é limitado a um modelo, e cada registro já vem com sua fonte original vinculada ao criador (o campo original_source), então a atribuição é incorporada, não um complemento.

    Obtendo os dados

    O manifesto está em o conjunto de dados, que retorna a contagem total de prompts, o esquema do registro e o esquema de paginação. O catálogo em si está em /dataset/prompts, paginado com um cursor de chave, até 500 registros por página:

    curl "https://www.wikiprompt.org/dataset/prompts?limit=500"

    Cada resposta inclui um URL next. Siga-o até que next retorne null e você terá o catálogo completo. Um loop de paginação mínimo se parece com isto:

    import requests

    url = "https://www.wikiprompt.org/dataset/prompts?limit=500"

    records = []

    while url:

    resp = requests.get(url).json()

    records.extend(resp["prompts"])

    url = resp.get("next")

    print(len(records), "prompts coletados")

    Sem chave de API, CORS habilitado, e tudo fica atrás do cache de borda da Vercel, então baixar o conjunto completo é rápido e não sobrecarrega o site ao vivo como a raspagem faria.

    Campos estruturados, não texto livre

    Cada registro inclui slug, url, title, description, content (o prompt em si), category, tags, media, model, metadata, author, original_source, created_at e updated_at. As categorias abrangem criativo, marketing, pessoal, produtividade, codificação, educação, negócios, pesquisa e outros, então filtrar por caso de uso é uma busca de campo, não um classificador de texto que você precisa treinar.

    Apenas prompts ativos e limpos entram na exportação, o que significa que você não está baixando spam, duplicatas ou rascunhos inacabados junto com o que importa.

    Se você precisar ao vivo em vez de em massa

    O conjunto de dados é para análise em massa. Se, em vez disso, você quiser consultar sob demanda, a API de busca retorna JSON para uma consulta ao vivo, o servidor MCP permite que um agente de IA pesquise e puxe prompts diretamente em uma conversa, e o llms.txt dá a qualquer LLM um mapa da estrutura do site. Todos os três apontam para o mesmo catálogo subjacente do conjunto de dados.

    Atribuição

    Cada prompt no Wikiprompt foi agregado de uma postagem pública de seu autor original. Ao reutilizar um prompt ou uma exportação do conjunto de dados em algo que você publicar, credite wikiprompt.org e o link original_source do registro de volta ao criador que o escreveu. Isso não é uma licença formal, é a cortesia básica da qual todo o catálogo depende.

    Se você tem costurado exemplos de prompts de tweets salvos e pacotes pagos, este é o atalho: um download, todas as modalidades, saídas reais anexadas, atualizado conforme o catálogo cresce.

    Tags
    open-data·dataset·ai-prompts·image-generation·video-generation·api