)ruindo um App de IA no Dataset do Wikipédia
Um passo a passo para desenvolvedores sobre como construir uma interface de busca de prompts, um bot de prompt do dia, uma extensão de navegador ou um bot do Discord sobre o conjunto de dados público de mais de 55.000 prompts da Wikiprompt, com código de ingestão e notas de atribuição.

Construindo uma App de IA no Dataset de Wikiprompt
Todo hacker independente que tentou construir uma app de "biblioteca de prompts" bate na mesma parede no primeiro dia: você precisa de conteúdo inicial, e fazer scraping é lento, frágil, e indelicado para o servidor de quem você está acessando. O Wikiprompt acaba de remover essa parede. O catálogo completo, com mais de 55.000 prompts que cobren ChatGPT, Claude, Gemini, Midjourney, GPT Image, Veo, Kling, Seedance, Nano Banana, Grok e outros, está agora disponível como um dataset público em lote. Sem chave, sem danza de rate-limit, sem scraping. Só JSON.
Este post é um registro de construção, não um comunicado de prensa. Quatro apps pequenas que você poderia lançar neste fim de semana, e a canalização exata para chegar lá.
O que você está realmente trabalhando
Acesse o manifest primeiro:
curl "https://www.wikiprompt.org/dataset"
Ele retorna total_prompts, os record_fields que você pode esperar em cada linha, e o esquema de paginação. Os dados reais estão em /dataset/prompts, paginados com um cursor de keyset: cada página te dá uma URL next, você a segue até que next retorne null. Até 500 registros por página.
curl "https://www.wikiprompt.org/dataset/prompts?limit=500"
Cada registro é um objeto pequeno e útil: slug, url, title, description, content (o texto real do prompt que você colaria em um modelo), category, tags, media (URLs de imagem/vídeo quando o prompt produjo um), model (para o que foi construído ou executado), metadata (campos estruturados como tipo de media, proporção de aspecto, estilo, e uma avaliação de qualidade), author, original_source (o tweet ou post original de onde veio), e timestamps. Isso é suficiente para construir uma UI real sem uma única chamada de API extra.
Aquí está o loop completo de ingestão em Python, talvez 15 linhas para um cache local SQLite:
import requests, sqlite3
db = sqlite3.connect("wikiprompt.db")
db.execute("""create table if not exists prompts(
slug text primary key, title text, description text,
content text, category text, model text, url text)""")
url = "https://www.wikiprompt.org/dataset/prompts?limit=500"
while url:
data = requests.get(url).json()
for p in data["records"]:
db.execute(
"insert or replace into prompts values (?,?,?,?,?,?,?)",
(p["slug"], p["title"], p["description"],
p["content"], p["category"], p.get("model"), p["url"]),
)
db.commit()
url = data.get("next")
Execute isso uma vez, e você tem uma cópia local e consultable de todo o catálogo. CORS está aberto (Access-Control-Allow-Origin: *) e as respostas são cacheadas na borda, então isso é amigable para executar desde um navegador também, não só desde um job de backend.
Quatro coisas que valem a pena construir
Uma UI de busca de prompts. O dataset te dá category, tags, model e metadata de forma gratuita, o que significa que a busca facetada é basicamente uma cláusula SQL WHERE: "prompts de Midjourney etiquetados como retrato" ou "prompts de código para Claude" se resolvem com um filtro, não com um projeto de pesquisa. Se você não quer construir o índice você mesmo, wikiprompt já tem um: a API de busca aceita ?q= e retorna JSON ranqueado, suficientemente bom para prototipar uma caixa de busca antes de escrever uma única linha de código de recuperação.
category=creative para um feed temático), publica title + content + a url de volta à origem. O campo media significa que você pode anexar a imagem ou vídeo de saída real à publicação, não só texto. Isso é talvez 40 linhas de código e funciona igualmente bem como bot de Slack, bot de Telegram, ou um cron que publica em X.content. Como os dados são locais após a sincronização inicial, isso funciona offline e instantáneamente, sem round-trip de rede por tecla./prompt image midjourney, filtra seu cache por category e model, responde com title, content, e a media como embed. Se alguém quer ver o original, linka original_source no footer, isso é a atribución coberta na mesma mensagem.Usando o campo metadata de verdade
metadata é onde vive o interessante para qualquer coisa relacionada a media: tamanho de aspecto, etiquetas de estilo, uma avaliação de qualidade. Se você está construendo algo que ranquea ou recomenda prompts (em vez de só listarlos), este é seu sinal. Um filtro de "melhores prompts de Midjourney para retratos, proporção 3:4, alta qualidade" é um par de cláusulas WHERE extras uma vez que você tenha ingerido o campo, sem pipeline de scoring separado.
Para um gostinho de como é um registro de prompt bom de ponta a ponta, navega algumas páginas ao vivo: um prompt de imagem de data physicalization, uma transformação de personagem arácnido futurista, e um design de personagem de viajante nómada misterioso. Cada um desses é um registro completo no dataset também, os mesmos campos, o mesmo content que você copiaría em um modelo.
A atribución não é opcional, e também não é difícil
Wikiprompt agrega prompts de publicações públicas de seus autores originais; não é o detentor da licencia, é o bibliotecario. Se sua app mostra um prompt, mostre original_source junto a ele e credite wikiprompt.org como de onde você obtuvo o catálogo. Isso é o acordo, e o dataset torna trivial honrá-lo porque original_source já está aí em cada registro. Não o elimine durante a ingestão só porque seu esquema ainda não tem uma columna para isso.
Se você prefere não executar seu próprio índice
Existen três opciones dependendo de cuánta infraestructura quieras poseer. Ejecuta el dataset masivo a través de tu propia capa de búsqueda/recomendación si quieres control total. Llama la API de búsqueda directamente si solo necesitas resultados, no un pipeline. O, si estás construyendo un agente en lugar de una app, apúntalo al servidor MCP, que expone búsqueda, categorías y prompts individuales como herramientas que Claude y otros agentes pueden llamar de forma nativa. También hay llms.txt si quieres que un modelo entienda toda la superficie en una sola descarga.
Empieza aquí
curl "https://www.wikiprompt.org/dataset/prompts?limit=500" | head -c 2000
Mira lo que viene de vuelta, elige una de las cuatro ideas anteriores, y tendrás algo funcionando antes de que el café se enfríe. La parte difícil, más de 55.000 prompts curados en una docena de modelos, ya está hecha. Lo que construyas con eso es la parte divertida.
Related Articles
- Laya vs. Jev: Die Open-Source-Antwort auf die Entscheidungsmodell-Welle
Sep 22, 2026 · 5 min read
- Laya contre Jev : La réponse open-source à la vague des modèles de décision
Sep 22, 2026 · 5 min read
- Laya vs Jev: La respuesta de código abierto a la ola de modelos de decisión
Sep 22, 2026 · 5 min read
- Laya vs Jev: 오픈소스로 답하는 의사결정 모델 물결
Sep 22, 2026 · 5 min read
- लाया बनाम जेव: निर्णय-मॉडल लहर का ओपन-सोर्स उत्तर
Sep 22, 2026 · 5 min read