)ruyendo una aplicación de IA con el conjunto de datos de Wikiprompt
Una guía para desarrolladores sobre cómo construir una interfaz de búsqueda de prompts, un bot de prompt del día, una extensión de navegador o un bot de Discord sobre el conjunto de datos público de más de 55,000 prompts de Wikiprompt, con código de ingesta y notas de atribución.

Construyendo una App de IA con el Dataset de Wikiprompt
Todo hacker independiente que ha intentado construir una app de "biblioteca de prompts" se topa con la misma pared desde el primer día: necesitas contenido semilla, y el scraping es lento, frágil, y grosero con el servidor al que estás golpeando. Wikiprompt acaba de eliminar esa pared. Todo el catálogo, más de 55,000 prompts que abarcan ChatGPT, Claude, Gemini, Midjourney, GPT Image, Veo, Kling, Seedance, Nano Banana, Grok y más, ahora está disponible como un dataset público masivo. Sin clave, sin baile de límites de tasa, sin scraping. Solo JSON.
Este post es un registro de construcción, no un comunicado de prensa. Cuatro apps pequeñas que podrías lanzar este fin de semana, y la plomería exacta para llegar ahí.
Con qué estás trabajando realmente
Accede primero al manifiesto:
curl "https://www.wikiprompt.org/dataset"
Devuelve total_prompts, los record_fields que puedes esperar en cada fila, y el esquema de paginación. Los datos reales viven en /dataset/prompts, paginados con un cursor de keyset: cada página te entrega una URL next, la sigues hasta que next devuelva null. Hasta 500 registros por página.
curl "https://www.wikiprompt.org/dataset/prompts?limit=500"
Cada registro es un objeto pequeño y útil: slug, url, title, description, content (el texto del prompt real que pegarías en un modelo), category, tags, media (URLs de imagen/video cuando el prompt produjo uno), model (para qué fue construido o ejecutado), metadata (campos estructurados como tipo de medio, relación de aspecto, estilo, y una evaluación de calidad), author, original_source (el tweet o post original del que proviene), y marcas de tiempo. Eso es suficiente para construir una UI real sin una sola llamada API adicional.
Aquí está el bucle completo de ingesta en Python, quizás 15 líneas hasta una caché local de SQLite:
import requests, sqlite3
db = sqlite3.connect("wikiprompt.db")
db.execute("""create table if not exists prompts(
slug text primary key, title text, description text,
content text, category text, model text, url text)""")
url = "https://www.wikiprompt.org/dataset/prompts?limit=500"
while url:
data = requests.get(url).json()
for p in data["records"]:
db.execute(
"insert or replace into prompts values (?,?,?,?,?,?,?)",
(p["slug"], p["title"], p["description"],
p["content"], p["category"], p.get("model"), p["url"]),
)
db.commit()
url = data.get("next")
Ejecuta eso una vez, y tienes una copia local y consultable de todo el catálogo. CORS está completamente abierto (Access-Control-Allow-Origin: *) y las respuestas están cacheadas en el borde, así que esto es amigable para ejecutar desde un navegador también, no solo desde un trabajo de backend.
Cuatro cosas que valen la pena construir
Una UI de búsqueda de prompts. El dataset te da category, tags, model y metadata gratis, lo que significa que la búsqueda facetada es básicamente una cláusula WHERE de SQL: "prompts de Midjourney etiquetados como retrato" o "prompts de codificación para Claude" se resuelven con un filtro, no con un proyecto de investigación. Si no quieres construir el índice tú mismo, wikiprompt ya tiene uno: la API de búsqueda toma ?q= y devuelve JSON clasificado, lo suficientemente bueno para prototipar un cuadro de búsqueda antes de escribir una sola línea de código de recuperación.
Un bot de "prompt del día". Trabajo de cron, elige una fila aleatoria de tu caché local (o filtra por category=creative para un feed temático), publica title + content + la url de vuelta al origen. El campo media significa que puedes adjuntar la imagen o video de salida real al post, no solo texto. Esto son quizás 40 líneas de código y funciona igual de bien como bot de Slack, bot de Telegram, o un cron que publica en X.
Una extensión de navegador. Clic derecho en cualquier campo de texto, "insertar un prompt," busca en tu caché local por categoría o modelo, pega content. Dado que los datos son locales después de la sincronización inicial, esto funciona sin conexión e instantáneamente, sin round-trip de red por cada tecla.
Un bot de Discord. Comando de barra /prompt image midjourney, filtra tu caché por category y model, responde con title, content, y el medio como un embed. Si alguien quiere ver el original, enlaza original_source en el pie de página, eso cubre la atribución en el mismo mensaje.
Usando el campo metadata de verdad
metadata es donde vive lo interesante para cualquier cosa relacionada con medios: relación de aspecto, etiquetas de estilo, una evaluación de calidad. Si estás construyendo algo que clasifica o recomienda prompts (en lugar de solo listarlos), esta es tu señal. Un filtro de "mejores prompts de Midjourney para retratos, relación de aspecto 3:4, puntaje de calidad alto" es un par de cláusulas WHERE adicionales una vez que has ingerido el campo, sin pipeline de puntuación separado requerido.
Para una muestra de cómo se ve un buen registro de prompt de principio a fin, navega por algunas páginas en vivo: un prompt de imagen de fisicalización de datos, una transformación de personaje arácnido futurista, y un diseño de personaje de viajero nómada misterioso. Cada uno de esos es un registro completo en el dataset también, mismos campos, mismo content que copiarías en un modelo.
La atribución no es opcional, y tampoco es difícil
Wikiprompt agrega prompts de posts públicos de sus autores originales; no es el titular de la licencia, es el bibliotecario. Si tu app muestra un prompt, muestra original_source junto a él y acredita wikiprompt.org como la fuente del catálogo. Ese es el trato, y el dataset lo hace trivial de honrar ya que original_source ya está ahí en cada registro. No lo elimines durante la ingesta solo porque tu esquema aún no tiene una columna para ello.
Si prefieres no ejecutar tu propio índice
Existen tres opciones dependiendo de cuánta infraestructura quieras poseer. Ejecuta el dataset masivo a través de tu propia capa de búsqueda/recomendación si quieres control total. Llama a la API de búsqueda directamente si solo necesitas resultados, no un pipeline. O, si estás construyendo un agente en lugar de una app, apúntalo a el servidor MCP, que expone búsqueda, categorías, y prompts individuales como herramientas que Claude y otros agentes pueden llamar de forma nativa. También hay llms.txt si quieres que un modelo entienda toda la superficie en una sola búsqueda.
Empieza aquí
curl "https://www.wikiprompt.org/dataset/prompts?limit=500" | head -c 2000
Mira lo que devuelve, elige una de las cuatro ideas anteriores, y tendrás algo funcionando antes de que el café se enfríe. La parte difícil, más de 55,000 prompts curados en una docena de modelos, ya está hecha. Lo que construyas con eso es la parte divertida.
Related Articles
- Laya vs. Jev: Die Open-Source-Antwort auf die Entscheidungsmodell-Welle
Sep 22, 2026 · 5 min read
- Laya contre Jev : La réponse open-source à la vague des modèles de décision
Sep 22, 2026 · 5 min read
- Laya vs Jev: La respuesta de código abierto a la ola de modelos de decisión
Sep 22, 2026 · 5 min read
- Laya vs Jev: 오픈소스로 답하는 의사결정 모델 물결
Sep 22, 2026 · 5 min read
- लाया बनाम जेव: निर्णय-मॉडल लहर का ओपन-सोर्स उत्तर
Sep 22, 2026 · 5 min read