Cómo descargar 55,000 prompts de IA (Gratis, sin scraping)
Una guía paso a paso para extraer el catálogo completo de Wikiprompt a través del endpoint público del conjunto de datos, siguiendo el cursor de paginación por conjunto de claves hasta que no quede nada, sin necesidad de scraping.

Cómo Descargar 55,000 Prompts de IA (Gratis, Sin Scraping)
Si alguna vez intentaste construir un dataset de prompts haciendo scraping de hilos de Twitter, capturando pantallas de servidores de Discord o paginando el HTML de un sitio web con un navegador headless, ya sabes lo frágil que es eso. Los selectores cambian, los límites de tasa aparecen, y la mitad de los "prompts" que recolectas resultan ser respuestas sobre el prompt, no el prompt en sí.
Wikiprompt acaba de eliminar la necesidad de todo eso. El catálogo, con más de 55,000 prompts de IA curados que abarcan generación de imagen, video y texto en modelos como Midjourney, GPT Image, Veo, Kling, Nano Banana y Claude, ahora está disponible como un dataset JSON plano que puedes paginar con curl. Sin clave de API, sin inicio de sesión, sin scraping. Esta publicación es el camino más rápido desde "quiero los datos" hasta un archivo local con 55,000 registros.
Paso 1: accede al manifiesto
Antes de extraer cualquier registro, revisa el manifiesto para que tu script sepa con qué está tratando:
curl "https://www.wikiprompt.org/dataset"
Esto devuelve un documento JSON pequeño que describe el dataset: total_prompts (el conteo actual, 55,000+), record_fields (el esquema a continuación) y el esquema de pagination. Trata este endpoint como la fuente de verdad para el total, no codifiques un número en tu pipeline.
Paso 2: extrae tu primera página
Los registros reales viven en /dataset/prompts. La paginación se basa en claves (un cursor, no números de página), lo que significa que se mantiene rápida y estable incluso en la página 200. El tamaño de página predeterminado es de 200 registros; puedes pedir hasta 500 a la vez:
curl "https://www.wikiprompt.org/dataset/prompts?limit=500"
La respuesta es un objeto JSON con una lista de registros y un campo next. next es una URL completa, lista para obtener tal cual, que lleva un cursor after apuntando al último registro que acabas de recibir. Cuando no queda nada por paginar, next es null. Ese único campo es toda tu condición de bucle.
Paso 3: sigue `next` hasta que sea null
Aquí está el bucle de paginación completo en Python. Escribe cada registro en un archivo local y se detiene solo:
import json
import time
import urllib.request
url = "https://www.wikiprompt.org/dataset/prompts?limit=500"
out = open("wikiprompt_dataset.jsonl", "w")
count = 0
while url:
with urllib.request.urlopen(url) as resp:
data = json.loads(resp.read())
for record in data["records"]:
out.write(json.dumps(record) + "\n")
count += 1
url = data.get("next")
time.sleep(0.2)
out.close()
print(f"Downloaded {count} prompts")
El mismo bucle en Node, si ese es tu stack:
let url = "https://www.wikiprompt.org/dataset/prompts?limit=500";
const fs = require("fs");
const out = fs.createWriteStream("wikiprompt_dataset.jsonl");
let count = 0;
while (url) {
const res = await fetch(url);
const data = await res.json();
for (const record of data.records) {
out.write(JSON.stringify(record) + "\n");
count++;
}
url = data.next;
}
console.log(Downloaded ${count} prompts);
Ejecuta cualquiera de los dos y aléjate. Cada respuesta está cacheada en el borde y habilitada con CORS (Access-Control-Allow-Origin: *), por lo que esto funciona desde un servidor, una consola del navegador, un notebook o una función serverless sin encabezados especiales. En una conexión normal, extraer todos los 55,000+ registros con limit=500 toma menos de un par de minutos.
Lo que realmente obtienes por registro
Cada objeto JSON en el dataset tiene la misma forma, que es lo que lo hace útil para algo más que una navegación puntual:
slug y url, la página canónica para ese prompt en wikiprompt.orgtitle y descriptioncontent, el texto del prompt real que copiarías en un modelocategory (creative, marketing, personal, productivity, coding, education, business, research, other) y tagsmedia, URLs de imagen o video cuando el prompt produjo salida visualmodel, el modelo de IA para el que se escribió o con el que se generó el promptmetadata, un bloque estructurado que cubre tipo de medio, relación de aspecto, estilo y una evaluación de calidadauthor y original_source, un enlace de vuelta al tweet o publicación original del que provino el promptcreated_at y updated_atEse campo content es el punto clave: es el texto del prompt listo para usar, no un resumen de él, que es lo que la mayoría de los datasets raspados hacen mal.
Algunos registros para mirar primero
En lugar de tomar el esquema como una fe ciega, abre algunas entradas reales. Titan: Engineering Blueprint of a Transforming Robot es un buen ejemplo de un prompt de imagen detallado con un bloque de metadatos completo. Data Physicalization muestra cómo se asignan category y tags para un prompt más conceptual y orientado al diseño. Y Pastel Fantasy Portrait of a Young Woman es un prompt compacto impulsado por estilo que vale la pena comparar con el campo style en sus metadatos. Extraer esos tres slugs de tu archivo JSONL local es una forma rápida de verificar tu parser antes de confiar en él con los 55,000.
Si prefieres consultar en lugar de descargar
El dataset masivo es para cuando quieres todo, localmente, una vez. Si solo necesitas una parte, la API de búsqueda responde consultas bajo demanda en JSON, el servidor MCP expone el mismo catálogo como herramientas para Claude y otros agentes, y llms.txt da a los rastreadores un mapa del sitio. La exportación del dataset y estos endpoints en vivo comparten los mismos datos subyacentes, por lo que cambiar entre ellos más tarde no te cuesta nada.
Una regla si reutilizas esto
Wikiprompt agrega prompts de publicaciones públicas de sus autores originales; no es el titular de los derechos de autor. Si publicas algo construido sobre este dataset, acredita a wikiprompt.org y el enlace original_source en los registros específicos que usaste. Esa es la única condición adjunta a todo esto.
Descárgalo, páginalo y construye algo. El manifiesto y el cursor next son las únicas dos cosas que necesitas recordar.
Related Articles
- Laya vs. Jev: Die Open-Source-Antwort auf die Entscheidungsmodell-Welle
Sep 22, 2026 · 5 min read
- Laya contre Jev : La réponse open-source à la vague des modèles de décision
Sep 22, 2026 · 5 min read
- Laya vs Jev: La respuesta de código abierto a la ola de modelos de decisión
Sep 22, 2026 · 5 min read
- Laya vs Jev: 오픈소스로 답하는 의사결정 모델 물결
Sep 22, 2026 · 5 min read
- लाया बनाम जेव: निर्णय-मॉडल लहर का ओपन-सोर्स उत्तर
Sep 22, 2026 · 5 min read