Blog›Guides

statementunciando el dataset abierto de prompts de Wikipedia: más de 55,000 prompts de IA, gratis

Wikiprompt acaba de abrir su catálogo completo como un conjunto de datos gratuito, estructurado y sin necesidad de clave, con más de 55,000 prompts de IA, listo para obtener en una sola línea en lugar de hacer scraping del sitio.

statementunciando el dataset abierto de prompts de Wikipedia: más de 55,000 prompts de IA, gratis

Anuncio del Dataset Abierto de Prompts de Wikiprompt: Más de 55,000 Prompts de IA, Gratis

Hoy estamos abriendo todo el catálogo de Wikiprompt. Cada prompt que hemos curado en ChatGPT, Claude, Gemini, GPT Image, Midjourney, Seedance, Veo, Kling, Nano Banana, Grok y más ahora está disponible como un dataset público, estructurado y gratuito. Sin registro, sin clave API, sin necesidad de scraping.

Si alguna vez quisiste un corpus real de prompts de IA funcionales, del tipo que otras personas realmente usaron y obtuvieron resultados, en lugar de una lista extraída de un blog al azar, este es ese corpus. Más de 55,000 prompts, cada uno con su registro completo: título, descripción, el texto real del prompt, categoría, etiquetas, medios, el modelo para el que fue escrito, metadatos estructurados de calidad, autor y un enlace de vuelta a la publicación original de donde proviene.

Por qué estamos haciendo esto

Wikiprompt siempre ha funcionado como una wiki: la gente envía prompts, nosotros los curamos y organizamos, y el resultado se convierte en una referencia pública que cualquiera puede explorar gratis. Eso funcionó bien como sitio web. No funcionó tan bien para las personas que querían *construir* algo con los datos: entrenar con ellos, analizarlos, extraer patrones, alimentarlos en sus propias herramientas. Su única opción era hacer scraping de wikiprompt.org página por página, lo cual es lento, frágil e innecesariamente pesado para nuestros servidores.

Así que estamos haciendo lo que Wikipedia hizo hace décadas: publicar el volcado. En lugar de hacer scraping, descargas. En lugar de parsear HTML, obtienes JSON. Todo el catálogo, en un formato predecible, actualizado a medida que el catálogo crece.

Qué contiene realmente

Comienza en el dataset. Ese endpoint es el manifiesto: te dice total_prompts, los record_fields que puedes esperar en cada registro y cómo funciona la paginación. El contenido real vive en /dataset/prompts, que devuelve el catálogo en sí como JSON.

Cada registro incluye:

  • slug y url, la página canónica para ese prompt
  • title y description
  • content, el texto real del prompt que copiarías y usarías
  • category y tags
  • media, cualquier URL de imagen o video de ejemplo
  • model, el modelo de IA para el que fue escrito o probado el prompt
  • metadata, detalles estructurados como tipo de medio, relación de aspecto, estilo y una evaluación de calidad
  • author y original_source, un enlace de vuelta al tweet o publicación original
  • created_at y updated_at
  • Solo los prompts activos y limpiados pasan el corte, el mismo estándar editorial que aplicamos al sitio en vivo. Las categorías abarcan creativo, marketing, personal, productividad, programación, educación, negocios, investigación y otros, así que hay un rango real aquí, no solo un nicho.

    Para hacerlo concreto: el dataset es cómo un prompt como este prompt de póster editorial fumador o un prompt de póster de viaje linocut cortado a mano termina como una fila de JSON estructurado en lugar de solo una página que tendrías que visitar y copiar a mano. También lo hace un prompt etéreo de fotografía de retrato de la dinastía Tang, y todos los demás prompts del catálogo.

    Cómo obtenerlo en una línea

    Esta es la parte que más nos entusiasma: no hay configuración. Un solo comando curl te da una página de registros reales ahora mismo.

    curl "https://www.wikiprompt.org/dataset/prompts?limit=500"

    Eso es todo. Sin clave en el encabezado, sin baile de autenticación. CORS está completamente abierto (Access-Control-Allow-Origin: *), así que también puedes llamarlo directamente desde un navegador o una aplicación del lado del cliente. También está fuertemente cacheado en el borde, lo que significa que es rápido para ti y barato para nosotros, una combinación rara.

    El dataset está paginado con un cursor de conjunto de claves en lugar de números de página, lo que lo mantiene estable incluso cuando se agregan nuevos prompts a mitad del rastreo. Cada respuesta incluye una URL next; sigue siguiéndola hasta que next devuelva null. Puedes solicitar hasta 500 registros por página con limit, o tomar el valor predeterminado de 200. Un bucle mínimo se ve así:

    import requests

    url = "https://www.wikiprompt.org/dataset/prompts?limit=500"

    prompts = []

    while url:

    data = requests.get(url).json()

    prompts.extend(data["results"])

    url = data.get("next")

    print(len(prompts), "prompts fetched")

    Ejecuta eso y tendrás el catálogo completo en memoria en unos minutos.

    Una nota sobre la atribución

    Cada prompt en este dataset fue agregado de una publicación pública de su autor original. Wikiprompt cura y estructura el catálogo, pero no tenemos una licencia formal sobre el contenido en sí. Si construyes algo con este dataset, publicas investigación sobre él o reutilizas prompts individuales, por favor acredita wikiprompt.org como la fuente y, donde importe, el enlace original_source en el registro específico que estás usando. Esa es toda la petición.

    Más allá del volcado

    El dataset es la opción masiva, pero no es la única vía de acceso. Si solo necesitas responder una sola pregunta, la API de búsqueda devuelve JSON para cualquier consulta sin descargar todo el catálogo. Si estás construyendo un agente de IA, el servidor MCP expone búsqueda, recuperación y envío como herramientas que Claude y otros agentes pueden llamar directamente. Y llms.txt le da a cualquier LLM un mapa rápido de lo que hay aquí y cómo usarlo.

    Construimos Wikiprompt para ser una referencia pública de cómo la gente está usando realmente estos modelos hoy. Abrir el dataset es tomar esa idea en serio: todo el catálogo debería ser tan fácil de obtener como de explorar. Ve a buscarlo y mira qué construyes.

    Tags
    open-data·dataset·ai-prompts·api·download·announcement