Blog›Guides

El conjunto de datos abiertos más grande de indicaciones de IA para imágenes y videos

El conjunto de datos público de Wikiprompt cubre más de 55,000 indicaciones de imagen, video y texto en GPT Image, Midjourney, Seedance, Veo, Kling, ChatGPT y más, cada una acompañada de su medio de resultado real y metadatos estructurados.

El conjunto de datos abiertos más grande de indicaciones de IA para imágenes y videos

El Mayor Conjunto de Datos Abierto de Prompts de Imagen y Video con IA

La mayoría de las colecciones de prompts que encuentras en línea cubren un modelo, un tipo de medio, y te dan una página para revisar manualmente. Una galería de prompts de Midjourney aquí, un gist de prompts de sistema de ChatGPT allá, un curso de pago que agrupa "50 prompts de Veo" detrás de una página de pago. Ninguna te permite trabajar realmente con los datos.

Wikiprompt es diferente de una manera que es fácil de explicar y vale la pena detallar: es un catálogo único y abierto de más de 55,000 prompts que abarca generación de imágenes, generación de video y texto, cubriendo los modelos que la gente usa realmente hoy en día, GPT Image, Midjourney, Seedance, Veo, Kling, Nano Banana, ChatGPT, Claude, Grok y más, y a partir de este mes todo es descargable como un conjunto de datos JSON simple. Sin inicio de sesión, sin clave de API, sin silos por modelo. Un solo feed.

La amplitud es el punto

La mayoría de los sitios de "biblioteca de prompts" eligen un camino. Una galería solo de Midjourney no puede decirte cómo difiere un prompt de Kling para el mismo concepto, y un repositorio de prompts de texto para ChatGPT no tiene nada que decir sobre la relación de aspecto o las etiquetas de estilo. El catálogo de Wikiprompt está organizado para que los prompts de imagen, video y texto vivan en el mismo esquema, navegables a través de la misma categoría de creativos y buscables a través de la misma API de búsqueda.

Concretamente, eso significa que puedes obtener:

  • Prompts de imagen para GPT Image, Midjourney, Nano Banana y herramientas similares, como un retrato fantástico en pastel o un póster de viaje en linograbado cortado a mano.
  • Prompts de video para Seedance, Veo y Kling, incluyendo piezas impulsadas por escenas como un espíritu de serpiente blanca derrotado bajo la lluvia.
  • Prompts de texto para ChatGPT, Claude y Gemini, cubriendo casos de uso de codificación, escritura, negocios e investigación.
  • Esa amplitud es toda la tesis. Si estás evaluando recursos de prompts para construir una herramienta, entrenar un clasificador, o simplemente entender cómo se ve un buen prompting entre modalidades, una lista de un solo modelo te obliga a ir a recopilar el resto por tu cuenta. El conjunto de datos de Wikiprompt ya lo tiene en un solo lugar.

    Cada prompt incluye su resultado, no solo su texto

    La otra brecha en las colecciones de prompts dispersas es que generalmente solo obtienes el prompt. Ves el texto, tal vez una captura de pantalla pegada en un tweet, y tienes que juzgar por tu cuenta si realmente funciona.

    Cada registro en el conjunto de datos de Wikiprompt lleva el texto del prompt junto con el medio real que produjo, más metadata estructurada: el modelo utilizado, la relación de aspecto, la resolución, las etiquetas de estilo y una evaluación editorial de calidad (creatividad, utilidad, calidad técnica y, para imagen/video, adherencia al prompt y "factor sorpresa"). Esa es la diferencia entre una lista de cadenas de prompts y un conjunto de datos que realmente puedes usar para estudiar qué funciona. No estás adivinando si un prompt es bueno, puedes ver el resultado que generó y cómo fue puntuado.

    Cómo se compara con lo que hay por ahí

    Hacer scraping de X o Reddit para obtener prompts por tu cuenta significa lidiar con límites de tasa, formato inconsistente y publicaciones que desaparecen. Los productos de "paquetes de prompts" de pago te dan una porción curada pero te bloquean el resto y rara vez incluyen el medio generado real. Las comunidades de un solo modelo son útiles pero estructuralmente no pueden responder preguntas entre modelos, como si un estilo de encuadre particular se traduce de Midjourney a Kling.

    El conjunto de datos de Wikiprompt evita los tres problemas: es gratuito, no está limitado a un modelo, y cada registro ya viene con su fuente original enlazada al creador (el campo original_source), por lo que la atribución está integrada en lugar de añadida después.

    Obteniendo los datos

    El manifiesto vive en el conjunto de datos, que devuelve el recuento total de prompts, el esquema de registros y el esquema de paginación. El catálogo real está en /dataset/prompts, paginado con un cursor de conjunto de claves, hasta 500 registros por página:

    curl "https://www.wikiprompt.org/dataset/prompts?limit=500"

    Cada respuesta incluye una URL next. Síguela hasta que next devuelva null y tendrás el catálogo completo. Un bucle de paginación mínimo se ve así:

    import requests

    url = "https://www.wikiprompt.org/dataset/prompts?limit=500"

    records = []

    while url:

    resp = requests.get(url).json()

    records.extend(resp["prompts"])

    url = resp.get("next")

    print(len(records), "prompts collected")

    Sin clave de API, CORS habilitado, y todo está detrás de la caché de borde de Vercel, por lo que obtener el conjunto completo es rápido y no pone carga en el sitio en vivo como lo haría el scraping.

    Campos estructurados, no texto libre

    Cada registro incluye slug, url, title, description, content (el prompt real), category, tags, media, model, metadata, author, original_source, created_at y updated_at. Las categorías abarcan creativo, marketing, personal, productividad, codificación, educación, negocios, investigación y otros, por lo que filtrar por caso de uso es una búsqueda de campo, no un clasificador de texto que tengas que entrenar tú mismo.

    Solo los prompts activos y limpios llegan a la exportación, lo que significa que no estás descargando spam, duplicados o borradores a medio terminar junto con lo real.

    Si lo necesitas en vivo en lugar de en masa

    El conjunto de datos es para análisis masivo. Si en cambio quieres consultar bajo demanda, la API de búsqueda devuelve JSON para una consulta en vivo, el servidor MCP permite que un agente de IA busque y obtenga prompts directamente dentro de una conversación, y llms.txt le da a cualquier LLM un mapa de la estructura del sitio. Los tres apuntan al mismo catálogo subyacente que el conjunto de datos.

    Atribución

    Cada prompt en Wikiprompt fue agregado de una publicación pública de su autor original. Cuando reutilices un prompt o una exportación del conjunto de datos en algo que publiques, acredita a wikiprompt.org y el enlace original_source del registro de vuelta al creador que lo escribió. Eso no es una licencia formal, es la cortesía básica de la que depende todo el catálogo.

    Si has estado uniendo ejemplos de prompts de tweets marcados y paquetes de pago, este es el atajo: una descarga, todas las modalidades, resultados reales adjuntos, actualizado a medida que el catálogo crece.

    Tags
    open-data·dataset·ai-prompts·image-generation·video-generation·api