Lo que 55,000 indicaciones revelan sobre cómo las personas usan la IA
Una mirada a lo que puedes aprender al analizar el conjunto de datos público de Wikiprompt: qué modelos dominan, cómo difieren los prompts de imagen, video y texto, y cómo ejecutar tu propio análisis sobre el corpus.

hair Qué revelan 55,000 prompts sobre cómo usa la gente la IA
Cada prompt en Wikiprompt comenzó como una solicitud real que alguien hizo a un modelo real, y luego decidió que valía la pena compartirla. Multiplícalo por más de 55,000 y dejas de tener una lista de ejemplos para empezar a tener un corpus: un censo aproximado de cómo habla la gente con la IA cuando quiere algo específico de ella. Construimos el conjunto de datos para que cualquiera pudiera extraer todo ese corpus y buscar los patrones por sí mismo, en lugar de fiarse de nuestro resumen.
Esta entrada es ese resumen, pero planteado como una invitación. Todo lo que sigue es una hipótesis inicial, no un hallazgo que te pedimos que tomes como cierto. Los datos están en /dataset/prompts, son gratuitos y solo se necesitan unas diez líneas de código para extraerlos.
Qué contiene realmente un registro
Cada entrada del volcado incluye slug, url, title, description, content (el texto del prompt en sí), category, tags, media, model, un objeto metadata con campos estructurados como la relación de aspecto y el estilo, author, original_source y ambas marcas de tiempo. Con eso basta para ejecutar tres tipos de análisis sin tocar el sitio en vivo: análisis de texto sobre content y title, análisis categórico sobre category/tags/model/metadata, y análisis de series temporales sobre created_at si quieres ver cómo cambiaron la redacción o la elección de modelo a lo largo de la vida del catálogo.
El panorama de los modelos
Agrupa los registros por el campo model y obtienes algo parecido a una clasificación de lo que la gente usa de verdad, no de lo más nuevo o con más bombo. Los generadores de imagen y vídeo (Midjourney, GPT Image, Seedance, Veo, Kling, Nano Banana) conviven con los modelos de texto y razonamiento (Claude, GPT, Gemini, Grok) en la misma tabla, porque Wikiprompt no separa "prompts de chat" de "prompts de imagen" como productos distintos. Eso merece explorarse por sí solo: ¿un modelo determinado atrae una variedad de categorías más amplia o más reducida? ¿Ciertos modelos se agrupan en torno a ciertos estilos en metadata? Los campos metadata.model y metadata.style existen precisamente para que no tengas que usar expresiones regulares sobre el texto del prompt para responder a eso.
Imagen, vídeo y texto no están divididos de forma uniforme
metadata.media_type etiqueta cada registro como imagen, vídeo o texto, y la proporción entre los tres es ya una señal de dónde está ocurriendo la ingeniería de prompts más interesante ahora mismo. Los prompts de texto (prompts de sistema, personajes, plantillas estructuradas) tienden a ser más largos y con más andamiaje. Los de imagen se apoyan en un vocabulario visual denso condensado en una o dos frases. Los de vídeo, la porción más nueva y pequeña, se leen más como una lista de tomas, con el movimiento de cámara, la duración y el ritmo explicados explícitamente. Si intentas entender cómo difiere "prompting" como habilidad entre modalidades, filtrar el volcado por media_type antes de hacer nada más te ahorrará promediar tres disciplinas distintas.
Categorías y estilos, con ejemplos reales
El catálogo agrupa todo en nueve categorías (creativa, marketing, personal, productividad, programación, educación, negocios, investigación, otras), y la creativa es un buen sitio para ver el vocabulario de estilos en acción. Toma un póster editorial de fumar en blanco y negro minimalista: el prompt hace mucho con la contención, el espacio negativo y una tradición fotográfica concreta en lugar de acumular adjetivos. Compáralo con un retrato soberano de una criatura prehistórica, que se apoya en un lenguaje de mezcla de géneros (regio, mítico, soberano) para forzar un tono específico en el modelo, o un retrato de fantasía pastel de una mujer joven, que es casi por completo descripción de color e iluminación. Tres prompts, tres estrategias completamente distintas para conseguir especificidad en un modelo de imagen, y los tres están en la misma categoría creative. Las etiquetas y metadata.style son los campos que te permiten dividir "creativo" en algo más granular de lo que mostraría la categoría de primer nivel por sí sola.
Patrones de redacción que merece la pena buscar
Hay algunas cosas que merece la pena probar contra el corpus completo en lugar de fiarse de anécdotas: si ciertas construcciones iniciales (verbos imperativos, "eres un...", cláusulas que establecen la escena) se correlacionan con las puntuaciones de quality/assessment en los metadatos; si los prompts dirigidos a un modelo concreto usan un vocabulario distinto al de los que no mencionan modelo; si la co-ocurrencia de etiquetas revela categorías que se comportan de forma parecida aunque estén etiquetadas distinto (los prompts de marketing y negocios, por ejemplo, tienden a compartir muchas etiquetas). Nada de esto requiere nada más sofisticado que contar n-gramas y agrupar por campo. Es el tipo de conjunto de datos donde una tarde tranquila con pandas o una hoja de cálculo saca a la luz algo real.
Cómo extraerlo tú mismo
El manifiesto en el conjunto de datos te indica el recuento total, la forma de los registros y cómo funciona la paginación antes de que obtengas un solo registro. Los datos reales están paginados por claves, con hasta 500 registros por página:
curl "https://www.wikiprompt.org/dataset/prompts?limit=500"
Cada respuesta incluye una URL next; síguela hasta que next devuelva null. Un bucle mínimo sería así:
import requests
url = "https://www.wikiprompt.org/dataset/prompts?limit=500"
records = []
while url:
res = requests.get(url).json()
records.extend(res["records"])
url = res.get("next")
print(len(records), "prompts extraídos")
Sin clave de API, con CORS habilitado, y todo detrás de una caché perimetral, así que una extracción completa es rápida y no sobrecarga nuestros servidores. Si prefieres consultar en lugar de descargar todo, la API de búsqueda cubre consultas puntuales, y llms.txt documenta todo lo legible por máquina en un solo sitio.
Atribución y qué nos gustaría ver
Cada registro se remonta a un autor real a través de original_source, así que cualquier análisis, gráfico o artículo que salga de estos datos debería acreditar tanto a wikiprompt.org como a los creadores originales que agrega. No tenemos una licencia formal sobre los prompts subyacentes; somos el catálogo, no el titular de los derechos, y el conjunto de datos se ofrece en esas condiciones: libre de explorar, por favor atribuye.
Si ejecutas algo interesante sobre el corpus, desde un gráfico de adopción de modelos hasta una taxonomía de estilos o un estudio sobre cómo se correlaciona la longitud del prompt con las puntuaciones de calidad, queremos verlo. Cincuenta y cinco mil prompts son señal suficiente para decir algo real sobre cómo está usando la gente la IA ahora mismo, y la respuesta honesta es que nosotros tampoco hemos ejecutado todos los análisis posibles.
Related Articles
- Laya vs. Jev: Die Open-Source-Antwort auf die Entscheidungsmodell-Welle
Sep 22, 2026 · 5 min read
- Laya contre Jev : La réponse open-source à la vague des modèles de décision
Sep 22, 2026 · 5 min read
- Laya vs Jev: La respuesta de código abierto a la ola de modelos de decisión
Sep 22, 2026 · 5 min read
- Laya vs Jev: 오픈소스로 답하는 의사결정 모델 물결
Sep 22, 2026 · 5 min read
- लाया बनाम जेव: निर्णय-मॉडल लहर का ओपन-सोर्स उत्तर
Sep 22, 2026 · 5 min read