O que 55.000 Prompts Revelam Sobre Como as Pessoas Usam IA
Uma olhada no que você pode aprender analizando o dataset público de Wikiprompt: quais modelos dominam, como prompts de imagem, vídeo e texto diferem, e como executar sua própria análise sobre o corpus.

O Que 55.000 Prompts Revelam Sobre Como as Pessoas Usam IA
Cada prompt no Wikiprompt começou como uma solicitação real que alguém fez a um modelo real e depois decidiu que valia a pena compartilhar. Multiplique isso por 55.000+ e você deixa de ter uma lista de exemplos e passa a ter um corpus: um censo aproximado de como as pessoas realmente falam com IA quando querem algo específico dela. Nós construimos o dataset para que qualquer pessoa pudesse baixar todo esse corpus e procurar os padrões por conta própria, em vez de confiar no nosso resumo.
Este post é esse resumo, mas apresentado como um convite. Tudo abaixo é uma hipótesis inicial, não uma conclusão que pedimos que você aceite por fé. Os dados estão em /dataset/prompts, são gratuitos, e bastan cerca de dez linhas de código para baixarlos.
O que realmente está em um registro
Cada entrada no dump carrega slug, url, title, description, content (o texto do prompt em si), category, tags, media, model, um objeto metadata com campos estruturados como aspect ratio e style, author, original_source, e ambos timestamps. Isso é suficiente para executar três tipos diferentes de análise sem tocar o site ao vivo: análise de texto em content e title, análise categórica em category/tags/model/metadata, e análise de séries temporales em created_at se você quiser ver como a fraseologia ou a escolha de modelo mudou ao longo da vida do catálogo.
O panorama dos modelos
Agrupe os registros pelo campo model e você obtiene algo parecido a um ranking do que as pessoas realmente estão usando, não do que é mais novo ou mais hype. Generadores de imagem e vídeo (Midjourney, GPT Image, Seedance, Veo, Kling, Nano Banana) ficam ao lado de modelos de texto e raciocínio (Claude, GPT, Gemini, Grok) na mesma tabela, porque o Wikipédia não separa "prompts de chat" de "prompts de imagem" como produtos diferentes. Isso vale a pena explorar por conta própria: um modelo dado atrae uma gama mais estreita ou mais ampla de categorias? Certos modelos se agrupam em torno de certos estilos em metadata? Os campos metadata.model e metadata.style existem justamente para que você não tenha que usar regex no texto do prompt para responder isso.
Imagem, vídeo e texto não estão divididos de forma uniforme
metadata.media_type etiqueta cada registro como imagem, vídeo ou texto, e a proporção entre os três é em si um sinal sobre onde está ocorrendo a engeniería de prompts mais interessante agora. Prompts de texto (system prompts, personas, templates estruturados) tendem a ser mais longos e mais estruturados. Prompts de imagem se apoiam em um vocabulário visual denso embalado em uma ou duas frases. Prompts de vídeo, a parte mais nova e menor, se leem mais como listas de tomas, com movimento de cámara, duração e ritmo explicitamente especificados. Se você tenta entender como "prompting" como habilidade difiere entre modalidades, filtrar o dump por media_type antes de fazer qualquer outra coisa te salvará de promediar três disciplinas diferentes juntas.
Categorias e estilos, com exemplos reais
O catálogo agrupa tudo em nove categorias (creative, marketing, personal, productivity, coding, education, business, research, other), e creative é um bom lugar para ver o vocabulário de estilo em ação. Tome um póster editorial minimalista em preto e branco sobre fumar: o prompt está fazendo muito trabalho com contenção, espaço negativo e uma tradição fotográfica nomeada, em vez de acumular adjetivos. Compare isso com um retrato soberano de criatura préhistórica, que se apoia em linguagem de mashup de gêneros (regal, mythic, sovereign) para forzar um tono específico do modelo, ou um retrato de fantasia pastel de uma jovem mulher, que é quase inteiramente descrição de cor e iluminación. Tres prompts, tres estrategias completamente diferentes para obter especificidad de um modelo de imagem, e todos os três estão no mesmo balde category: creative. Tags e metadata.style são os campos que permiten dividir "creative" em algo mais granular do que a categoria de nível superior mostraría sozinha.
Padrones de frase que valem a pena buscar
Algunas coisas valem a pena testar contra o corpus completo em vez de confiar anecdotamente: se certas construções de abertura (verbos imperativos, "you are a...", cláusulas de ambientação) correlacionam com os scores de quality/assessment em metadata; se prompts que apuntan a un modelo específico nomeado usan vocabulário diferente que os agnósticos de modelo; se a co-ocurrencia de tags revela categorías que se comportan como si fueran similares aunque estén etiquetadas de forma diferente (marketing e business, por ejemplo, tendem a compartir muchas tags). Nada de esto requiere nada más sofisticado que contar n-gramas y agrupar por campo. Es el tipo de dataset donde una tarde lenta con pandas o una hoja de cálculo descubre algo real.
Baixando você mesmo
O manifest em the dataset te dice el total de registros, la forma de los registros y cómo funciona la paginación antes de que descargues un solo registro. Los datos reales están paginados por keyset, con hasta 500 registros por página:
curl "https://www.wikiprompt.org/dataset/prompts?limit=500"
Cada respuesta incluye una URL next; síguela hasta que next devuelva null. Un bucle mínimo se ve así:
import requests
url = "https://www.wikiprompt.org/dataset/prompts?limit=500"
records = []
while url:
res = requests.get(url).json()
records.extend(res["records"])
url = res.get("next")
print(len(records), "prompts pulled")
No se necesita API key, CORS está habilitado, y todo está detrás de una caché de borde, así que una descarga completa es rápida y no sobrecarga nuestros servidores. Si prefieres consultar en lugar de descargar en masa, la API de búsqueda cubre consultas ad hoc, y llms.txt documenta todo lo legible por máquina en un solo lugar.
Atribución, y lo que nos gustaría ver
Cada registro se remonta a un autor real a través de original_source, así que cualquier análisis, gráfico o informe que salga de estos datos debe acreditar tanto a wikiprompt.org como a los creadores originales que agrega. No tenemos una licencia formal sobre los prompts subyacentes; somos el catálogo, no el titular de los derechos de autor, y el dataset se ofrece sobre esa base: libre de explorar, por favor atribuye.
Si ejecutas algo interesante sobre el corpus, desde un gráfico de adopción de modelos hasta una taxonomía de estilos o un estudio de cómo la longitud del prompt se correlaciona con los scores de calidad, queremos verlo. Cincuenta y cinco mil prompts son suficiente señal para decir algo real sobre cómo las personas están usando IA en este momento, y la respuesta honesta es que nosotros tampoco hemos ejecutado todos los análisis sobre ello.
Related Articles
- Laya vs. Jev: Die Open-Source-Antwort auf die Entscheidungsmodell-Welle
Sep 22, 2026 · 5 min read
- Laya contre Jev : La réponse open-source à la vague des modèles de décision
Sep 22, 2026 · 5 min read
- Laya vs Jev: La respuesta de código abierto a la ola de modelos de decisión
Sep 22, 2026 · 5 min read
- Laya vs Jev: 오픈소스로 답하는 의사결정 모델 물결
Sep 22, 2026 · 5 min read
- लाया बनाम जेव: निर्णय-मॉडल लहर का ओपन-सोर्स उत्तर
Sep 22, 2026 · 5 min read