55,000个提示词揭示人们如何使用AI
分析Wikiprompt公开数据集能学到什么:哪些模型占主导地位,图像、视频和文本提示词有何不同,以及如何在该语料库上运行你自己的分析。

55,000条提示词揭示的人们如何使用AI
Wikiprompt上的每一条提示词都始于某个人向真实模型提出的真实请求,随后被认为值得分享。将其乘以55,000以上,你得到的就不再是一份示例列表,而是一个语料库:一份关于人们如何在与AI对话时提出具体需求的大致普查。我们构建了数据集,以便任何人都能拉取整个语料库并自行寻找模式,而不是只相信我们的总结。
这篇文章就是那份总结,但以邀请的形式呈现。以下所有内容都是起始假设,而非要求你盲目接受的研究发现。数据位于/dataset/prompts,完全免费,只需大约十行代码即可拉取。
记录中实际包含什么
转储中的每条记录都带有slug、url、title、description、content(提示词文本本身)、category、tags、media、model、一个包含结构化字段(如宽高比和风格)的metadata对象、author、original_source以及两个时间戳。这足以在不触碰实时网站的情况下运行三种不同类型的分析:对content和title进行文本分析,对category/tags/model/metadata进行分类分析,以及如果想知道措辞或模型选择在目录生命周期内如何变化,可以对created_at进行时间序列分析。
模型格局
按model字段分组记录,你会得到一个接近人们实际使用排行榜的结果,而不是最新或最热门的模型。图像和视频生成器(Midjourney、GPT Image、Seedance、Veo、Kling、Nano Banana)与文本和推理模型(Claude、GPT、Gemini、Grok)并排在同一张表中,因为Wikiprompt不将“聊天提示词”和“图像提示词”视为不同产品。这本身就值得探索:某个特定模型是否吸引更窄或更宽的类别分布?某些模型是否在metadata中围绕特定风格聚集?metadata.model和metadata.style字段的存在正是为了让你不必通过正则表达式匹配提示词文本来回答这些问题。
图像、视频和文本并非均匀分布
metadata.media_type将每条记录标记为图像、视频或文本,三者之间的比例本身就是关于当前有趣提示词工程发生在哪里的信号。文本提示词(系统提示词、角色设定、结构化模板)往往更长且更具框架性。图像提示词倾向于将密集的视觉词汇压缩在一两句中。视频提示词,作为最新且最小的部分,读起来更像镜头列表,明确写出摄像机运动、时长和节奏。如果你想理解“提示词编写”作为一种技能如何在不同模态间有所差异,在做其他事情之前先按media_type过滤转储数据,将避免你把三种不同学科混在一起取平均值。
类别和风格,附真实示例
目录将所有内容分为九个类别(创意、营销、个人、生产力、编程、教育、商业、研究、其他),而创意类别是观察风格词汇运用的好地方。以一张极简黑白编辑风格吸烟海报为例:提示词通过克制、留白和指定的摄影传统来发挥大量作用,而不是堆砌形容词。将其与一幅史前生物君主肖像相比,后者依赖类型混搭语言(威严、神话、君主)来迫使模型产生特定基调,或者一幅年轻女性的粉彩幻想肖像,几乎完全是色彩和光线描述。三条提示词,三种完全不同的策略来从图像模型获得具体性,而它们都位于同一个category: creative桶中。标签和metadata.style是让你将“创意”拆分为比顶层类别更细粒度的字段。
值得寻找的措辞模式
有几件事值得针对完整语料库进行测试,而不是仅凭轶事信任:某些开头结构(祈使动词、“你是……”、场景设定从句)是否与元数据中的quality/assessment评分相关;针对特定命名模型的提示词是否使用与模型无关的提示词不同的词汇;标签共现是否揭示了行为相似但标签不同的类别(例如,营销和商业提示词往往共享大量标签)。这些都不需要比统计n-gram和按字段分组更复杂的方法。这是一种数据集,花一个下午用pandas或电子表格就能发现真实的东西。
自行拉取
数据集处的清单会在你获取任何单条记录之前告诉你总数、记录形状以及分页方式。实际数据采用键集分页,每页最多500条记录:
curl "https://www.wikiprompt.org/dataset/prompts?limit=500"
每个响应都包含一个next URL;跟随它直到next返回null。一个最小循环如下所示:
import requests
url = "https://www.wikiprompt.org/dataset/prompts?limit=500"
records = []
while url:
res = requests.get(url).json()
records.extend(res["records"])
url = res.get("next")
print(len(records), "prompts pulled")
无需API密钥,CORS已启用,整个系统位于边缘缓存之后,因此完整拉取速度快且不依赖我们的服务器。如果你更愿意查询而不是批量下载,搜索API覆盖临时查询,而llms.txt在一个地方记录所有机器可读的内容。
归属,以及我们希望看到的
每条记录都通过original_source追溯到真实作者,因此从这些数据中产生的任何分析、图表或文章都应同时注明wikiprompt.org及其聚合的原始创作者。我们对底层提示词不持有正式许可证;我们是目录,而非版权持有者,数据集在此基础上提供:免费探索,请注明出处。
如果你在语料库上运行了有趣的内容,从模型采用图表到风格分类法,再到提示词长度与质量评分相关性的研究,我们都想看到。五万五千条提示词足以说出关于人们当前实际如何使用AI的真实内容,而诚实的答案是,我们自己也没有对全部数据运行过每项分析。
Related Articles
- Laya vs. Jev: Die Open-Source-Antwort auf die Entscheidungsmodell-Welle
Sep 22, 2026 · 5 min read
- Laya contre Jev : La réponse open-source à la vague des modèles de décision
Sep 22, 2026 · 5 min read
- Laya vs Jev: La respuesta de código abierto a la ola de modelos de decisión
Sep 22, 2026 · 5 min read
- Laya vs Jev: 오픈소스로 답하는 의사결정 모델 물결
Sep 22, 2026 · 5 min read
- लाया बनाम जेव: निर्णय-मॉडल लहर का ओपन-सोर्स उत्तर
Sep 22, 2026 · 5 min read