用于研究:引用Wikiprompt语料库
面向研究人员、学生和记者的指南,介绍如何可重复地获取Wikiprompt数据集、正确标注其来源,并理解其作为经过策划、持续演进的聚合语料库的局限性。

使用并引用Wikiprompt语料库进行研究
提示工程以规模化方式生成文本,而规模化文本正是研究人员、学生和记者喜欢研究的内容。针对不同模型的图像提示中,哪些措辞模式反复出现?创意提示与编程或生产力提示在结构上有何不同?这些问题都可以回答,但前提是有一个语料库作为对照,而在此之前,这个语料库分散在各个社交媒体账户的时间线上,未被索引,实际上无法研究。
Wikiprompt在过去几个月里整理了这样一类集合:从开放网络抓取的公开、用户提交的AI提示,经过组织和标记。该目录现拥有超过55,000条提示,涵盖ChatGPT、Claude和Gemini等文本模型,以及Midjourney、GPT Image、Seedance、Veo、Kling和Nano Banana等图像或视频模型。该语料库作为公开批量数据集提供,本文是一份指南,介绍如何在学术或新闻工作中负责任地使用它:如何可复现地拉取数据、如何标注来源,以及其局限性在哪里。
为什么选择这个语料库
研究领域中流传的大多数提示数据集,要么是手工收集的小样本,要么是来源不明的抓取快照。Wikiprompt在三个方面有所不同。
首先,每条记录都追溯到真实、可归因的来源:original_source字段链接到原始帖子,author字段标明撰写者姓名。这是一个经过整理的、真实公开提示分享活动的索引,而非合成或匿名数据集。
其次,它在记录间是结构化且可比较的。每条提示都有category(创意、营销、个人、生产力、编程、教育、商业、研究或其他)、tags、model字段(指明目标AI系统),以及适用的metadata对象,包含media_type、aspect_ratio、style和编辑质量评估,这对公开数据集来说并不常见,且有助于研究优秀提示与平庸提示的差异。
第三,它无需任何门槛即可访问:不需要API密钥,没有速率限制需要绕过,也无需维护抓取基础设施。这对可复现性很重要,而这正是本文的重点。
可复现地拉取数据
该数据集通过两个端点提供。数据集清单返回一个JSON文档,描述集合信息:total_prompts、完整的record_fields模式以及分页方案。目录本身位于/dataset/prompts,同样是JSON格式,使用键集游标而非页码进行分页。
键集分页值得特别说明,因为它是研究拉取可复现的关键。基于偏移量的分页在爬取过程中若记录被添加或删除,会悄然发生偏移,导致重复或跳过行。键集游标没有这种故障模式:跟随每个响应中的next URL,直到返回null,每一页都锚定在稳定位置,而非可能漂移的行数。
最小拉取示例:
curl "https://www.wikiprompt.org/dataset/prompts?limit=500"
limit每页最多接受500条记录(默认200),游标参数为after。用Python进行完整爬取是一个简短循环:
import requests
url = "https://www.wikiprompt.org/dataset/prompts?limit=500"
records = []
while url:
resp = requests.get(url, timeout=30).json()
records.extend(resp["prompts"])
url = resp.get("next")
print(len(records), "records pulled")
响应带有Access-Control-Allow-Origin: *和强边缘缓存,因此该循环成本低廉,无需后端代理。对于固定、可复现的样本,请将拉取日期与数据集快照一并记录,因为语料库正在持续增长。
记录中包含什么
每条记录包含用于文本分析的字段(title、description、content,即实际提示文本)、用于分类的字段(category、tags、model),以及用于多模态工作的字段(media,一个图像或视频URL数组,加上结构化的metadata对象)。时间戳(created_at、updated_at)支持纵向研究,slug和url为每条记录提供稳定、可解引用的标识符,用于引用具体示例而非仅引用汇总统计。
具体来说,引用可以指向一个围绕单块砖投下巨大阴影的建筑摄影提示,或一个风格独特的条目,如结合秋日意象与藏传曼陀罗图案的肖像,或借鉴武侠和唐卡美学惯例的作品。这些页面中的每一个都是该记录的规范、可引用位置:稳定URL、对原始作者的可见署名,以及指向原始帖子的链接。
对于实时过滤而非批量拉取,搜索API支持对同一目录进行基于查询的查找,机器可读摘要位于llms.txt。两者都不能替代用于系统抽样的批量数据集,但都有助于抽查或限定范围的样本,例如仅拉取创意类别用于限定在该领域的研究。
署名与引用
Wikiprompt是一个聚合器,而非语料库中提示的原始作者。内容来自个人创作者的公开帖子,正确的署名需要同时引用两层:Wikiprompt作为数据集来源,以及任何你引用、复制或详细分析的记录的特定original_source。我们不持有或声称对底层内容拥有正式许可;请将重用视为正确署名的请求,而非更广泛权利的授予。如果某个使用场景提出了数据集字段无法回答的问题,请将记录追溯到其original_source,并在文档中注明该来源链。
整个语料库的合理引用格式:
Wikiprompt Corpus. Retrieved [date] from https://www.wikiprompt.org/dataset/prompts.
Aggregated public AI prompt data; individual records attribute original authors
via the original_source field.
引用单条提示时,请引用其规范URL(wikiprompt.org/<slug>),并在分析依赖于原始上下文时,同时引用链接的original_source。
值得明确说明的局限性
这是一个经过整理的语料库,而非在线所有AI提示活动的随机样本。只有活跃、干净的提示会被导出;因质量或政策原因被移除的内容不会出现。这使其非常适合研究一个经过审核的、面向公众的提示集合是什么样的,但关于“人们如何向AI模型提示”的一般性主张应相应限定范围。
该语料库也在增长而非固定不变。一周的拉取不会与下一周完全匹配。在需要精确可复现的情况下,请自行快照数据(上述键集分页使这变得成本低廉),并引用检索日期,理想情况下还包括快照的记录数,而非指向实时端点并假设其后续会匹配。
最后,metadata中的质量评估是整理过程中做出的编辑判断,而非正式或同行评审的评分标准。它们作为研究变量很有用,但在未披露该来源的情况下,作为基准真相则不太可靠。
这些都不是回避该语料库的理由。这是任何聚合公开数据集都应被使用的条件:了解数据来源,披露样本边界,并引用实际撰写提示的人。
Related Articles
- Laya vs. Jev: Die Open-Source-Antwort auf die Entscheidungsmodell-Welle
Sep 22, 2026 · 5 min read
- Laya contre Jev : La réponse open-source à la vague des modèles de décision
Sep 22, 2026 · 5 min read
- Laya vs Jev: La respuesta de código abierto a la ola de modelos de decisión
Sep 22, 2026 · 5 min read
- Laya vs Jev: 오픈소스로 답하는 의사결정 모델 물결
Sep 22, 2026 · 5 min read
- लाया बनाम जेव: निर्णय-मॉडल लहर का ओपन-सोर्स उत्तर
Sep 22, 2026 · 5 min read