Blog›Guides

最大规模的AI图像与视频提示词开放数据集

Wikiprompt的公开数据集涵盖55,000多个图像、视频和文本提示词,覆盖GPT Image、Midjourney、Seedance、Veo、Kling、ChatGPT等,每个提示词都附带其实际结果媒体和结构化元数据。

最大规模的AI图像与视频提示词开放数据集

最大的AI图像与视频提示词开放数据集

你在网上找到的大多数提示词集合通常只覆盖一个模型、一种媒体类型,并且只能手动翻页浏览。这里有一个Midjourney提示词画廊,那里有一个ChatGPT系统提示词片段,还有一个付费课程把“50个Veo提示词”藏在结账页面后面。它们没有一个能让你真正处理这些数据。

Wikiprompt的不同之处很容易说明,也值得详细解释:它是一个单一的开放目录,包含超过55,000条提示词,涵盖图像生成、视频生成和文本,覆盖人们当前实际使用的模型,包括GPT Image、Midjourney、Seedance、Veo、Kling、Nano Banana、ChatGPT、Claude、Grok等,并且从本月起,所有这些都可以作为纯JSON数据集下载。无需登录,无需API密钥,也没有按模型划分的孤岛。一个数据源就够了。

广度是关键

大多数“提示词库”网站都会选择一个方向。一个仅限Midjourney的画廊无法告诉你同一概念下Kling提示词有何不同,而一个针对ChatGPT的文本提示词仓库对宽高比或风格标签毫无涉及。Wikiprompt的目录经过组织,使图像、视频和文本提示词位于同一架构中,可通过相同的创意提示词分类浏览,并通过相同的搜索API进行搜索。

具体来说,你可以获取:

  • 针对GPT Image、Midjourney、Nano Banana等工具的图像提示词,例如一幅粉彩奇幻肖像或一张手工刻制的油毡版画旅行海报。
  • 针对Seedance、Veo和Kling的视频提示词,包括场景驱动的作品,如雨中被击败的白蛇精。
  • 针对ChatGPT、Claude和Gemini的文本提示词,涵盖编程、写作、商业和研究用例。
  • 这种广度就是全部论点所在。如果你正在评估提示词资源以构建工具、训练分类器,或者只是想了解跨模态的优秀提示词是什么样的,单一模型的列表会迫使你自己去收集其余部分。Wikiprompt的数据集已经把所有内容放在一个地方。

    每条提示词都附带其结果,而不仅仅是文本

    零散提示词集合的另一个缺口是,你通常只能得到提示词本身。你看到文本,也许还有一张粘贴到推文中的截图,然后只能自己判断它是否真的有效。

    Wikiprompt数据集中的每条记录都附带提示词文本及其实际生成的媒体,此外还有结构化的metadata:使用的模型、宽高比、分辨率、风格标签,以及编辑质量评估(创造力、实用性、技术质量,对于图像/视频还包括提示词遵循度和“惊艳指数”)。这就是提示词字符串列表与你可以真正用来研究什么有效的数据集之间的区别。你不需要猜测提示词好不好,你可以看到它生成的输出以及它的评分。

    与市面上其他资源的比较

    自己从X或Reddit抓取提示词意味着要应对速率限制、格式不一致和消失的帖子。付费的“提示词包”产品给你一个精选片段,但把你锁在其余内容之外,而且很少包含实际生成的媒体。单一模型的社区很有用,但在结构上无法回答跨模型的问题,比如某种构图风格是否能从Midjourney迁移到Kling。

    Wikiprompt数据集绕过了这三个问题:它是免费的,不局限于单一模型,而且每条记录都已经附带了指向原始创作者的来源链接(original_source字段),因此归属是内置的,而不是事后添加的。

    获取数据

    清单位于数据集,其中返回提示词总数、记录架构和分页方案。实际目录位于/dataset/prompts,使用键集游标分页,每页最多500条记录:

    curl "https://www.wikiprompt.org/dataset/prompts?limit=500"

    每个响应都包含一个next URL。一直跟随它,直到next返回null,你就获得了完整目录。一个最小的分页循环如下:

    import requests

    url = "https://www.wikiprompt.org/dataset/prompts?limit=500"

    records = []

    while url:

    resp = requests.get(url).json()

    records.extend(resp["prompts"])

    url = resp.get("next")

    print(len(records), "prompts collected")

    无需API密钥,已启用CORS,整个服务位于Vercel的边缘缓存后面,因此拉取完整数据集速度很快,不会像抓取那样给在线站点带来负载。

    结构化字段,而非自由文本

    每条记录包含slug、url、title、description、content(实际提示词)、category、tags、media、model、metadata、author、original_source、created_at和updated_at。分类涵盖创意、营销、个人、生产力、编程、教育、商业、研究和其他,因此按用例过滤是字段查找,而不是你必须自己训练的分类器。

    只有活跃且经过清理的提示词才会进入导出,这意味着你不会在下载真实内容的同时下载垃圾信息、重复内容或半成品草稿。

    如果你需要实时数据而非批量数据

    数据集用于批量分析。如果你想按需查询,搜索API会为实时查询返回JSON,MCP服务器允许AI代理在对话中直接搜索和拉取提示词,而llms.txt为任何LLM提供站点结构地图。这三个都指向与数据集相同的底层目录。

    归属

    Wikiprompt中的每条提示词都是从原始作者的公开帖子中聚合而来。当你在发布的内容中重用提示词或数据集导出时,请注明wikiprompt.org,并通过记录的original_source链接回撰写它的创作者。这不是正式许可,而是整个目录赖以存在的基线礼貌。

    如果你一直在从书签推文和付费包中拼凑提示词示例,这就是捷径:一次下载,涵盖所有模态,附带真实输出,并随着目录增长持续更新。

    Tags
    open-data·dataset·ai-prompts·image-generation·video-generation·api