Blog›Guides

So laden Sie 55.000 KI-Prompts herunter (kostenlos, ohne Scraping)

Eine Schritt-für-Schritt-Anleitung zum Abrufen des gesamten Wikiprompt-Katalogs über den öffentlichen Datensatz-Endpunkt, wobei der Keyset-Paginierungs-Cursor verfolgt wird, bis nichts mehr übrig ist, ohne dass Scraping erforderlich ist.

So laden Sie 55.000 KI-Prompts herunter (kostenlos, ohne Scraping)

So laden Sie 55.000 KI-Prompts herunter (kostenlos, ohne Scraping)

Wenn Sie jemals versucht haben, einen Prompt-Datensatz aufzubauen, indem Sie Twitter-Threads scrapen, Discord-Server screenshotten oder mit einem Headless-Browser durch das HTML einer Website paginieren, wissen Sie bereits, wie fragil das ist. Selektoren ändern sich, Rate Limits greifen ein, und die Hälfte der "Prompts", die Sie sammeln, entpuppt sich als Antworten über den Prompt, nicht als der Prompt selbst.

Wikiprompt hat die Notwendigkeit dafür gerade beseitigt. Der Katalog mit über 55.000 kuratierten KI-Prompts für Bild-, Video- und Textgenerierung über Modelle wie Midjourney, GPT Image, Veo, Kling, Nano Banana und Claude ist jetzt als einfacher JSON-Datensatz verfügbar, den Sie mit curl durchblättern können. Kein API-Schlüssel, kein Login, kein Scraping. Dieser Beitrag ist der schnellste Weg von "Ich will die Daten" zu einer lokalen Datei mit 55.000 Datensätzen.

Schritt 1: Das Manifest abrufen

Bevor Sie Datensätze abrufen, prüfen Sie das Manifest, damit Ihr Skript weiß, womit es es zu tun hat:

curl "https://www.wikiprompt.org/dataset"

Dies gibt ein kleines JSON-Dokument zurück, das den Datensatz beschreibt: total_prompts (die aktuelle Anzahl, 55.000+), record_fields (das Schema unten) und das pagination-Schema. Behandeln Sie diesen Endpunkt als Quelle der Wahrheit für die Gesamtzahl, hardcoden Sie keine Zahl in Ihre Pipeline.

Schritt 2: Ihre erste Seite abrufen

Die eigentlichen Datensätze befinden sich unter /dataset/prompts. Die Paginierung ist keyset-basiert (ein Cursor, keine Seitennummern), was bedeutet, dass sie auch auf Seite 200 schnell und stabil bleibt. Die Standard-Seitengröße beträgt 200 Datensätze; Sie können bis zu 500 auf einmal anfordern:

curl "https://www.wikiprompt.org/dataset/prompts?limit=500"

Die Antwort ist ein JSON-Objekt mit einer Liste von Datensätzen und einem next-Feld. next ist eine vollständige URL, die Sie direkt abrufen können und die einen after-Cursor enthält, der auf den letzten Datensatz zeigt, den Sie gerade erhalten haben. Wenn nichts mehr zu paginieren ist, ist next null. Dieses einzelne Feld ist Ihre gesamte Schleifenbedingung.

Schritt 3: `next` folgen, bis es null ist

Hier ist die gesamte Paginierungsschleife in Python. Sie schreibt jeden Datensatz in eine lokale Datei und stoppt sich selbst:

import json

import time

import urllib.request

url = "https://www.wikiprompt.org/dataset/prompts?limit=500"

out = open("wikiprompt_dataset.jsonl", "w")

count = 0

while url:

with urllib.request.urlopen(url) as resp:

data = json.loads(resp.read())

for record in data["records"]:

out.write(json.dumps(record) + "\n")

count += 1

url = data.get("next")

time.sleep(0.2)

out.close()

print(f"Downloaded {count} prompts")

Dieselbe Schleife in Node, falls das Ihr Stack ist:

let url = "https://www.wikiprompt.org/dataset/prompts?limit=500";

const fs = require("fs");

const out = fs.createWriteStream("wikiprompt_dataset.jsonl");

let count = 0;

while (url) {

const res = await fetch(url);

const data = await res.json();

for (const record of data.records) {

out.write(JSON.stringify(record) + "\n");

count++;

}

url = data.next;

}

console.log(Downloaded ${count} prompts);

Führen Sie eines davon aus und gehen Sie weg. Jede Antwort ist edge-cached und CORS-aktiviert (Access-Control-Allow-Origin: *), sodass dies von einem Server, einer Browser-Konsole, einem Notebook oder einer serverlosen Funktion ohne spezielle Header funktioniert. Bei einer normalen Verbindung dauert das Abrufen aller 55.000+ Datensätze mit limit=500 deutlich unter zwei Minuten.

Was Sie tatsächlich pro Datensatz erhalten

Jedes JSON-Objekt im Datensatz hat dieselbe Form, was es für alles außer einmaligem Stöbern nützlich macht:

  • slug und url, die kanonische Seite für diesen Prompt auf wikiprompt.org
  • title und description
  • content, der eigentliche Prompt-Text, den Sie in ein Modell kopieren würden
  • category (creative, marketing, personal, productivity, coding, education, business, research, other) und tags
  • media, Bild- oder Video-URLs, wenn der Prompt visuelle Ausgabe erzeugt hat
  • model, das KI-Modell, für das der Prompt geschrieben oder mit dem er generiert wurde
  • metadata, ein strukturierter Block, der Medientyp, Seitenverhältnis, Stil und eine Qualitätsbewertung abdeckt
  • author und original_source, ein Link zurück zum ursprünglichen Tweet oder Beitrag, von dem der Prompt stammt
  • created_at und updated_at
  • Dieses content-Feld ist der Kernpunkt: Es ist der gebrauchsfertige Prompt-Text, keine Zusammenfassung davon, was die meisten gescrapten Datensätze falsch machen.

    Ein paar Datensätze, die Sie sich zuerst ansehen sollten

    Verlassen Sie sich nicht blind auf das Schema, sondern öffnen Sie ein paar tatsächliche Einträge. Titan: Engineering Blueprint of a Transforming Robot ist ein gutes Beispiel für einen detaillierten Bild-Prompt mit einem vollständigen Metadatenblock. Data Physicalization zeigt, wie category und tags für einen konzeptionelleren, designorientierten Prompt zugewiesen werden. Und Pastel Fantasy Portrait of a Young Woman ist ein kompakter, stilgetriebener Prompt, den es wert ist, mit dem style-Feld in seinen Metadaten verglichen zu werden. Das Abrufen dieser drei Slugs aus Ihrer lokalen JSONL-Datei ist ein schneller Weg, um Ihren Parser zu überprüfen, bevor Sie ihm bei allen 55.000 vertrauen.

    Wenn Sie lieber abfragen als herunterladen

    Der Bulk-Datensatz ist für den Fall, dass Sie alles lokal und einmalig möchten. Wenn Sie nur einen Ausschnitt benötigen, beantwortet die Such-API On-Demand-Abfragen in JSON, der MCP-Server stellt denselben Katalog als Tools für Claude und andere Agenten bereit, und llms.txt gibt Crawlern eine Karte der Website. Der Datensatz-Export und diese Live-Endpunkte teilen dieselben zugrunde liegenden Daten, sodass ein späterer Wechsel zwischen ihnen nichts kostet.

    Eine Regel, wenn Sie dies wiederverwenden

    Wikiprompt aggregiert Prompts aus öffentlichen Beiträgen ihrer ursprünglichen Autoren; es ist nicht der Urheberrechtsinhaber. Wenn Sie etwas veröffentlichen, das auf diesem Datensatz basiert, geben Sie wikiprompt.org und den original_source-Link auf den spezifischen Datensätzen an, die Sie verwendet haben. Das ist die einzige Bedingung, die an all dem hängt.

    Laden Sie es herunter, blättern Sie es durch und bauen Sie etwas. Das Manifest und der next-Cursor sind die einzigen zwei Dinge, die Sie sich merken müssen.

    Tags
    open-data·dataset·ai-prompts·api·download·pagination