So laden Sie 55.000 KI-Prompts herunter (kostenlos, ohne Scraping)
Eine Schritt-für-Schritt-Anleitung zum Abrufen des gesamten Wikiprompt-Katalogs über den öffentlichen Datensatz-Endpunkt, wobei der Keyset-Paginierungs-Cursor verfolgt wird, bis nichts mehr übrig ist, ohne dass Scraping erforderlich ist.

So laden Sie 55.000 KI-Prompts herunter (kostenlos, ohne Scraping)
Wenn Sie jemals versucht haben, einen Prompt-Datensatz aufzubauen, indem Sie Twitter-Threads scrapen, Discord-Server screenshotten oder mit einem Headless-Browser durch das HTML einer Website paginieren, wissen Sie bereits, wie fragil das ist. Selektoren ändern sich, Rate Limits greifen ein, und die Hälfte der "Prompts", die Sie sammeln, entpuppt sich als Antworten über den Prompt, nicht als der Prompt selbst.
Wikiprompt hat die Notwendigkeit dafür gerade beseitigt. Der Katalog mit über 55.000 kuratierten KI-Prompts für Bild-, Video- und Textgenerierung über Modelle wie Midjourney, GPT Image, Veo, Kling, Nano Banana und Claude ist jetzt als einfacher JSON-Datensatz verfügbar, den Sie mit curl durchblättern können. Kein API-Schlüssel, kein Login, kein Scraping. Dieser Beitrag ist der schnellste Weg von "Ich will die Daten" zu einer lokalen Datei mit 55.000 Datensätzen.
Schritt 1: Das Manifest abrufen
Bevor Sie Datensätze abrufen, prüfen Sie das Manifest, damit Ihr Skript weiß, womit es es zu tun hat:
curl "https://www.wikiprompt.org/dataset"
Dies gibt ein kleines JSON-Dokument zurück, das den Datensatz beschreibt: total_prompts (die aktuelle Anzahl, 55.000+), record_fields (das Schema unten) und das pagination-Schema. Behandeln Sie diesen Endpunkt als Quelle der Wahrheit für die Gesamtzahl, hardcoden Sie keine Zahl in Ihre Pipeline.
Schritt 2: Ihre erste Seite abrufen
Die eigentlichen Datensätze befinden sich unter /dataset/prompts. Die Paginierung ist keyset-basiert (ein Cursor, keine Seitennummern), was bedeutet, dass sie auch auf Seite 200 schnell und stabil bleibt. Die Standard-Seitengröße beträgt 200 Datensätze; Sie können bis zu 500 auf einmal anfordern:
curl "https://www.wikiprompt.org/dataset/prompts?limit=500"
Die Antwort ist ein JSON-Objekt mit einer Liste von Datensätzen und einem next-Feld. next ist eine vollständige URL, die Sie direkt abrufen können und die einen after-Cursor enthält, der auf den letzten Datensatz zeigt, den Sie gerade erhalten haben. Wenn nichts mehr zu paginieren ist, ist next null. Dieses einzelne Feld ist Ihre gesamte Schleifenbedingung.
Schritt 3: `next` folgen, bis es null ist
Hier ist die gesamte Paginierungsschleife in Python. Sie schreibt jeden Datensatz in eine lokale Datei und stoppt sich selbst:
import json
import time
import urllib.request
url = "https://www.wikiprompt.org/dataset/prompts?limit=500"
out = open("wikiprompt_dataset.jsonl", "w")
count = 0
while url:
with urllib.request.urlopen(url) as resp:
data = json.loads(resp.read())
for record in data["records"]:
out.write(json.dumps(record) + "\n")
count += 1
url = data.get("next")
time.sleep(0.2)
out.close()
print(f"Downloaded {count} prompts")
Dieselbe Schleife in Node, falls das Ihr Stack ist:
let url = "https://www.wikiprompt.org/dataset/prompts?limit=500";
const fs = require("fs");
const out = fs.createWriteStream("wikiprompt_dataset.jsonl");
let count = 0;
while (url) {
const res = await fetch(url);
const data = await res.json();
for (const record of data.records) {
out.write(JSON.stringify(record) + "\n");
count++;
}
url = data.next;
}
console.log(Downloaded ${count} prompts);
Führen Sie eines davon aus und gehen Sie weg. Jede Antwort ist edge-cached und CORS-aktiviert (Access-Control-Allow-Origin: *), sodass dies von einem Server, einer Browser-Konsole, einem Notebook oder einer serverlosen Funktion ohne spezielle Header funktioniert. Bei einer normalen Verbindung dauert das Abrufen aller 55.000+ Datensätze mit limit=500 deutlich unter zwei Minuten.
Was Sie tatsächlich pro Datensatz erhalten
Jedes JSON-Objekt im Datensatz hat dieselbe Form, was es für alles außer einmaligem Stöbern nützlich macht:
slug und url, die kanonische Seite für diesen Prompt auf wikiprompt.orgtitle und descriptioncontent, der eigentliche Prompt-Text, den Sie in ein Modell kopieren würdencategory (creative, marketing, personal, productivity, coding, education, business, research, other) und tagsmedia, Bild- oder Video-URLs, wenn der Prompt visuelle Ausgabe erzeugt hatmodel, das KI-Modell, für das der Prompt geschrieben oder mit dem er generiert wurdemetadata, ein strukturierter Block, der Medientyp, Seitenverhältnis, Stil und eine Qualitätsbewertung abdecktauthor und original_source, ein Link zurück zum ursprünglichen Tweet oder Beitrag, von dem der Prompt stammtcreated_at und updated_atDieses content-Feld ist der Kernpunkt: Es ist der gebrauchsfertige Prompt-Text, keine Zusammenfassung davon, was die meisten gescrapten Datensätze falsch machen.
Ein paar Datensätze, die Sie sich zuerst ansehen sollten
Verlassen Sie sich nicht blind auf das Schema, sondern öffnen Sie ein paar tatsächliche Einträge. Titan: Engineering Blueprint of a Transforming Robot ist ein gutes Beispiel für einen detaillierten Bild-Prompt mit einem vollständigen Metadatenblock. Data Physicalization zeigt, wie category und tags für einen konzeptionelleren, designorientierten Prompt zugewiesen werden. Und Pastel Fantasy Portrait of a Young Woman ist ein kompakter, stilgetriebener Prompt, den es wert ist, mit dem style-Feld in seinen Metadaten verglichen zu werden. Das Abrufen dieser drei Slugs aus Ihrer lokalen JSONL-Datei ist ein schneller Weg, um Ihren Parser zu überprüfen, bevor Sie ihm bei allen 55.000 vertrauen.
Wenn Sie lieber abfragen als herunterladen
Der Bulk-Datensatz ist für den Fall, dass Sie alles lokal und einmalig möchten. Wenn Sie nur einen Ausschnitt benötigen, beantwortet die Such-API On-Demand-Abfragen in JSON, der MCP-Server stellt denselben Katalog als Tools für Claude und andere Agenten bereit, und llms.txt gibt Crawlern eine Karte der Website. Der Datensatz-Export und diese Live-Endpunkte teilen dieselben zugrunde liegenden Daten, sodass ein späterer Wechsel zwischen ihnen nichts kostet.
Eine Regel, wenn Sie dies wiederverwenden
Wikiprompt aggregiert Prompts aus öffentlichen Beiträgen ihrer ursprünglichen Autoren; es ist nicht der Urheberrechtsinhaber. Wenn Sie etwas veröffentlichen, das auf diesem Datensatz basiert, geben Sie wikiprompt.org und den original_source-Link auf den spezifischen Datensätzen an, die Sie verwendet haben. Das ist die einzige Bedingung, die an all dem hängt.
Laden Sie es herunter, blättern Sie es durch und bauen Sie etwas. Das Manifest und der next-Cursor sind die einzigen zwei Dinge, die Sie sich merken müssen.
Related Articles
- Laya vs. Jev: Die Open-Source-Antwort auf die Entscheidungsmodell-Welle
Sep 22, 2026 · 5 min read
- Laya contre Jev : La réponse open-source à la vague des modèles de décision
Sep 22, 2026 · 5 min read
- Laya vs Jev: La respuesta de código abierto a la ola de modelos de decisión
Sep 22, 2026 · 5 min read
- Laya vs Jev: 오픈소스로 답하는 의사결정 모델 물결
Sep 22, 2026 · 5 min read
- लाया बनाम जेव: निर्णय-मॉडल लहर का ओपन-सोर्स उत्तर
Sep 22, 2026 · 5 min read