Blog›Guides

Erstellen einer KI-App auf dem Wikiprompt-Datensatz

Ein Entwickler-Walkthrough zum Aufbau einer Prompt-Such-UI, eines Prompt-of-the-Day-Bots, einer Browser-Erweiterung oder eines Discord-Bots auf Basis des öffentlichen 55.000+ Prompt-Datensatzes von Wikiprompt, mit Ingest-Code und Attributionshinweisen.

Erstellen einer KI-App auf dem Wikiprompt-Datensatz

Eine KI-App mit dem Wikiprompt-Datensatz bauen

Jeder Indie-Hacker, der versucht hat, eine "Prompt-Bibliothek"-App zu bauen, stößt am ersten Tag auf dieselbe Wand: Du brauchst Startinhalte, und das Scraping ist langsam, fragil und unhöflich gegenüber dem Server, den du abfragst. Wikiprompt hat diese Wand gerade entfernt. Der gesamte Katalog, über 55.000 Prompts für ChatGPT, Claude, Gemini, Midjourney, GPT Image, Veo, Kling, Seedance, Nano Banana, Grok und mehr, ist jetzt als ein öffentlicher Bulk-Datensatz verfügbar. Kein Schlüssel, kein Rate-Limit-Tanz, kein Scraping. Nur JSON.

Dieser Beitrag ist ein Build-Log, keine Pressemitteilung. Vier kleine Apps, die du dieses Wochenende ausliefern könntest, und die genaue Verkabelung, um dorthin zu gelangen.

Womit du tatsächlich arbeitest

Rufe zuerst das Manifest ab:

curl "https://www.wikiprompt.org/dataset"

Es gibt total_prompts, die record_fields, die du in jeder Zeile erwarten kannst, und das Paginierungsschema zurück. Die echten Daten liegen unter /dataset/prompts, paginiert mit einem Keyset-Cursor: Jede Seite gibt dir eine next-URL, du folgst ihr, bis next als null zurückkommt. Bis zu 500 Datensätze pro Seite.

curl "https://www.wikiprompt.org/dataset/prompts?limit=500"

Jeder Datensatz ist ein kleines, nützliches Objekt: slug, url, title, description, content (der eigentliche Prompt-Text, den du in ein Modell einfügen würdest), category, tags, media (Bild-/Video-URLs, wenn der Prompt eines erzeugt hat), model (wofür er gebaut oder worauf er ausgeführt wurde), metadata (strukturierte Felder wie Medientyp, Seitenverhältnis, Stil und eine Qualitätsbewertung), author, original_source (der ursprüngliche Tweet oder Beitrag, von dem er stammt) und Zeitstempel. Das reicht, um eine echte UI ohne einen einzigen zusätzlichen API-Aufruf zu bauen.

Hier ist die vollständige Ingest-Schleife in Python, vielleicht 15 Zeilen bis zu einem lokalen SQLite-Cache:

import requests, sqlite3

db = sqlite3.connect("wikiprompt.db")

db.execute("""create table if not exists prompts(

slug text primary key, title text, description text,

content text, category text, model text, url text)""")

url = "https://www.wikiprompt.org/dataset/prompts?limit=500"

while url:

data = requests.get(url).json()

for p in data["records"]:

db.execute(

"insert or replace into prompts values (?,?,?,?,?,?,?)",

(p["slug"], p["title"], p["description"],

p["content"], p["category"], p.get("model"), p["url"]),

)

db.commit()

url = data.get("next")

Führe das einmal aus, und du hast eine lokale, abfragbare Kopie des gesamten Katalogs. CORS ist weit geöffnet (Access-Control-Allow-Origin: *) und Antworten sind Edge-gecacht, sodass dies auch aus einem Browser freundlich nutzbar ist, nicht nur aus einem Backend-Job.

Vier Dinge, die es wert sind, gebaut zu werden

Eine Prompt-Such-UI. Der Datensatz gibt dir category, tags, model und metadata kostenlos, was bedeutet, dass Facettensuche im Grunde eine SQL-WHERE-Klausel entfernt ist: "Midjourney-Prompts mit Tag Porträt" oder "Coding-Prompts für Claude" lösen sich in einen Filter auf, nicht in ein Forschungsprojekt. Wenn du den Index nicht selbst bauen willst, betreibt wikiprompt bereits einen: die Such-API nimmt ?q= und gibt rankierte JSON zurück, gut genug, um ein Suchfeld zu prototypisieren, bevor du eine einzige Zeile Retrieval-Code geschrieben hast.

Ein "Prompt des Tages"-Bot. Cron-Job, wähle eine zufällige Zeile aus deinem lokalen Cache (oder filtere nach category=creative für einen thematischen Feed), poste title + content + die url zurück zum Ursprung. Das media-Feld bedeutet, dass du das tatsächliche Ausgabebild oder -video an den Beitrag anhängen kannst, nicht nur Text. Das sind vielleicht 40 Zeilen Code und funktioniert gleichermaßen gut als Slack-Bot, Telegram-Bot oder als Cron, der auf X postet.

Eine Browser-Erweiterung. Rechtsklick auf ein beliebiges Textfeld, "Prompt einfügen", suche in deinem lokalen Cache nach Kategorie oder Modell, füge content ein. Da die Daten nach der ersten Synchronisierung lokal sind, funktioniert dies offline und sofort, ohne Netzwerk-Roundtrip pro Tastendruck.

Ein Discord-Bot. /prompt image midjourney-Slash-Befehl, filtere deinen Cache nach category und model, antworte mit title, content und den Medien als Embed. Wenn jemand das Original sehen möchte, verlinke original_source in der Fußzeile, das deckt die Attribution in derselben Nachricht ab.

Das Metadaten-Feld wirklich nutzen

metadata ist der Ort, an dem die interessanten Dinge für alles Medienbezogene liegen: Seitenverhältnis, Stil-Tags, eine Qualitätsbewertung. Wenn du etwas baust, das Prompts bewertet oder empfiehlt (anstatt sie nur aufzulisten), ist das dein Signal. Ein Filter für "beste Midjourney-Prompts für Porträts, 3:4-Seitenverhältnis, hoher Qualitätswert" sind ein paar zusätzliche WHERE-Klauseln, sobald du das Feld aufgenommen hast, keine separate Scoring-Pipeline erforderlich.

Für einen Eindruck davon, wie ein guter Prompt-Datensatz Ende zu Ende aussieht, durchstöbere ein paar Live-Seiten: ein Daten-Physicalisierung-Bildprompt, eine futuristische Arachniden-Charaktertransformation und ein mysteriöses nomadisches Reisenden-Charakterdesign. Jeder davon ist auch ein vollständiger Datensatz im Dataset, gleiche Felder, gleicher content, den du in ein Modell kopieren würdest.

Attribution ist nicht optional, und sie ist auch nicht schwer

Wikiprompt aggregiert Prompts aus öffentlichen Beiträgen ihrer ursprünglichen Autoren; es ist nicht der Lizenzinhaber, es ist der Bibliothekar. Wenn deine App einen Prompt anzeigt, zeige original_source daneben und nenne wikiprompt.org als Quelle, von der du den Katalog hast. Das ist der Deal, und der Datensatz macht es trivial, ihn zu ehren, da original_source bereits in jedem Datensatz sitzt. Entferne es nicht während der Aufnahme, nur weil dein Schema noch keine Spalte dafür hat.

Wenn du lieber keinen eigenen Index betreiben möchtest

Es gibt drei Optionen, je nachdem, wie viel Infrastruktur du besitzen möchtest. Führe den Bulk-Datensatz durch deine eigene Such-/Empfehlungsschicht, wenn du volle Kontrolle willst. Rufe die Such-API direkt auf, wenn du nur Ergebnisse brauchst, keine Pipeline. Oder, wenn du einen Agenten statt einer App baust, richte ihn auf den MCP-Server, der Suche, Kategorien und einzelne Prompts als Tools exponiert, die Claude und andere Agenten nativ aufrufen können. Es gibt auch llms.txt, wenn du möchtest, dass ein Modell die gesamte Oberfläche in einem Abruf versteht.

Starte hier

curl "https://www.wikiprompt.org/dataset/prompts?limit=500" | head -c 2000

Schau dir an, was zurückkommt, wähle eine der vier Ideen oben, und du wirst etwas zum Laufen haben, bevor der Kaffee kalt wird. Der schwierige Teil, über 55.000 kuratierte Prompts über ein Dutzend Modelle, ist bereits erledigt. Was du damit baust, ist der unterhaltsame Teil.

Tags
open-data·dataset·api·developers·tutorial·discord-bot·ai-prompts