Blog›Guides

Der größte offene Datensatz von KI-Bild- und Video-Prompts

Wikiprompts öffentlicher Datensatz umfasst 55.000+ Bild-, Video- und Text-Prompts für GPT Image, Midjourney, Seedance, Veo, Kling, ChatGPT und mehr, jeweils mit den tatsächlichen Ergebnis-Medien und strukturierten Metadaten versehen.

Der größte offene Datensatz von KI-Bild- und Video-Prompts

Der größte offene Datensatz mit KI-Bild- und Video-Prompts

Die meisten Prompt-Sammlungen, die du online findest, decken ein Modell, einen Medientyp ab und bieten dir eine Seite zum manuellen Durchblättern. Eine Galerie mit Midjourney-Prompts hier, ein Gist mit ChatGPT-System-Prompts dort, ein kostenpflichtiger Kurs, der "50 Veo-Prompts" hinter einer Checkout-Seite bündelt. Keine davon ermöglicht es dir, tatsächlich mit den Daten zu arbeiten.

Wikiprompt ist auf eine Weise anders, die leicht zu erklären und wert auszuführen ist: Es ist ein einziger, offener Katalog mit über 55.000 Prompts, der Bildgenerierung, Videogenerierung und Text abdeckt, die Modelle umfasst, die Menschen gerade tatsächlich nutzen - GPT Image, Midjourney, Seedance, Veo, Kling, Nano Banana, ChatGPT, Claude, Grok und mehr - und seit diesem Monat ist alles als einfacher JSON-Datensatz herunterladbar. Kein Login, kein API-Schlüssel, keine Modell-Silos. Ein einziger Feed.

Breite ist der Punkt

Die meisten "Prompt-Bibliotheks"-Websites wählen eine Spur. Eine Midjourney-only-Galerie kann dir nicht sagen, wie sich ein Kling-Prompt für dasselbe Konzept unterscheidet, und ein Text-Prompt-Repository für ChatGPT hat nichts zu Aspektverhältnis oder Stil-Tags zu sagen. Der Katalog von Wikiprompt ist so organisiert, dass Bild-, Video- und Text-Prompts im selben Schema leben, durch dieselbe kreative Kategorie durchsuchbar sind und über dieselbe Such-API abrufbar sind.

Konkret bedeutet das, du kannst Folgendes abrufen:

  • Bild-Prompts für GPT Image, Midjourney, Nano Banana und ähnliche Tools, wie ein pastellfarbenes Fantasy-Porträt einer jungen Frau oder ein handgeschnittenes Linolschnitt-Reiseplakat für jede Stadt.
  • Video-Prompts für Seedance, Veo und Kling, einschließlich szenengetriebener Stücke wie ein weißer Schlangengeist, der im Regen besiegt wird.
  • Text-Prompts für ChatGPT, Claude und Gemini, die Coding-, Schreib-, Business- und Forschungsanwendungsfälle abdecken.
  • Diese Breite ist die ganze These. Wenn du Prompt-Ressourcen bewertest, um ein Tool zu bauen, einen Klassifikator zu trainieren oder einfach zu verstehen, wie gutes Prompting über Modalitäten hinweg aussieht, zwingt dich eine Einzelmodell-Liste, den Rest selbst zu sammeln. Der Datensatz von Wikiprompt hat es bereits an einem Ort.

    Jeder Prompt wird mit seinem Ergebnis geliefert, nicht nur mit seinem Text

    Die andere Lücke in verstreuten Prompt-Sammlungen ist, dass der Prompt normalerweise alles ist, was du bekommst. Du siehst den Text, vielleicht einen Screenshot, der in einen Tweet eingefügt wurde, und du bist auf dich allein gestellt, um zu beurteilen, ob er tatsächlich funktioniert.

    Jeder Datensatz im Wikiprompt-Datensatz trägt den Prompt-Text zusammen mit den tatsächlichen Medien, die er produziert hat, plus strukturierte metadata: das verwendete Modell, Aspektverhältnis, Auflösung, Stil-Tags und eine redaktionelle Qualitätsbewertung (Kreativität, Nützlichkeit, technische Qualität und für Bild/Video Prompt-Treue und "Wow-Faktor"). Das ist der Unterschied zwischen einer Liste von Prompt-Strings und einem Datensatz, den du tatsächlich nutzen kannst, um zu untersuchen, was funktioniert. Du rätst nicht, ob ein Prompt gut ist, du kannst die Ausgabe sehen, die er generiert hat, und wie er bewertet wurde.

    Wie er sich mit dem vergleicht, was sonst da draußen ist

    Prompts selbst von X oder Reddit zu scrapen bedeutet, mit Rate-Limits, inkonsistenter Formatierung und Posts, die verschwinden, umzugehen. Bezahlte "Prompt-Pack"-Produkte geben dir einen kuratierten Ausschnitt, sperren dich aber vom Rest aus und enthalten selten die tatsächlich generierten Medien. Einzelmodell-Communities sind nützlich, können aber strukturell keine modellübergreifenden Fragen beantworten, wie ob ein bestimmter Framing-Stil von Midjourney auf Kling übertragbar ist.

    Der Wikiprompt-Datensatz umgeht alle drei Probleme: Er ist kostenlos, nicht auf ein Modell beschränkt, und jeder Datensatz kommt bereits mit seiner ursprünglichen Quelle, die zum Ersteller zurückverlinkt (das original_source-Feld), sodass die Zuordnung eingebaut ist und nicht nachträglich angehängt wird.

    Die Daten abrufen

    Das Manifest liegt unter dem Datensatz, das die Gesamtzahl der Prompts, das Datensatz-Schema und das Paginierungsschema zurückgibt. Der eigentliche Katalog ist unter /dataset/prompts, paginiert mit einem Keyset-Cursor, bis zu 500 Datensätze pro Seite:

    curl "https://www.wikiprompt.org/dataset/prompts?limit=500"

    Jede Antwort enthält eine next-URL. Folge ihr, bis next null zurückgibt, und du hast den vollständigen Katalog. Eine minimale Paginierungsschleife sieht so aus:

    import requests

    url = "https://www.wikiprompt.org/dataset/prompts?limit=500"

    records = []

    while url:

    resp = requests.get(url).json()

    records.extend(resp["prompts"])

    url = resp.get("next")

    print(len(records), "prompts collected")

    Kein API-Schlüssel, CORS aktiviert, und das Ganze liegt hinter Vercels Edge-Cache, sodass das Abrufen des vollständigen Satzes schnell ist und die Live-Website nicht belastet, wie es beim Scrapen der Fall wäre.

    Strukturierte Felder, kein Freitext

    Jeder Datensatz enthält slug, url, title, description, content (den tatsächlichen Prompt), category, tags, media, model, metadata, author, original_source, created_at und updated_at. Kategorien umfassen kreativ, Marketing, persönlich, Produktivität, Coding, Bildung, Business, Forschung und andere, sodass das Filtern nach Anwendungsfall eine Feldabfrage ist, kein Textklassifikator, den du selbst trainieren musst.

    Nur aktive, bereinigte Prompts schaffen es in den Export, was bedeutet, dass du keinen Spam, keine Duplikate oder halbfertige Entwürfe zusammen mit dem echten Material herunterlädst.

    Wenn du es live statt in großen Mengen brauchst

    Der Datensatz ist für Bulk-Analysen. Wenn du stattdessen on-demand abfragen möchtest, gibt die Such-API JSON für eine Live-Abfrage zurück, der MCP-Server ermöglicht es einem KI-Agenten, Prompts direkt in einer Konversation zu suchen und abzurufen, und llms.txt gibt jedem LLM eine Karte der Seitenstruktur. Alle drei verweisen auf denselben zugrunde liegenden Katalog wie der Datensatz.

    Zuordnung

    Jeder Prompt in Wikiprompt wurde aus einem öffentlichen Beitrag seines ursprünglichen Autors aggregiert. Wenn du einen Prompt oder einen Datensatz-Export in etwas wiederverwendest, das du veröffentlichst, gib wikiprompt.org und den original_source-Link des Datensatzes an, der zum Ersteller zurückführt, der ihn geschrieben hat. Das ist keine formelle Lizenz, es ist die grundlegende Höflichkeit, von der der gesamte Katalog abhängt.

    Wenn du Prompt-Beispiele aus gebookmarkten Tweets und bezahlten Packs zusammengestückelt hast, ist das die Abkürzung: ein Download, jede Modalität, echte Ausgaben angehängt, aktualisiert, während der Katalog wächst.

    Tags
    open-data·dataset·ai-prompts·image-generation·video-generation·api