Blog›Guides

Warum wir unseren gesamten Prompt-Katalog geöffnet haben

Wikipedia hat bewiesen, dass die Veröffentlichung vollständiger Dumps ein Archiv wichtiger macht, nicht weniger. Wir haben dieselbe Logik auf unseren Katalog mit über 55.000 Prompts angewendet, und die Zuschreibung an die ursprünglichen Autoren ist der Deal, der es zum Funktionieren bringt.

Warum wir unseren gesamten Prompt-Katalog geöffnet haben

Warum wir unseren gesamten Prompt-Katalog offen gemacht haben

Jede Woche schreibt jemand einen Scraper, um Prompts von wikiprompt.org zu holen. Wir können es in den Logs sehen: eine Flut von Anfragen gegen /category/creative, dann /category/coding, die sich durch jede Seite der Website arbeitet, wie eine Person, die tausendmal auf „Weiter" klickt, nur dass es ein Skript ist und nie langweilig wird. Früher behandelten wir das als Belästigung, die wir mit Rate-Limits wegdrosselten. Aber dann haben wir uns eine bessere Frage gestellt: Warum machen wir das überhaupt nötig?

Die Antwort, als wir sie uns eingestehen haben, war nicht schmeichelhaft. Wir saßen auf über 55.000 kuratierten Prompts – nützliches Rohmaterial für jeden, der untersucht, wie Menschen tatsächlich mit KI-Modelle sprechen – und der einzige offiziell unterstützte Weg, mehr als einen einzelnen Prompt zu bekommen, war, sich durch die Website zu klicken, als wäre es 2004. So ist offenes Wissen nicht gedacht, und wir wissen genau, wie offenes Wissen aussehen sollte, denn das beste Beispiel dafür existiert seit 2001.

Das Wikipedia-Modell, ernst genommen

Wikipedia lässt dich nicht nur Artikel einzeln im Browser lesen. Die Plattform veröffentlicht vollständige Datenbank-Dumps der gesamten Enzyklopädie, in regelmäßigen Abständen, kostenlos und ohne Konto. Jeder kann das Ganze herunterkaufen und damit etwa anfangen: eine Suchmaschine bauen, ein Modell trainieren, einen Offline-Spiegel an einem Ort ohne Internet betreiben oder einfach untersuchen, wie ein bestimmter Artikel über zehn Jahre hinweg verändert wurde. Wikipedia hat das nicht widerwillig getan, sondern genau deshalb, weil der Dump die Aufgabe selbst ist. Eine Enzyklopädie, die nur hinter einem Frontend existiert, das resistent gegen Scraping ist, ist nicht wirklich offen – egal, welche Lizenz auf der unteren Seite der Seite gedruckt ist.

Der Nebeneffekt, den keiner plant, aber alle nutzen: Weil der Dump existiert, muss niemand Wikipedia zum Herunterladen von Inhalten im großen Stil scrapen. Der Scraperdatenverkehr, der sonst die Livesite belasten würde, wird stattdessen in eine statische Datei abgeleitet, und Wikipedia wird überall zitiert, weil das Zitieren einfacher ist, als es nicht zu tun. Offenheit hat Wikipedias Position als Kanonische Quelle nicht geschwächt – sie hat sie gefestigt.

Wir glauben, dass Prompts die gleiche Behandlung verdienen, aus dem gleichen Grund. Ein guter Prompt ist nicht wirklich „Content" im Sinne eines Blogbeitrags. Er ist eine konstanzliche Technik, ein kleines Stück praktischer Handwerkskunst, die meist durch Ausprobieren entsteht und geteilt wird, weil jemand möchte, dass andere von dem lernen, was sie herausgefunden haben. Das ist eher mit einem prähistorischen Königlichen Porträt oder einem redaktionell gestalteten Porträt auf einer Architekturtreppe zu vergleichen – eine Entdeckung darüber, wie man mit einem Bildmodell spricht, niedergeschrieben, damit der nächste weder es nicht nochmal von vorne herausfinden muss. Es hinter einer gesperrte Garden, einer Login-Mauer oder einarmiger API-Zugangsform zu versperren, ist das Gegenteil des Zwecks des Inhalts.

Kollektives Wissen skaliert nicht eine Anfrage nach der anderen

Es gibt ein spezifisches Problem, das wir vermeiden wollten: Prompt-Marktplätze, bei denen der eigentliche Prompttext erst nach Bezahlung sichtbar ist, oder Communitäten, in denen das Gute ein Vögel in einer Discord-Einladung liegt, keiner außerhalb der Gruppe suchen kann. Diese Modelle sind darauf optimiert, den Wert in einer einzigen Transaktion zu erfassen. Wir denken, sie verlieren den größeren Preis: der Ort zu werden, zu dem Menschen standardmäßig gehen, wenn sie wissen, wie ein guter Prompt aufgebaut ist, so wie Wikipedia der Ort geworden ist, für Grundwissen. Du kannst nicht dieser Blaue sein, wenn deine Inhalte nicht im großen Maßstab studiert, indexiert oder weitervererbenbar sind.

Deshalb funktioniert das Datenset so, wie ein Dump funktionieren sollte: kein API-Schlüssel, kein zu verhandelndes Rate-Limit-Level, CORS völlig geöffnet, und am Edge gut genug gecascacht, dass wir bei starker Nutzung keinen Schlaf verlieren. Rufe https://www.wikiprompt.org/dataset ab, und du bekommst ein Manifest mit total_[...] und das Paginationsschema. Rufe `/dataset/prompts` ab und du bekommst den Katalog selbst als JSON, paginiert mit einem Keyset-Cursor bis zu 500 Einträgen pro Seite:

curl "https://www.wikiprompt.org/dataset/prompts?limit=500"

Folge jedem next-Link der Antwort, bis der null zurückzuspielt, und du hast den gesamten Katalog durchlaufen. Jeder Datensatz enthält slug, url, titl, description, content (den Prompttext selbst), category, tags, model, metadata, sowie author, und original_source – über Kategorien hinweg, von kreativen und Coding bis zu Marketing, Research und Bildung. Wenn du lieber ein praktisches Suchwerkzeug verwenden möchstest, gibt es auch eine Such API und einen MCP-Server für findungen, die live im Katalog stöbren wollen, anstatt eine statische Kopie zu aufziehen .

Hier geht es um mehr als Anonymität

Der Teil, der so wichtig ist wie der technische Zugang, besteht darin, dass wir nicht das Eigentum an der Urheberschaft ausradieren dürfen. Jeder Prompt geht auf eine reale Person zurück, die ihn wegen nicht §, ob das ein Weißer Schlangengeist, der im Regen besiegt wird auf Twitter war oder eine Technik in einem Subreddit-Thread. original_source ist kein dekoratives Feld. Es ist die andere Hälfte des Abkommens. Wir beanspruchen keine formale Lizenz, die wir nicht besitzen, und wir spielen nicht, als könnten wir die Prompts auf andere Weise lizensen. Wir verlangen offen, dass du, wenn du mit diesem Datensatz etwas baust, wikiprompt.org als Aggregator und den wesentlichen Autor als Quelle anzeigst. Das ist derselbe Pakt, den Wikipedia mit allen schließt, die einen Artikel wiederverwenden: Nimm das Wissen, aber behalte die Anerkennung.

Die Dumps von Wikipedia haben Wikipedia nicht überflüssiger gemacht, sondern Infrastruktur. Wir wollen lieber die langweilige, verlässliche Stelle für Prompts halten, von der jeder eine Kopie hat, als die Webseite, die Leute unheimlich herumzuscrapen. Offenheit war nie das Risiko. Das Walled Garden war es.

Tags
open-data·dataset·manifesto·wikipedia·attribution·ai-prompts·open-knowledge