Blog›Guides

Einführung der Wikiprompt-LLM-Benchmarks: Live-Bestenlisten, mit Belegen

Wikiprompt verfolgt nun LLM-Bestenlisten in zehn Arenen, täglich gespeichert, damit Ranglistenänderungen dokumentiert bleiben. Quellen stammen von LMArena und OpenRouter, zitiert wie Wikipedia-Referenzen, in sieben Sprachen.

Einführung der Wikiprompt-LLM-Benchmarks: Live-Bestenlisten, mit Belegen

Einführung der Wikiprompt LLM-Benchmarks: Live-Ranglisten, mit Belegen

Wikiprompt hat jetzt einen Benchmarks-Bereich: wikiprompt.org/benchmarks. Live-Ranglisten für große Sprachmodelle und generative KI, die zehn Arenen abdecken: Text, Webentwicklung, Vision, Text-zu-Bild, Bildbearbeitung, Text-zu-Video, Videobearbeitung, Suche, Agenten und Dokumente. Kostenlos, in sieben Sprachen und täglich aktualisiert.

Warum eine weitere Ranglisten-Website?

Weil Benchmark-Zahlen sich leise bewegen. Ein Modell klettert drei Plätze, ein Score wird neu berechnet, der gestrige Spitzenreiter rutscht auf den vierten Platz, und normalerweise gibt es keine Aufzeichnung darüber, dass sich etwas geändert hat. Wir behandeln Benchmarks so, wie Wikipedia Artikel behandelt: Jeden Tag speichert Wikiprompt eine vollständige Momentaufnahme der Ranglisten, und die Seite zeigt aktuelle Änderungen gegenüber der vorherigen Momentaufnahme. Die Historie bleibt dokumentiert.

Der zweite Grund ist die Quellenangabe. Unsere Tabellen zitieren, woher jede Zahl stammt, wie Wikipedia-Referenzen:

  • Elo-Werte, Konfidenzintervalle und Stimmenzahlen stammen von LMArena, den Crowdsourcing-Modell-Duellen, die als offener Datensatz veröffentlicht werden.
  • Preise, Kontextfenster und Wissensstichtage stammen von der öffentlichen OpenRouter-API.
  • Wir führen keine proprietären Bewertungen durch und wir kommentieren die Scores nicht. Wir aggregieren offene, gemeinschaftsgetriebene Daten, zitieren sie und behalten die Belege.

    Was die Arenen gerade sagen

    Ein paar aktuelle Spitzenreiter, direkt aus der heutigen Momentaufnahme:

  • Text: claude-opus-4-6-high führt mit einem Elo von etwa 1527 bei über 45.000 Gemeinschaftsstimmen.
  • Text-zu-Bild: gpt-image-2 (mittel) führt die Arena mit etwa 69.000 Stimmen an; es führt auch die Bildbearbeitung mit fast 200.000.
  • Text-zu-Video: gemini-omni-flash hält den ersten Platz.
  • Videobearbeitung: dreamina-seedance-2.5 ist das Modell, das es zu schlagen gilt.
  • Suche: claude-opus-4-6-search führt mit über 112.000 Stimmen.
  • Diese werden sich ändern. Das ist der Punkt: Wenn sie es tun, erscheint die Bewegung im Abschnitt "Aktuelle Änderungen", anstatt zu verschwinden.

    Wie es mit der Prompt-Enzyklopädie zusammenhängt

    Wikiprompt katalogisiert bereits Zehntausende von Prompts, die nach Modell getaggt sind. Der Benchmarks-Bereich schließt den Kreis: Sehen Sie, welches Modell eine Arena anführt, und springen Sie dann zu echten Prompts für dieses Modell, um es einzusetzen. Modellanleitungen wie Die besten GPT-Bild-Prompts und der Nano-Banana-Familienvergleich stehen neben den Ranglisten.

    Offen, wie alles andere hier

    Die Benchmarks-Seite folgt denselben Prinzipien wie der Rest von Wikiprompt: Die Zusammenstellung ist CC BY-SA, die Quellen sind offene Datensätze und öffentliche APIs, und der gesamte Prompt-Katalog ist als eine einzelne Datei herunterladbar. Wenn Sie die Benchmark-Daten selbst möchten, sind die von uns zitierten Quellen nur einen Klick entfernt.

    Überprüfen Sie die aktuellen Platzierungen unter wikiprompt.org/benchmarks. Sie werden nächste Woche anders aussehen, und Sie werden genau sehen können, wie.

    Tags
    nano-banana-2·image-generation·portrait·photorealistic·prompts·ai-art