KI-Videomodelle, September 2026: Arena-Elo vs. menschliche Bewertungen vs. reale Nutzung
Gemini Omni führt die Arena an, Seedance 2.0 gewinnt die menschlichen Bewertungen pro Clip, und Veo 3 dominiert die Nutzung. Drei Datensätze, drei verschiedene Gewinner - und wie man wählt.

Die KI-Videogenerierung entwickelt sich schneller als jede andere Modalität, und das Bild, das man bekommt, hängt davon ab, wo man hinschaut. Die Community-Arena krönt eine Familie, menschliche Bewerter, die einzelne Clips bewerten, bevorzugen eine andere, und Prompt-Autoren stimmen mit ihren Tastaturen für eine dritte. Hier ist der Stand der KI-Videoerstellung vom September 2026, gestützt auf zwei Datensätze, die wir täglich veröffentlichen: das Text-zu-Video-Ranking und den eigenen Korpus von Wikiprompt mit über 6.900 Video-Prompts und bewerteten Ergebnissen.
Was die Arena sagt
Im heutigen Benchmark-Schnappschuss sieht die Spitze der Text-zu-Video-Arena nach Community-Elo wie folgt aus:
Was menschliche Bewerter sagen, Clip für Clip
Unser Korpus bewertet die tatsächliche Ausgabe jedes Prompts auf einer 1-5-"Wow"-Skala. Durchschnittliches Wow über die Video-Modelle mit 350+ bewerteten Prompts:
| Modell | Prompts | Durchschnittliches Wow |
|---|---|---|
| Seedance 2.0 | 1.876 | 3,47 |
| Kling | 614 | 3,38 |
| Wan 2.1 | 423 | 3,26 |
| Sora | 369 | 3,14 |
| Hailuo | 937 | 3,09 |
| Seedance 2.5 | 827 | 2,94 |
| Veo 3 | 1.409 | 2,84 |
Zwei Dinge springen ins Auge. Seedance 2.0 übertrifft seinen eigenen Nachfolger beim Wow pro Clip - eine Erinnerung daran, dass neuer nicht immer beeindruckender ist, wenn es um die Prompts geht, die Leute tatsächlich schreiben. Und Veo 3 rangiert hier niedriger als in Arenas: Seine Stärke (nativer Ton, Dialog) ist in Bewertungen von stummen Clips unsichtbar, was genau der Grund ist, warum man mehrere Ranglisten lesen sollte, bevor man ein Werkzeug wählt.
Was Prompt-Autoren tatsächlich verwenden
Nach Volumen dominieren Seedance 2.0 (1.876 Prompts) und Veo 3 (1.409) den Korpus; Wan 2.1 besitzt die lokale/offene Nische und Veo 2 bleibt das Budget-Arbeitspferd über die Gemini-API. Kling schlägt über sein Volumen hinaus in der Qualität (3,38 Wow bei 614 Prompts).
Wie man in der Praxis wählt
Jede Zahl oben wird täglich aktualisiert: Text-zu-Video-Ranking · Benchmark-Verlauf · durchstöbere die Clips hinter den Bewertungen in der Prompt-Arena oder pro Modell bei Seedance, Veo 3, Kling, Wan 2.1.
Related Articles
- Instantánea de Evaluaciones de LLM, 22 de septiembre de 2026: Una Semana Congelada en la Cima
Sep 22, 2026 · 4 min read
- ## Instantâneo de Benchmark de LLM, 22 de setembro de 2026: Uma Semana Congelada no Topo
Sep 22, 2026 · 4 min read
- LLM基准快照,2026年9月22日:榜首冻结的一周
Sep 22, 2026 · 4 min read
- LLM Benchmark Snapshot, September 22, 2026: A Frozen Week at the Top
Sep 22, 2026 · 4 min read
- Aperçu des benchmarks LLM, 22 septembre 2026 : une semaine figée en tête
Sep 22, 2026 · 4 min read