Blog›Benchmarks

KI-Videomodelle, September 2026: Arena-Elo vs. menschliche Bewertungen vs. reale Nutzung

Gemini Omni führt die Arena an, Seedance 2.0 gewinnt die menschlichen Bewertungen pro Clip, und Veo 3 dominiert die Nutzung. Drei Datensätze, drei verschiedene Gewinner - und wie man wählt.

KI-Videomodelle, September 2026: Arena-Elo vs. menschliche Bewertungen vs. reale Nutzung

Die KI-Videogenerierung entwickelt sich schneller als jede andere Modalität, und das Bild, das man bekommt, hängt davon ab, wo man hinschaut. Die Community-Arena krönt eine Familie, menschliche Bewerter, die einzelne Clips bewerten, bevorzugen eine andere, und Prompt-Autoren stimmen mit ihren Tastaturen für eine dritte. Hier ist der Stand der KI-Videoerstellung vom September 2026, gestützt auf zwei Datensätze, die wir täglich veröffentlichen: das Text-zu-Video-Ranking und den eigenen Korpus von Wikiprompt mit über 6.900 Video-Prompts und bewerteten Ergebnissen.

Was die Arena sagt

Im heutigen Benchmark-Schnappschuss sieht die Spitze der Text-zu-Video-Arena nach Community-Elo wie folgt aus:

  • Gemini Omni 1.1 Flash (1515) und Gemini Omni Flash (1512) - Googles omni-modale Linie eroberte diesen Sommer die Video-Krone.
  • Flux 3 Video (1495) - Black Forest Labs' Expansion von Bildern zu Bewegung, der stärkste offen-nahe Eintrag.
  • Seedance 2.0 / 2.5 (1479 / 1476) - ByteDances Paar hält das Kopf-an-Kopf-Rennen eng.
  • MiniMax H3 (1460) - die Hailuo-Linie, in westlicher Berichterstattung durchweg unterschätzt.
  • Was menschliche Bewerter sagen, Clip für Clip

    Unser Korpus bewertet die tatsächliche Ausgabe jedes Prompts auf einer 1-5-"Wow"-Skala. Durchschnittliches Wow über die Video-Modelle mit 350+ bewerteten Prompts:

    | Modell | Prompts | Durchschnittliches Wow |

    |---|---|---|

    | Seedance 2.0 | 1.876 | 3,47 |

    | Kling | 614 | 3,38 |

    | Wan 2.1 | 423 | 3,26 |

    | Sora | 369 | 3,14 |

    | Hailuo | 937 | 3,09 |

    | Seedance 2.5 | 827 | 2,94 |

    | Veo 3 | 1.409 | 2,84 |

    Zwei Dinge springen ins Auge. Seedance 2.0 übertrifft seinen eigenen Nachfolger beim Wow pro Clip - eine Erinnerung daran, dass neuer nicht immer beeindruckender ist, wenn es um die Prompts geht, die Leute tatsächlich schreiben. Und Veo 3 rangiert hier niedriger als in Arenas: Seine Stärke (nativer Ton, Dialog) ist in Bewertungen von stummen Clips unsichtbar, was genau der Grund ist, warum man mehrere Ranglisten lesen sollte, bevor man ein Werkzeug wählt.

    Was Prompt-Autoren tatsächlich verwenden

    Nach Volumen dominieren Seedance 2.0 (1.876 Prompts) und Veo 3 (1.409) den Korpus; Wan 2.1 besitzt die lokale/offene Nische und Veo 2 bleibt das Budget-Arbeitspferd über die Gemini-API. Kling schlägt über sein Volumen hinaus in der Qualität (3,38 Wow bei 614 Prompts).

    Wie man in der Praxis wählt

  • Kinematografischer Realismus mit Ton: Veo 3 - schreibe den Ton in den Prompt.
  • Beste durchschnittliche Clip-Qualität pro Prompt: Seedance 2.0 - siehe den Seedance-Leitfaden.
  • Offene Gewichte / lokal: Wan 2.1, wobei 2.2 die Bewegung verbessert.
  • Charakterbewegung und Choreografie: Kling.
  • Weiter beobachten: Geminis Arena-Führung und Flux 3 Video - beide sind neu genug, dass sich ihre Prompt-Kultur noch formt, und unsere täglichen Schnappschüsse werden zeigen, ob das Elo hält.
  • Jede Zahl oben wird täglich aktualisiert: Text-zu-Video-Ranking · Benchmark-Verlauf · durchstöbere die Clips hinter den Bewertungen in der Prompt-Arena oder pro Modell bei Seedance, Veo 3, Kling, Wan 2.1.

    Tags
    video-generation·seedance·veo-3·kling·wan·gemini·benchmarks