AI视频模型,2026年9月:竞技场Elo vs 人类评分 vs 实际使用情况
Gemini Omni 在竞技场中领先,Seedance 2.0 在逐片段人工评分中胜出,而 Veo 3 在使用量上占据主导。三组数据,三个不同的赢家,,以及如何选择。

AI视频生成的发展速度目前超过其他任何模态,你看到的图景取决于你关注哪里。社区竞技场推崇一个家族,人工评分员对单个片段另有偏好,而提示词作者则用键盘投票给第三个选择。以下是2026年9月AI视频的现状,基于我们每日发布的两个数据集:文生视频排行榜和Wikiprompt自有的6,900多个带评分结果的视频提示词语料库。
竞技场怎么说
在今天的基准快照上,文生视频竞技场按社区Elo排名前列的是:
人工评分员怎么说,逐片段来看
我们的语料库对每个提示词的实际输出按1-5的“惊艳”等级评分。在拥有350多个评分提示词的视频模型中,平均惊艳分如下:
| 模型 | 提示词数 | 平均惊艳分 |
|---|---|---|
| Seedance 2.0 | 1,876 | 3.47 |
| Kling | 614 | 3.38 |
| Wan 2.1 | 423 | 3.26 |
| Sora | 369 | 3.14 |
| Hailuo | 937 | 3.09 |
| Seedance 2.5 | 827 | 2.94 |
| Veo 3 | 1,409 | 2.84 |
有两件事很突出。Seedance 2.0在逐片段惊艳分上超过了自己的继任者,这提醒我们,在人们实际写的提示词上,更新并不总是更令人印象深刻。而Veo 3在这里的排名低于在竞技场上的排名:它的强项(原生音频、对话)在无声片段评分中不可见,这正是为什么你在选择工具前应该阅读多个排行榜。
提示词作者实际用什么
按数量来看,Seedance 2.0(1,876个提示词)和Veo 3(1,409个)主导了语料库;Wan 2.1占据了本地/开源细分市场,而Veo 2通过Gemini API仍然是预算型主力。Kling在数量上超出其体量的质量表现(614个提示词,3.38惊艳分)。
实践中如何选择
以上每个数字每日更新:文生视频排行榜 · 基准历史 · 在提示词竞技场浏览评分背后的片段,或按模型查看Seedance、Veo 3、Kling、Wan 2.1。
Related Articles
- Instantánea de Evaluaciones de LLM, 22 de septiembre de 2026: Una Semana Congelada en la Cima
Sep 22, 2026 · 4 min read
- ## Instantâneo de Benchmark de LLM, 22 de setembro de 2026: Uma Semana Congelada no Topo
Sep 22, 2026 · 4 min read
- LLM基准快照,2026年9月22日:榜首冻结的一周
Sep 22, 2026 · 4 min read
- LLM Benchmark Snapshot, September 22, 2026: A Frozen Week at the Top
Sep 22, 2026 · 4 min read
- Aperçu des benchmarks LLM, 22 septembre 2026 : une semaine figée en tête
Sep 22, 2026 · 4 min read