Blog›Benchmarks

AI视频模型,2026年9月:竞技场Elo vs 人类评分 vs 实际使用情况

Gemini Omni 在竞技场中领先,Seedance 2.0 在逐片段人工评分中胜出,而 Veo 3 在使用量上占据主导。三组数据,三个不同的赢家,,以及如何选择。

AI视频模型,2026年9月:竞技场Elo vs 人类评分 vs 实际使用情况

AI视频生成的发展速度目前超过其他任何模态,你看到的图景取决于你关注哪里。社区竞技场推崇一个家族,人工评分员对单个片段另有偏好,而提示词作者则用键盘投票给第三个选择。以下是2026年9月AI视频的现状,基于我们每日发布的两个数据集:文生视频排行榜和Wikiprompt自有的6,900多个带评分结果的视频提示词语料库。

竞技场怎么说

在今天的基准快照上,文生视频竞技场按社区Elo排名前列的是:

  • Gemini Omni 1.1 Flash(1515)和Gemini Omni Flash(1512)- 谷歌的全模态系列今年夏天夺得了视频桂冠。
  • Flux 3 Video(1495)- Black Forest Labs从图像扩展到动态,是最强的开放邻近参赛者。
  • Seedance 2.0 / 2.5(1479 / 1476)- 字节跳动的这对组合保持了正面竞争的激烈态势。
  • MiniMax H3(1460)- Hailuo系列,在西方报道中一直被低估。
  • 人工评分员怎么说,逐片段来看

    我们的语料库对每个提示词的实际输出按1-5的“惊艳”等级评分。在拥有350多个评分提示词的视频模型中,平均惊艳分如下:

    | 模型 | 提示词数 | 平均惊艳分 |

    |---|---|---|

    | Seedance 2.0 | 1,876 | 3.47 |

    | Kling | 614 | 3.38 |

    | Wan 2.1 | 423 | 3.26 |

    | Sora | 369 | 3.14 |

    | Hailuo | 937 | 3.09 |

    | Seedance 2.5 | 827 | 2.94 |

    | Veo 3 | 1,409 | 2.84 |

    有两件事很突出。Seedance 2.0在逐片段惊艳分上超过了自己的继任者,这提醒我们,在人们实际写的提示词上,更新并不总是更令人印象深刻。而Veo 3在这里的排名低于在竞技场上的排名:它的强项(原生音频、对话)在无声片段评分中不可见,这正是为什么你在选择工具前应该阅读多个排行榜。

    提示词作者实际用什么

    按数量来看,Seedance 2.0(1,876个提示词)和Veo 3(1,409个)主导了语料库;Wan 2.1占据了本地/开源细分市场,而Veo 2通过Gemini API仍然是预算型主力。Kling在数量上超出其体量的质量表现(614个提示词,3.38惊艳分)。

    实践中如何选择

  • 带声音的电影级写实:Veo 3 - 把音频写进提示词里。
  • 每个提示词的最佳平均片段质量:Seedance 2.0 - 参见Seedance指南。
  • 开放权重/本地:Wan 2.1,其中2.2改进了动态效果。
  • 角色动作和编排:Kling。
  • 值得关注:Gemini Omni的竞技场领先地位和Flux 3 Video - 两者都足够新,它们的提示词文化仍在形成中,我们的每日快照将显示Elo是否保持。
  • 以上每个数字每日更新:文生视频排行榜 · 基准历史 · 在提示词竞技场浏览评分背后的片段,或按模型查看Seedance、Veo 3、Kling、Wan 2.1。

    Tags
    video-generation·seedance·veo-3·kling·wan·gemini·benchmarks