Blog›Guides

推出Wikiprompt LLM基准测试:实时排行榜,附有凭证

Wikiprompt 现已在十个竞技场中追踪 LLM 排行榜,每日快照,确保排名变化有据可查。数据来源于 LMArena 和 OpenRouter,引用方式类似维基百科参考文献,支持七种语言。

推出Wikiprompt LLM基准测试:实时排行榜,附有凭证

介绍Wikiprompt LLM基准测试:实时排行榜,有据可查

Wikiprompt现在有了基准测试板块:wikiprompt.org/benchmarks。面向大型语言模型和生成式AI的实时排行榜,涵盖十个领域:文本、网页开发、视觉、文生图、图像编辑、文生视频、视频编辑、搜索、智能体和文档。免费,支持七种语言,每天更新。

为什么还要另一个排行榜网站?

因为基准测试数据在悄然变化。一个模型上升了三个名次,某个分数被重新计算,昨天的榜首滑落到第四,而通常没有任何记录表明发生了什么变化。我们对待基准测试的方式就像维基百科对待词条一样:每天Wikiprompt都会存储排名的完整快照,页面会显示与上一次快照相比的近期变化。历史记录始终保留在案。

第二个原因是数据来源。我们的表格引用了每个数字的来源,就像维基百科的参考文献一样:

  • Elo评分、置信区间和投票数来自LMArena,这是一个众包式的模型对战平台,以开放数据集的形式发布。
  • 定价、上下文窗口和知识截止日期来自公开的OpenRouter API。
  • 我们不运行任何专有评估,也不对分数进行主观评判。我们汇总开放、社区驱动的数据,引用它们,并保留凭证。

    各领域目前的领先者

    以下是今天快照中的一些当前领先者:

  • 文本:claude-opus-4-6-high以约1527的Elo评分领先,获得了超过45,000次社区投票。
  • 文生图:gpt-image-2(中等)以约69,000票位居该领域榜首;它还在图像编辑领域以近200,000票领先。
  • 文生视频:gemini-omni-flash保持第一。
  • 视频编辑:dreamina-seedance-2.5是当前最强的模型。
  • 搜索:claude-opus-4-6-search以超过112,000票领先。
  • 这些数据会变化。这正是关键所在:当它们变化时,变化会显示在“近期变化”部分,而不是消失不见。

    它与提示词百科的关联

    Wikiprompt已经收录了数万个按模型标记的提示词。基准测试板块形成了一个闭环:查看哪个模型在某个领域领先,然后跳转到该模型的真实提示词来实际使用它。模型指南如最佳GPT图像提示词和Nano Banana系列对比与排行榜并列展示。

    开放,就像这里的一切一样

    基准测试页面遵循与Wikiprompt其他部分相同的原则:汇编内容采用CC BY-SA许可,数据来源是开放数据集和公共API,整个提示词目录可以以单个文件的形式下载。如果你想要基准测试数据本身,我们引用的来源只需点击一下即可访问。

    查看当前排名,请访问wikiprompt.org/benchmarks。下周它们会有所不同,而你将能清楚地看到变化的具体情况。

    Tags
    nano-banana-2·image-generation·portrait·photorealistic·prompts·ai-art