推出Wikiprompt LLM基准测试:实时排行榜,附有凭证
Wikiprompt 现已在十个竞技场中追踪 LLM 排行榜,每日快照,确保排名变化有据可查。数据来源于 LMArena 和 OpenRouter,引用方式类似维基百科参考文献,支持七种语言。

介绍Wikiprompt LLM基准测试:实时排行榜,有据可查
Wikiprompt现在有了基准测试板块:wikiprompt.org/benchmarks。面向大型语言模型和生成式AI的实时排行榜,涵盖十个领域:文本、网页开发、视觉、文生图、图像编辑、文生视频、视频编辑、搜索、智能体和文档。免费,支持七种语言,每天更新。
为什么还要另一个排行榜网站?
因为基准测试数据在悄然变化。一个模型上升了三个名次,某个分数被重新计算,昨天的榜首滑落到第四,而通常没有任何记录表明发生了什么变化。我们对待基准测试的方式就像维基百科对待词条一样:每天Wikiprompt都会存储排名的完整快照,页面会显示与上一次快照相比的近期变化。历史记录始终保留在案。
第二个原因是数据来源。我们的表格引用了每个数字的来源,就像维基百科的参考文献一样:
我们不运行任何专有评估,也不对分数进行主观评判。我们汇总开放、社区驱动的数据,引用它们,并保留凭证。
各领域目前的领先者
以下是今天快照中的一些当前领先者:
这些数据会变化。这正是关键所在:当它们变化时,变化会显示在“近期变化”部分,而不是消失不见。
它与提示词百科的关联
Wikiprompt已经收录了数万个按模型标记的提示词。基准测试板块形成了一个闭环:查看哪个模型在某个领域领先,然后跳转到该模型的真实提示词来实际使用它。模型指南如最佳GPT图像提示词和Nano Banana系列对比与排行榜并列展示。
开放,就像这里的一切一样
基准测试页面遵循与Wikiprompt其他部分相同的原则:汇编内容采用CC BY-SA许可,数据来源是开放数据集和公共API,整个提示词目录可以以单个文件的形式下载。如果你想要基准测试数据本身,我们引用的来源只需点击一下即可访问。
查看当前排名,请访问wikiprompt.org/benchmarks。下周它们会有所不同,而你将能清楚地看到变化的具体情况。
Related Articles
- Laya vs. Jev: Die Open-Source-Antwort auf die Entscheidungsmodell-Welle
Sep 22, 2026 · 5 min read
- Laya contre Jev : La réponse open-source à la vague des modèles de décision
Sep 22, 2026 · 5 min read
- Laya vs Jev: La respuesta de código abierto a la ola de modelos de decisión
Sep 22, 2026 · 5 min read
- Laya vs Jev: 오픈소스로 답하는 의사결정 모델 물결
Sep 22, 2026 · 5 min read
- लाया बनाम जेव: निर्णय-मॉडल लहर का ओपन-सोर्स उत्तर
Sep 22, 2026 · 5 min read