译自英文

LMArena(前身为Chatbot Arena)是一个源自加州大学伯克利分校的众包平台,通过盲测成对人类比较和类Elo评分系统,对AI语言和图像模型进行排名。

LMArena,最初以Chatbot Arena之名推出,是一个众包的评估平台,通过公众投票的盲测、两两比较来对大型语言模型及其他生成式模型进行排名。用户提交提示词,接收来自两个匿名模型的回复,并投票选出更优答案;这些投票输入一个类似Elo的评分系统,生成持续更新的排行榜。该项目起源于加州大学伯克利分校,出自开发Vicuna开源权重模型的同一研究团队,后来独立成为一家公司。

历史

Chatbot Arena于2023年推出,作为比较指令微调聊天模型的研究工具,当时基准测试MMLU等标准指标日益被认为已饱和或易受训练数据污染影响。由于该竞技场依赖实时人类偏好而非静态测试集,它迅速被开源开发者及主要实验室采用,这些机构在发布新模型时开始引用竞技场排名,与正式基准分数并列。该项目于2025年更名为LMArena,因其扩展至文本聊天之外的图像、视频及编程专用竞技场,同时其伯克利关联创始人组建了一家公司,独立运营该平台,同时保持排行榜免费开放。

方法与影响

LMArena的排名系统采用改编自国际象棋及其他竞技评分场景的Elo公式,随新投票到达而更新,并辅以统计控制,以应对批评者指出的因素,如回复风格和长度,这些可能使人类评分者偏向更冗长或风格自信的答案,而不论其正确性。为此引入了排行榜的风格控制变体。包括OpenAIGoogle DeepMindAnthropicxAIDeepSeek在内的实验室均在排行榜上占据显著位置,而强劲的竞技场排名成为新模型发布(如GeminiGrokDeepSeek-R1)的营销亮点。

批评

LMArena面临批评,认为实验室可提交多个未发布模型变体至竞技场,以在公开发布前选出表现最佳的检查点,实质上是针对测试而非通用质量进行优化,这一指控在2025年Meta的Llama 4发布时尤为突出。研究人员还质疑,由自我选择的爱好者投票者主导的众包审美偏好,是否与SWE-benchHumanEval等基准所衡量的现实任务表现良好相关。尽管存在这些批评,LMArena仍是行业内比较模型质量时被引用最广泛的公共参考点之一。

分类:evaluation·benchmarks·industry
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史