译自英文

MMMU-Dev是MMMU基准测试的开发子集,旨在模型调优和验证,之后才在完整数据集上进行评估。

MMMU-Dev是“大规模多学科多模态理解”(MMMU)基准测试的开发子集,该数据集用于评估大型多模态模型的能力。它提供了一个较小且经过筛选的问题集合,研究人员和开发者可以用它来微调模型、测试流程,并在运行完整评估套件之前验证实验设置。开发集旨在反映主基准测试的结构和难度,为迭代式模型改进提供实用资源。

MMMU-Dev于2023年与完整的MMMU基准测试一同推出,由来自多个机构的研究团队开发,包括阿尔伯塔大学及其他学术合作伙伴。该基准测试旨在评估模型在需要大学水平知识的任务上的表现,涵盖六个学科:艺术与设计、商业、科学、社会科学、健康与医学,以及人文学科。开发集通常包含几百个问题,而完整基准测试包含数千个问题,并配有验证集和测试集用于全面评估。

目的与使用场景

MMMU-Dev的主要目的是支持多模态AI系统的开发周期。通过提供一个较小且易于管理的数据集,它使研究人员能够:

由于开发集是更大基准测试的子集,MMMU-Dev上的结果可以作为验证集和测试集预期表现的代理指标,但不能替代官方评估。

与完整MMMU基准测试的关系

MMMU-Dev是MMMU基准测试中三个分割之一:开发(dev)、验证(val)和测试(test)。开发集通常用于模型开发和内部实验,而验证集用于超参数调优和模型选择。测试集保留用于最终评估,并常用于排行榜中以公平比较模型。MMMU-Dev中的问题来自与完整基准测试相同的分布,确保在开发集上训练或调优的模型不会过拟合到特定子集。

该基准测试本身以强调大学水平、学科特定知识而著称,要求模型整合来自图像、图表、图示和文本的信息。这使得MMMU-Dev成为评估Large language model和多模态系统推理能力的挑战性资源。

评估指标与评分

MMMU-Dev上的性能通常使用准确率来衡量,定义为正确回答问题的百分比。每个问题为多项选择,包含四个选项,模型必须根据提供的图像和文本选择正确答案。该基准测试还按学科报告准确率,使研究人员能够识别特定知识领域的优势和不足。

为确保公平比较,基准测试提供了标准评估脚本,用于处理答案解析和评分。模型需要以特定格式输出答案,脚本会考虑措辞变化。这种标准化对于可重复研究和跨不同系统的结果比较至关重要。

局限性与注意事项

尽管MMMU-Dev是一个有价值的资源,但它存在局限性。开发集相对较小,可能导致性能估计的高方差。此外,问题是静态的,这意味着如果数据集反复用于微调,模型最终可能会记住答案。为缓解这一问题,研究人员通常仅将开发集用于初步实验,并依赖验证集进行最终模型选择。

另一个考虑因素是,MMMU-Dev与完整基准测试一样,主要使用英语,并侧重于西方学术知识。这可能限制其适用于其他语言和文化背景,尽管目前正在努力将多模态基准测试扩展到更多样化的领域。

参见

  • MMMU(如可用)
  • multimodal-learning(如可用)
  • AI benchmark(如可用)
  • evaluation(如可用)
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:dataset·benchmark·multimodal·evaluation
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史