EMNIST(扩展MNIST)是一个手写字符数据集,在原始MNIST数字数据集的基础上扩展,同时包含数字以及大写和小写字母。它包含240,000张训练图像和40,000张测试图像,每张均为28x28的灰度图像。EMNIST广泛用于机器学习和深度学习研究,用于字符识别和分类算法基准测试等任务。
该数据集由格雷戈里·科恩、赛义德·阿夫沙尔、乔纳森·塔普森和安德烈·范·沙伊克于2017年在西悉尼大学MARCS大脑、行为与发展研究所引入。它是通过将NIST特别数据库19(包含来自超过3,600位书写者的手写样本)转换为与MNIST相同的格式而创建的。EMNIST比MNIST提供了更具挑战性的基准,因为它包含字母,类别更多,且某些字符之间的视觉相似性更高(例如,'O'和'0'、'I'和'l')。
变体与划分
EMNIST有多个变体,每个变体具有不同的类别结构。最常见的是EMNIST Letters,包含26个类别(A-Z)和145,600张训练图像。其他变体包括EMNIST Digits(10个类别,280,000张训练图像)、EMNIST Balanced(47个类别,112,800张训练图像)、EMNIST ByClass(62个类别,697,932张训练图像)和EMNIST ByMerge(47个类别,697,932张训练图像)。Balanced和ByMerge变体合并了某些字母大小写(例如,'C'和'c')以减少歧义,而ByClass则保持所有类别分开。
研究用途
EMNIST已成为评估神经网络架构和训练技术的标准基准。它常用于测试数据增强、丢弃、批归一化和其他正则化方法的改进。研究人员还使用EMNIST研究迁移学习,即在更大数据集上预训练的模型在EMNIST上进行微调。该数据集包含在PyTorch和TensorFlow等流行的机器学习库中,使其易于访问以进行实验。
与MNIST的关系
EMNIST被设计为MNIST的直接替代品,具有相同的图像大小和格式。然而,字母的加入增加了难度:类别数量从10个增加到最多62个,且类间相似性更高。这使得EMNIST成为现实应用中手写识别的更真实基准,例如邮政邮件分拣和表单处理。许多研究报告称,在MNIST上达到近乎完美准确率的模型在EMNIST上会出现显著下降,凸显了对更稳健方法的需求。
局限性与扩展
尽管范围更广,EMNIST仍存在局限性。它来源于单一来源(NIST),因此可能无法捕捉不同人群手写风格的完整多样性。图像还经过预处理以居中并归一化,这减少了变异性。为解决这些问题,研究人员创建了扩展版本,如Fashion-MNIST(服装图像)和Kuzushiji-MNIST(日文字符),但EMNIST仍是一个广泛使用的基线。截至2020年代初,EMNIST每年仍被数百篇论文引用,并常用于教育环境中教授深度学习概念。