MNIST数据库(修改版美国国家标准与技术研究院数据库)是一个包含大量手写数字的大型数据库,常用于训练各种图像处理系统。该数据库也广泛用于机器学习领域的训练和测试。它通过“重新混合”NIST原始数据集中的样本而创建。创建者认为,由于NIST的训练数据集取自美国人口普查局的雇员,而测试数据集取自美国高中生,因此不适合机器学习实验。此外,NIST的黑白图像被归一化以适应28x28像素的边界框,并进行了抗锯齿处理,从而引入了灰度级别。
MNIST数据库包含60,000张训练图像和10,000张测试图像。训练集的一半和测试集的一半取自NIST的训练数据集,而训练集的另一半和测试集的另一半取自NIST的测试数据集。数据库的原始创建者保留了一份在其上测试过的部分方法列表。在他们最初的论文中,他们使用支持向量机获得了0.8%的错误率。原始MNIST数据集至少包含4个错误标签。
历史
MNIST的开发之前有几个相关的数据集和基准。1988年,构建了一个来自美国邮政服务的数字数据集,包含从纽约州布法罗邮局处理的美国邮件上的手写邮政编码数字化得到的16x16灰度图像。训练集有7,291张图像,测试集有2,007张,总计9,298张。训练集和测试集都包含模糊、无法分类和错误分类的数据。该数据集用于训练和基准测试1989年的LeNet,这是一个开创性的神经网络。在测试集上,两名人类的平均错误率为2.5%。
特殊数据库
在20世纪80年代末,人口普查局对人口普查表格的手写自动数字化感兴趣,因此委托NIST的图像识别小组(IRG)评估OCR系统。多年的工作产生了几个“特殊数据库”和基准。对MNIST特别重要的是1990年5月发布的特殊数据库1(SD-1)、1992年2月发布的特殊数据库3(SD-3)和1992年4月发布的特殊数据库7(SD-7),即NIST测试数据1(TD-1)。它们以ISO-9660 CD-ROM形式发布。它们是通过要求人们填写“手写样本表格”(HSF),然后对HSF进行数字化,再分割出字母数字字符而获得的。每位书写者填写一份HSF。
每份HSF包含多个填写字段,人们被要求在其中书写。共有34个字段:姓名和日期条目、一个城市/州字段、28个数字字段、一个大写字段、一个小写字段,以及一个不受约束的宪法文本段落。每份HSF以300点每英寸(11.8点每毫米)的分辨率扫描。SD-1和SD-3是由3,400名永久性人口普查现场工作人员中的2,100人作为1990年美国人口普查的一部分,从同一组HSF构建的。SD-1包含分割后的数据输入字段,但不包含分割后的字母数字字符。SD-3包含从分割后的字母数字字符数字化的二进制128x128图像,其中有223,125个数字、44,951个大写字母和45,313个小写字母。
SD-7或TD-1是测试集,包含由马里兰州贝塞斯达的500名高中生书写的58,646张128x128二进制图像。他们被描述为“高中里在课堂上进行简短练习的数学和科学学生”。每张图像都附带一个唯一的整数ID,用于标识其书写者。SD-7以CD-ROM形式发布时没有标签,标签后来通过软盘发布。它不包含HSF。SD-7的难度足以使人类在其上的错误率达到1.5%。SD-3比SD-7中的图像更干净,更容易识别。欧洲风格的横线七(7)在SD-7中比在SD-3中更为常见。有人怀疑SD-3是由比SD-7的制作者更有动力的人制作的。此外,SD-3的字符分割器设计比SD-7的更旧,失败频率更高。有人怀疑,由于困难实例甚至无法通过分割器,因此它们被从SD-3的构建中过滤掉了。研究发现,在SD-3上训练和验证的机器学习系统在SD-7上的性能显著下降,错误率从不到1%上升到约10%。
1992年,NIST和人口普查局赞助了一场竞赛和会议,以确定该行业的技术水平。在竞赛中,团队在3月23日之前获得SD-3作为训练集,在4月13日之前获得SD-7作为测试集,并需在4月27日之前提交一个或多个用于分类SD-7的系统。共有来自7个不同国家的26家公司的45种算法被提交。5月27日和28日,所有提交结果的各方在马里兰州盖瑟斯堡召开了第一次人口普查OCR系统会议。联邦调查局、国税局和美国邮政服务的观察员出席了会议。获胜的参赛作品没有使用SD-3进行训练,而是使用了一个更大的专有训练集,因此不受分布偏移的影响。在25个确实使用SD-3进行训练的参赛作品中,获胜的是一个使用手工设计的、对欧几里得变换不变的度量的最近邻分类器。
SD-19于1995年发布,是SD-1、SD-3、SD-7及一些进一步数据的汇编。它包含814,255张字母数字的二进制图像和4,169份HSF的二进制图像,包括用于生成SD-7的那500份HSF。它于2016年更新。
MNIST
MNIST是在1994年夏天之前构建的。它通过混合SD-3和SD-7中的128x128二进制图像构建而成。具体来说,他们首先从SD-7中取出所有图像,并将其分为训练集和测试集,每个集来自250位书写者。这导致每个集中有近30,000张图像。然后,他们从SD-3中添加更多图像,直到每个集恰好包含60,000张图像。
每张图像被大小归一化以适应20x20像素的框,同时保持其纵横比,并进行抗锯齿处理以转换为灰度。然后,通过平移将其放入28x28的图像中,直到像素的质心位于图像中心。下采样过程的具体细节被重建。训练集和测试集最初都有60k个样本,但测试集中有50k个样本被丢弃,只使用了索引为24476到34475的样本,从而测试集仅剩10k个样本。
进一步版本
2019年,MNIST的完整60k测试集被恢复以构建QMNIST,其训练集有60k张图像,测试集有60k张图像。扩展MNIST(EMNIST)是NIST开发和发布的较新数据集,旨在作为MNIST的(最终)继任者,于2017年发布。MNIST仅包含手写数字的图像。EMNIST是从SD-19中的所有图像构建的,包括字母和数字,并为深度学习和人工智能研究提供了更具挑战性的基准。