译自英文

MNIST数据库是一个包含70,000张手写数字图像的大型数据集,广泛用于训练和测试机器学习及图像处理系统。它通过重新混合NIST原始数据集中的样本而创建,并已成为该领域的基础基准。

MNIST数据库(修改版美国国家标准与技术研究院数据库)是一个大型手写数字数据库,常用于训练各种图像处理系统。它也广泛用于机器学习领域的训练和测试。该数据库是通过“重新混合”NIST原始数据集中的样本而创建的,因为创建者认为,取自美国人口普查局员工的原始训练数据集和取自美国高中生的测试数据集不适合机器学习实验。NIST的黑白图像被归一化以适应28x28像素的边界框,并进行了抗锯齿处理,从而引入了灰度级别。

MNIST数据库包含60,000张训练图像和10,000张测试图像。训练集的一半和测试集的一半取自NIST的训练数据集,而每一半的另一半则来自NIST的测试数据集。原始创建者维护了一份在其上测试过的方法列表;在他们最初的论文中,他们使用支持向量机实现了0.8%的错误率。原始MNIST数据集包含至少四个错误标签。

历史

USPS数据库

1988年,构建了一个来自美国邮政服务的手写数字数据集。它包含从纽约州布法罗邮局处理的美国邮件上的手写邮政编码数字化而来的16×16灰度图像。训练集有7,291张图像,测试集有2,007张,总计9,298张。两个集合都包含模糊、无法分类和错误分类的数据。该数据集用于训练和基准测试1989年的LeNet。任务很困难;在测试集上,两名人类以平均2.5%的错误率出错。

特殊数据库

在20世纪80年代末,人口普查局对自动数字化手写人口普查表格感兴趣,并委托NIST的图像识别小组(IRG)评估OCR系统。几年的工作产生了几个“特殊数据库”和基准。对MNIST特别重要的是1990年5月发布的特殊数据库1(SD-1)、1992年2月发布的特殊数据库3(SD-3)和1992年4月发布的特殊数据库7(SD-7)或NIST测试数据1(TD-1)。它们以ISO-9660 CD-ROM形式发布。数据是通过要求人们在“手写样本表格”(HSF)上书写,然后数字化表格并分割出字母数字字符而获得的。每位书写者填写一张HSF。

每张HSF包含多个输入字段,包括姓名和日期条目、城市/州字段、28个数字字段、一个大写字段、一个小写字段和一个不受约束的宪法文本段落。每张HSF以每英寸300点(每毫米11.8点)的分辨率扫描。

SD-1和SD-3是由3,400名永久性人口普查外勤人员中的2,100人作为1990年美国人口普查的一部分,从同一组HSF构建的。SD-1包含分割后的数据输入字段,但不包含分割后的字母数字字符。SD-3包含从分割后的字母数字字符数字化而来的二进制128×128图像,其中有223,125个数字、44,951个大写字母和45,313个小写字母。

SD-7(或TD-1)是测试集,包含由马里兰州贝塞斯达的500名高中生书写的58,646张128×128二进制图像,被描述为“高中数学和科学学生在课堂上进行的简短练习”。每张图像都附带一个唯一的整数ID,用于标识书写者的身份。SD-7以CD-ROM形式发布时没有标签,标签后来在软盘上发布。它不包含HSF。SD-7上的人类错误率为1.5%。

SD-3比SD-7更干净,更容易识别。欧洲风格的横线七(7)在SD-7中比在SD-3中更为常见。据推测,SD-3是由比SD-7更有动力的人产生的,并且SD-3的字符分割器(一种较旧的设计)更频繁地失败,从而过滤掉了更难的实例。在SD-3上训练和验证的机器学习系统在SD-7上的性能显著下降,错误率从不到1%上升到约10%。

1992年,NIST和人口普查局赞助了一场竞赛和会议,以确定当时的技术水平。团队在3月23日之前获得SD-3作为训练集,在4月13日之前获得SD-7作为测试集,并需在4月27日之前提交用于分类SD-7的系统。共有来自7个国家26家公司的45种算法被提交。5月27日和28日,所有各方在马里兰州盖瑟斯堡举行了第一次人口普查OCR系统会议,联邦调查局、国税局和美国邮政服务的观察员出席了会议。获胜的参赛作品没有使用SD-3进行训练,而是使用了一个更大的专有训练集,从而避免了分布偏移。在使用SD-3的25个参赛作品中,获胜者是一个使用手工设计的、对欧几里得变换不变的度量的最近邻分类器。

SD-19于1995年发布,是SD-1、SD-3、SD-7和更多数据的汇编。它包含814,255张字母数字的二进制图像和4,169张HSF的二进制图像,包括用于生成SD-7的500张HSF。它于2016年更新。

MNIST的构建

MNIST是在1994年夏天之前通过混合SD-3和SD-7中的128x128二进制图像构建的。具体来说,创建者首先从SD-7中取出所有图像,并将它们分成训练集和测试集,每个集来自250位书写者,每个集产生近30,000张图像。然后,他们从SD-3中添加更多图像,直到每个集恰好包含60,000张图像。

每张图像都被大小归一化以适应20x20像素的框,同时保持其纵横比,并进行抗锯齿处理以转换为灰度。然后,通过平移将其放入28x28图像中,直到像素的质心位于图像中心。下采样过程的细节后来被重建。

训练集和测试集最初都有60,000个样本,但测试集中的50,000个样本被丢弃,只留下索引为24,476到34,475的样本,因此测试集仅剩10,000个样本。

进一步版本

2019年,MNIST中完整的60,000张测试集被恢复以构建QMNIST,其训练集有60,000张图像,测试集有60,000张图像。

扩展MNIST(EMNIST)是NIST开发和发布的较新数据集,作为MNIST的继任者,于2017年发布。虽然MNIST仅包含手写数字,但EMNIST是从SD-19中的所有图像构建的,包括字母和数字,并为深度学习人工智能研究提供了更具挑战性的基准。

遗产

MNIST已成为机器学习教育和研究中的基本基准,通常用作新算法和架构的首次测试。其简单性和小尺寸使其非常适合教授神经网络训练和评估的概念。该数据集的广泛采用影响了后续基准的开发,并促进了该领域的发展,包括深度学习生成式人工智能的进步。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:dataset·machine-learning·computer-vision·benchmark
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史