MNIST数据集发布

译自英文

MNIST数据集是一个广泛使用的基准,包含70,000张手写数字图像,通过重新混合NIST数据集创建,于1998年发布,用于训练图像识别中的机器学习模型。

MNIST数据库(修改版美国国家标准与技术研究院数据库)是手写数字图像的大型集合,常用于训练和测试图像处理及机器学习系统。它通过重新混合原始NIST数据集中的样本创建,旨在解决NIST训练数据(来自美国人口普查局员工)和测试数据(来自美国高中生)的局限性,这些数据不适合机器学习实验。黑白图像被归一化为28x28像素的边界框,并进行了抗锯齿处理,引入了灰度级别。

MNIST包含60,000张训练图像和10,000张测试图像,每个集合的一半来自NIST的训练数据,另一半来自其测试数据。创建者维护了一份在该数据集上测试过的方法列表,其原始论文报告了使用支持向量机时的0.8%错误率。原始MNIST数据集包含至少四个错误标签,这是一个众所周知的怪癖。

前身与起源

在MNIST之前,USPS数据库(1988年)提供了来自美国邮件上手写邮政编码的较小数字数据集。它包含16x16灰度图像,有7,291张训练图像和2,007张测试图像,总计9,298张。该数据集包含模糊和错误分类的样本,且具有挑战性,人类错误率平均为2.5%。它被用于训练早期的1989年LeNet架构。

在1980年代末,人口普查局寻求自动化手写表格数字化,聘请了NIST的图像识别小组来评估OCR系统。他们的工作产生了几个特殊数据库:SD-1(1990年)、SD-3(1992年)和SD-7(1992年)。这些数据库基于手写样本表格(HSF)构建,以300 dpi扫描,包含姓名、数字和字母的各种字段。SD-3包含128x128二值图像的分段字母数字,包括223,125个数字,源自人口普查工作人员。SD-7是测试集,有来自500名高中生的58,646张图像,人类错误率为1.5%。值得注意的是,SD-3更干净且更容易,但在SD-3上训练的机器学习系统在SD-7上的性能下降至约-10%的错误率,突显了分布偏移。

1992年NIST竞赛使用SD-3作为训练数据,SD-7作为测试集,有来自26家公司的45种算法。获胜条目使用了专有训练集,而SD-3训练系统中表现最好的是具有不变度量的最近邻分类器。SD-19(1995年)结合了几个特殊数据库,包含814,255张图像。

MNIST的创建

在1994年夏天之前的某个时候,MNIST由SD-3和SD-7构建而成。创建者将SD-7的图像分为训练集和测试集,每个来自250位书写者,产生近30,000张图像。然后,他们用SD-3图像扩充每个集合,以达到每集60,000个样本。所有图像被大小归一化到20x20像素框,保持纵横比,并抗锯齿为灰度,然后通过调整质心居中在28x28图像中。下采样细节后来被重建。

最初,训练集和测试集都有60,000个样本,但为了减小测试集大小,丢弃了50,000个样本,仅保留索引24476到34475,从而得到10,000张测试图像。

评估与影响

MNIST成为机器学习深度学习研究中的标准基准。它被广泛用于比较算法,从简单的线性模型到复杂的神经网络模型。数据集的小图像尺寸和适中的类别数量使其非常适合原型设计。其公开可用性和清晰的基准使其成为常见的教育工具。

遗产与后继者

扩展MNIST(EMNIST)是NIST开发的新数据集,于2017年发布,作为MNIST的后继者。它包括手写数字和字母,类别更广泛。2019年,MNIST的完整60,000张测试集被恢复以创建QMNIST,为研究提供了更大的测试集。这些衍生数据集保持了MNIST的结构,同时扩展了其多样性。

参见

参考文献

  • Yann LeCun等人关于MNIST的原始论文,1998年(在源事实中提供)。
  • NIST特殊数据库出版物和OCR基准报告。
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning-dataset·handwritten-digits·benchmark·deep-learning
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史