译自英文

Kuzushiji-MNIST是一个包含70,000张手写日语平假名字符灰度图像的数据集,旨在作为机器学习研究中原始MNIST数据集的直接替代品。

Kuzushiji-MNIST是一个用于机器学习深度学习中图像分类的基准数据集。它包含70,000张28x28像素的灰度图像,内容是手写的日语平假名字符,分为60,000个样本的训练集和10,000个样本的测试集。该数据集是作为经典的手写数字MNIST数据集的现代替代品而创建的,后者自20世纪90年代末以来被广泛用于评估神经网络算法。Kuzushiji-MNIST保留了与原始MNIST相同的图像尺寸、数据格式和类别数量(10类),使其成为研究人员希望在更具挑战性和文化意义的任务上测试模型的直接替代品。

该数据集由东京大学和日本文学研究所的研究团队于2018年推出,由Tarin Clanuwat及其同事领导。它与两个相关数据集一起发布:Kuzushiji-49,包含49类平假名字符,以及Kuzushiji-Kanji,包含3,832类草书汉字。主要动机是解决历史日语文档的光学字符识别(OCR)问题,这些文档使用一种称为kuzushiji的草书体书写。这种字体从8世纪到19世纪被广泛使用,但在1900年教育改革后基本被废弃,导致数百万份历史文本对现代日语使用者来说无法阅读。

设计与构建

Kuzushiji-MNIST中的图像来源于大量扫描的历史日语书籍和手稿语料库。研究人员结合自动分割和手动标注,从这些文档中提取单个字符图像。每张图像随后被调整为28x28像素并转换为灰度,像素值范围从0(黑色)到255(白色),与原始MNIST数据集的格式完全匹配。10个类别对应于语料库中最常见的十个平假名字符,即:'o'、'ki'、'su'、'tsu'、'na'、'ha'、'ma'、'ya'、're'和'wo'。这些字符的选择旨在平衡类别频率和视觉区分度,确保分类任务既不过于简单也不过于困难。

该数据集以与原始MNIST相同的二进制格式分发,包含用于训练图像、训练标签、测试图像和测试标签的单独文件。这种兼容性允许研究人员使用现有的为MNIST设计的代码和流水线,无需修改即可直接替换为新数据文件。创建者还提供了Python加载脚本和详细的README,以便于集成到PyTorch和TensorFlow等常见深度学习框架中。

基准性能

自发布以来,Kuzushiji-MNIST已成为评估图像分类模型的标准基准,特别是在数据增强残差网络架构的背景下。该任务比原始MNIST明显更困难,因为平假名字符表现出更大的类内变异和不同类别之间的视觉相似性。例如,'su'和'tsu'的字符即使对不熟悉kuzushiji的人类读者也常常混淆。因此,在MNIST上达到近乎完美准确率的简单模型在Kuzushiji-MNIST上通常表现显著较差,使其成为更灵敏的模型容量和泛化能力测试。

Kuzushiji-MNIST上的最先进结果已通过使用带有批量归一化丢弃正则化的卷积神经网络(CNN)实现。截至2024年,最佳报告的测试准确率约为99.5%,由残差网络集成与广泛数据增强实现。然而,该数据集对轻量级模型和依赖手工特征的方法仍然具有挑战性,这些方法通常稳定在低于95%的准确率。该基准也被用于研究学习率调度权重初始化策略的效果,以及模型对标签噪声的鲁棒性。

应用与影响

Kuzushiji-MNIST的主要应用是作为推进历史日语文档OCR技术的研究工具。该数据集来源的更广泛Kuzushiji项目旨在数字化并使数百万以kuzushiji书写但当前对公众不可访问的书籍和手稿可搜索。通过提供标准化基准,该数据集使全球研究人员能够开发和比较识别草书字符的算法,这是实现这些文本自动转录的关键步骤。

除了其直接应用外,Kuzushiji-MNIST已被采用作为机器学习教育和研究中的通用测试平台。其与MNIST的相似性使其成为图像分类的易入门介绍,而其增加的难度鼓励探索更先进的技术。该数据集已在数百篇学术论文中被引用,并被包含在流行的机器学习库和课程材料中。它还被用于评估在拉丁字母或汉字等其他字符数据集上训练的模型的迁移能力,为跨字体泛化提供见解。

相关数据集与扩展

Kuzushiji-MNIST的创建者还发布了Kuzushiji-49,涵盖全部49个平假名字符,以及Kuzushiji-Kanji,涵盖3,832个汉字字符。这些数据集更大且更复杂,其中Kuzushiji-Kanji包含超过140,000张图像。它们旨在用于更高级的OCR任务和训练能够处理历史文档中全范围字符的模型。此外,Kuzushiji项目已发布一个大型标注的历史文本语料库,称为Kuzushiji数据集,包含带有字符级边界框的整页图像。该资源已被用于竞赛和协作研究工作,以开发端到端的转录系统。

在机器学习社区中,Kuzushiji-MNIST启发了类似努力,以创建文化多样化的基准,例如用于手写字母的EMNIST数据集和用于服装图像的Fashion-MNIST数据集。这些数据集共享与原始MNIST相同的格式和大小,允许跨不同领域直接比较模型性能。Kuzushiji-MNIST的成功凸显了保存和数字化历史字体的价值,它继续作为文化遗产保护与现代人工智能研究之间的桥梁。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:dataset·image-classification·japanese-ocr·benchmark
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史