MNIST 数据集详解:手写数字识别的经典数据集
创作时间:
作者:
@小白创作中心
MNIST 数据集详解:手写数字识别的经典数据集
引用
CSDN
1.
https://blog.csdn.net/qq_44154915/article/details/136606043
MNIST(Modified National Institute of Standards and Technology)是一个广泛使用的手写数字识别数据集,常被用于测试和验证机器学习模型的性能。该数据集包含了一系列28x28像素的灰度图像,每个图像都包含一个手写数字(0到9之间的数字)。以下是有关MNIST数据集的详细信息:
图像大小:每个图像的大小为28x28像素。这意味着每个图像由28行和28列的像素组成,总共784个像素。
标签:每个图像都有一个与之相关联的标签,表示图像中手写数字的真实值。标签是0到9之间的整数,对应于手写数字。
训练集和测试集:MNIST数据集通常被分为训练集和测试集。训练集用于训练机器学习模型,而测试集用于评估模型的性能。标准的分割方式是60,000张图像用于训练,10,000张用于测试。
灰度图像:MNIST中的图像是灰度图像,每个像素的强度表示为0到255之间的整数。0表示黑色,255表示白色。
数据预处理:在使用MNIST数据集进行训练之前,通常需要进行一些数据预处理。这可能包括将像素值进行归一化,将图像大小调整为模型所需的输入大小,以及对标签进行独热编码(one-hot encoding)等操作。
常用于入门:MNIST数据集通常被用作机器学习和深度学习的入门任务,因为它相对较小,容易处理,并且可以用于快速验证模型的正确性。然而,由于其相对简单的特性,一些高级模型和技术可能在更复杂的任务上表现更好。
挑战性:尽管MNIST是一个经典的数据集,但由于其相对简单的特性,它并不能真正代表现实世界中更复杂的图像识别问题。因此,一些研究者已经提出了更具挑战性的数据集,以推动计算机视觉领域的研究进展。
代码
import torch
from torchvision import datasets, transforms
import matplotlib.pyplot as plt
import seaborn as sns
import matplotlib
matplotlib.use('TkAgg')
# 设置全局字体
matplotlib.rcParams['font.sans-serif'] = ['SimHei']
matplotlib.rcParams['font.family'] = 'sans-serif'
# 设置设备
device = torch.device("cuda" if torch.cuda.is_available() else "cpu")
# 定义数据预处理和加载
transform = transforms.Compose([transforms.ToTensor()])
train_dataset = datasets.MNIST(root='./data', train=True, download=True, transform=transform)
# 获取训练集数据
train_loader = torch.utils.data.DataLoader(train_dataset, batch_size=len(train_dataset), shuffle=True)
data, labels = next(iter(train_loader))
# 数据统计
print("训练集样本数:", len(train_dataset))
print("图像大小:", data.shape[1:])
# 显示训练集中前几个样本的图像和标签
plt.figure(figsize=(10, 5))
for i in range(10):
plt.subplot(2, 5, i + 1)
plt.imshow(data[i].squeeze().numpy(), cmap='gray')
plt.title(f"Label: {labels[i].item()}")
plt.axis('off')
plt.show()
# 分析标签分布
plt.figure(figsize=(8, 5))
plt.hist(labels.numpy(), bins=range(11), align='left', rwidth=0.8)
plt.title("训练集标签分布")
plt.xlabel("标签")
plt.ylabel("样本数")
plt.show()
训练集样本数: 60000
图像大小: torch.Size([1, 28, 28])
热门推荐
地平线4遭遇DLL文件缺失?别慌,这里有详细的修复指南!
柴油的危险性全解析:从化学品分类到储存要求
美国宇航局发布最高质量木星图像,揭示气态巨行星神秘面纱
提速!全国最大规模铁路既有线换梁施工完成
揭秘黑神话悟空二郎神台词出处,隐藏结局的关键竟藏在这些经典之中
鹰击-21:成为反舰“利刃”,末端10马赫攻击,试问谁能拦得住?
吸附应用 | 如何准确表征介孔催化剂载体的孔径?
超市如何办理营业执照
干货 | 你的自由泳换气方式可能是有错误的
汽车信息查询指南:颜色查询与保险购买全攻略
高长恭:北齐的荣耀与悲剧
中小学校园餐新学期有了新变化
计算机科学的本质与核心:算法设计、数据结构、软件开发和信息处理
Windows系统下重置MySQL root账户密码的两种方法
小米SU7保费比玛莎拉蒂更贵?小米汽车回应:符合市场水平
农民工的内心世界:倾听他们的声音,理解他们的需求
有哪些有效的方法可以帮助我们发现自己在职场中的优势与不足进行自我评价
不管三七二十一的成语故事及出处
南疆名城库车市:曾经是大名鼎鼎的龟兹,目前属于阿克苏地区管辖
体积较小的细胞相对表面积(细胞体积越大,相对表面积越小,物质运输速率越慢)
天主教国家有哪些
右腿麻木的按摩方法:专业医生详解5种缓解方案
加班费怎么规定?下班后主管传信息我可以报加班吗?
夫妻角色是什么
呼吸介入领域迎新突破 远程支气管镜机器人引导肺结节活检术完成
脑梗死患者如何进行肌力训练
分公司与子公司的法律区分及实务运用
降火气喝什么?火气大喝什么最有效?3款降火饮品推荐
Steam乱码:原因、解决方案及预防措施
如何在阿里云服务器上安装安卓模拟器:详细步骤及注意事项