TorchVision

TorchVision 是 PyTorch 官方推出的计算机视觉工具库,刚才我们加载 FashionMNIST 数据集的 torchvision.datasets 模块,就来自于它。

它的核心作用可以概括为 “拿数据、做处理、调模型、干杂活” 的一站式工具箱。

1. 核心组成模块

TorchVision 主要包含 4 大块,你可以把它们想象成一条流水线:

  • torchvision.datasets数据从哪里来
    提供常用数据集的 API,比如 ImageNet、CIFAR、COCO 等,当然也包括 FashionMNIST。它们都能自动下载、解压,并返回标准格式的数据。

  • torchvision.transforms数据怎么预处理
    提供图像裁剪、翻转、归一化等操作。在之前的例子中,我们用它把 FashionMNIST 的原始图片变成了 PyTorch 能理解的张量(Tensor)。

  • torchvision.models现成的模型骨架
    提供已经训练好的经典网络模型(如 ResNet、VGG),可以直接拿来用或在此基础上微调。对于 FashionMNIST 这种较简单的任务,你也可以用这些强大的模型。

  • torchvision.ops高级的视觉专用操作
    提供了 RoI Align(区域特征聚集)、NMS(非极大值抑制)等更专业的算子,常用于目标检测等任务,这部分在入门阶段接触得少一些。

2. 回到与 FashionMNIST 的关系

在 PyTorch 和 FashionMNIST 的关系里,TorchVision 充当了那个具体的执行者

  • PyTorch 是底层计算框架,负责张量计算和自动求导。
  • TorchVision 是位于上层的应用工具箱,直接给了你处理 FashionMNIST 所需的数据加载、预处理,甚至未来的模型。

如果你想看看用 torchvision.models 里的 ResNet 怎么在 FashionMNIST 上做迁移学习,我可以给你一个示例代码。

posted @ 2026-05-16 16:18  AceFenix  阅读(54)  评论(0)    收藏  举报