U-Net

结构

编码器:下采样路径(逐步缩小特征图,分辨率降低,通道数增加)

解码器:上采样路径(逐步恢复分辨率,分辨率提高,通道数降低)

跳跃连接:编码器某层直接接到解码器对应层

image

编码器(下采样路径):从 细节 到 语义

  • 浅层对应高分辨率,深层对应低分辨率
    • 因为下采样在逐层缩小特征图尺寸
      • 浅层:刚进入网络,还没怎么下采样,所以分辨率高。感受野小,只能看到局部,所以提取的是细节。
      • 深层:经过多次下采样,分辨率很低。但感受野变得很大(能看到整张图),所以提取的是全局语义。
  • 编码器的作用:从 看见一棵树的每片叶子 逐渐变成 看见这是一片森林
层级 特征图分辨率 提取的内容
浅层(第1层) 最高H×W 局部细节:边缘、颜色、纹理、噪点、小斑点
中间层(第2-3层) 中等 局部结构:形状片段、角点、曲线、小物体部件
深层(第4层及瓶颈) 最低H/8*W/8 全局语义:这是什么物体、整体布局、类别信息

解码器(上采样路径):从 语义 到 细节

  • 为什么解码器能 重建结构化的表示 ?
    • 输入1:上一层的上采样结果
    • 输入2:编码器对应层的跳跃连接
    • 两者融合后能同时兼顾 全局语义正确性 和 局部细节精确性
  • 解码器的作用:从 这是一篇森林 逐渐恢复 每片叶子的形状和颜色
层级 特征图分辨率 提取的内容
深层解码器 基于全局语义,先恢复一个 粗糙的轮廓
中间解码器 中等 逐步添加更细的结构信息
浅层解码器 恢复最终的精细纹理和像素级细节

U-Net作用

  • 不是 保留原图 或 复制原图,目的是 从原图中提炼出它的灵魂(语义),然后用这个灵魂去完成一个特定的任务
  • 下采样(阅读理解):先通读几篇关于猫的文章,提取中心思想、描写手法和结构(压缩成低分辨率的语义向量)。此时你手里没有原句,只有一份写作大纲。
  • 上采样(自由创作):你拿着这份大纲,结合你自己的词汇量和写作经验(预训练经验),重新写出一篇全新的、关于猫的作文(输出高分辨率特征)。

总结

  1. 下采样不是为了要一张缩小的图,而是为了理解原图的结构和含义
  2. 上采样不是为了还原原图,而是为了把刚才理解到的含义,用在新的任务上
posted @ 2026-07-09 22:09  jsqup  阅读(9)  评论(0)    收藏  举报