Cityscapes数据集介绍与下载
下载地址 夸克网盘
数据集简介
Cityscapes是计算机视觉领域广泛使用的城市街道场景理解基准数据集,由戴姆勒研究院、马克斯·普朗克信息学研究所和达姆施塔特工业大学联合发布。该数据集包含从50个不同城市采集的双目视频序列,涵盖春、夏、秋三季以及多种天气和光照条件,旨在评估视觉算法在城市场景语义理解中的性能。
数据集的核心标注包括5000帧高质量像素级精细标注,以及20000帧弱标注图像。标注类别涵盖30个类,归为8个大类:平面、人类、车辆、建筑、物体、自然、天空和无效区域。精细标注中,2975张用于训练、500张用于验证、1525张用于测试,覆盖19个评估类别。
主要ZIP文件说明
图像文件
leftImg8bit_trainvaltest.zip(约11 GB)
包含训练集、验证集和测试集的左侧8位彩色图像,共5000张,分辨率统一为1024×2048像素。这是语义分割任务最基础的图像输入文件。需要注意,测试集的精细标注(真实标签)并未公开,官方测试集分数需将预测结果提交至Cityscapes评估服务器获取。
leftImg8bit_trainextra.zip(约44 GB)
包含19998张额外的左侧8位图像,用于训练集扩充。这些图像仅有粗粒度标注,适用于研究利用大量弱标注数据的方法。注意其中文件“troisdorf_000000_000073_leftImg8bit.png”存在损坏问题。
leftImg8bit_blurred.zip(约11 GB)
与leftImg8bit_trainvaltest.zip内容相同,但对人脸和车牌进行了模糊处理,适用于对隐私保护有要求的场景。
rightImg8bit_trainvaltest.zip
包含右侧8位彩色图像,用于双目视觉任务。与左侧图像构成双目图像对,可用于视差推断和深度估计研究。
标注文件
gtFine_trainvaltest.zip(约241 MB)
精细标注文件,覆盖训练集和验证集的3475张图像,以及测试集的1525张图像(测试集标注仅为占位符,实际类别标注未公开)。解压后包含三个关键文件类型:
-
*_gtFine_color.png:以颜色编码的类别标签,便于可视化 -
*_gtFine_labelIds.png:以类别索引编码的标签,用于训练 -
*_gtFine_instanceIds.png:同时编码类别和实例ID。像素值除以1000的整数部分为类别ID,余数为实例ID
gtCoarse.zip(约1.3 GB)
粗粒度标注文件,包含训练集、验证集以及trainextra集的标注,覆盖约23473张图像。适用于弱监督学习或预训练任务。
传感器与车辆数据
camera_trainvaltest.zip(约2 MB) / camera_trainextra.zip(约8 MB)
包含相机的内参和外参标定参数,分别对应trainvaltest集和trainextra集。对于需要多视图几何或精确投影的任务至关重要。
vehicle_trainvaltest.zip(约2 MB) / vehicle_trainextra.zip(约7 MB)
包含车辆里程计数据、GPS坐标和温度信息,分别对应两个数据子集。可用于研究自车运动、定位或场景理解中的上下文信息利用。
视差与视频数据
disparity_trainvaltest.zip(约3.5 GB)
包含双目视差图,用于深度估计和立体视觉研究。与左右双目图像配合使用。
leftImg8bit_demoVideo.zip(约6.6 GB)
包含用于定性评估的视频序列,仅含左侧8位图像。视频数据提供了帧间连续性,适用于时序方法的研究。
扩展标注
gtBbox_cityPersons_trainval.zip
包含行人的边界框标注,用于目标检测任务。
gtBbox3d_trainvaltest.zip
Cityscapes 3D扩展标注,为所有车辆类型提供3D边界框,用于3D检测任务。
gtFinePanopticParts_trainval.zip
全景分割部件标注,支持全景分割任务的研究。
使用建议
下载时优先考虑leftImg8bit_trainvaltest.zip和gtFine_trainvaltest.zip,这两个文件合计约11 GB,足以覆盖语义分割的标准训练与验证流程。如果仅做流程验证,可先使用8张图像的Cityscapes8子集进行快速测试。训练时需注意,Cityscapes原始标签ID需通过映射转换为标准的19个训练ID,无效或忽略的标签映射为255以在损失计算中排除。
浙公网安备 33010602011771号