(来源:计算机视觉研究院)
计算机视觉研究院

公众号ID|计算机视觉研究院
学习群|扫码在主页获取加入方式
https://pmc.ncbi.nlm.nih.gov/articles/PMC12337018/pdf/main.pdf
计算机视觉研究院专栏
Column of Computer Vision Institute
本文发布了StreetVendor-SLI 街头摊贩检测数据集,全程用消费级运动相机实拍制作,完全开源免费,还通过了 GDPR 隐私合规校验。今天就带大家快速拆解这份数据。
PART/1
背景
为什么我们急需一份摊贩检测数据集?
街头摊贩是非正式就业的重要组成部分,准确掌握其规模与分布,是评估经济贡献、保障从业者权益、制定城市管理政策的基础。
但传统调研方式痛点非常突出:
摊贩流动性强、空间分散,常规问卷和访谈难以全面覆盖,数据缺口大;
人工实地普查成本高、效率低,还存在一定侵入性,跨城市数据难以对比;
过往研究大多依赖谷歌街景等第三方平台数据,不仅 API 费用逐年上涨,使用条款受限,且绝大多数数据集不公开,研究结果无法复现。
这份 StreetVendor-SLI 数据集填补了公开领域的空白,同时提供了一套可复制的低成本制作流程,研究者可以参照方案在本地城市自行采集扩展。
PART/2
数据集
这份数据集里都有什么内容?
数据集最终包含 2794 张高清街景图像(原始图像 1397 张 + 数据增强后新增 1397 张),单图分辨率 2416×1359 像素,所有标注均采用 YOLO 格式,总数据量 4.63GB,已在 Zenodo 平台开源。
【数据集规格汇总表】整套数据分为 4 个独立文件夹,适配不同研究需求:
:完成隐私脱敏的原始无标注图像,支持研究者自定义标注规则
:原始图像 + 对应 YOLO 格式标注文件,可直接用于模型训练
:经过数据增强的图像 + 同步调整的标注文件
:分辨率降低 25% 的轻量版本,用于快速训练迭代
标注方面,团队按照经营的流动性,将摊贩分为 3 个互斥类别,累计标注 2357 个目标框:
- 固定摊位(1774 个)
:全天固定在同一位置经营,如带遮阳伞的固定售货亭、常设摊位桌
- 半固定摊位(459 个)
:配备三轮车、手推车等移动设施,但经营时保持静止,可在不同时段转移位置
- 流动摊贩(124 个)
:随身携带商品边走边卖,使用篮子、背包、小型推车等轻便载具,商品存量有限
【三类街头摊贩分类示例图】
【LabelImg 工具标注效果示意图】PART/3
实验
从街景实拍可用数据集,完整流程拆解
整个数据集制作全程采用消费级设备和开源工具,可复现性极强,核心分为 4 个环节:
1. 街景影像采集
团队将 GoPro Hero 7 Black 运动相机固定在摩托车车把上,采用侧视视角拍摄。采集范围为哥伦比亚麦德林市中心 La Candelaria 区域,沿 10 条预设路线累计行驶 37 公里,单次行程 30-35 分钟。拍摄均在白天 9:00-12:00 进行,通过 Python 脚本从视频中每 2 秒提取 1 帧图像。
【数据采集路线样例图】采集过程也存在现实局限:雨天易造成镜头脏污、画面模糊;不同时段光照与相机参数差异,会导致图像尺寸、色彩不均衡;高分辨率图像也对存储和算力提出了更高要求。
2. 隐私合规脱敏
为严格符合欧盟 GDPR 个人数据保护法规,团队采用 “自动检测 + 人工复核” 的双重脱敏机制:
自动阶段:基于 YOLOv7-tiny 模型自动识别行人面部与机动车车牌,通过高斯模糊完成打码;
人工阶段:至少 2 名研究人员逐张核验,未完全脱敏的图像重新处理或直接剔除,确保无任何可识别个人信息。
【人脸检测与打码前后对比图】3. 精细化人工标注
使用开源标注工具 LabelImg,为每张图像中的摊贩绘制轴对齐边界框,并按照上述三类标准分配类别标签。所有标注完成后,团队进行了二次人工校验,确保边界框位置准确、类别划分一致,最终筛选出 1397 张包含摊贩的有效图像。
4. 数据增强扩容
为缓解类别不平衡问题、提升模型泛化能力,团队通过 Albumentations 库对原始数据做了两类增强处理:
几何变换:旋转、翻转、缩放、剪切
光谱变换:亮度、对比度、饱和度、色调调整,以及模糊、直方图均衡化
最终数据集规模扩充一倍至 2794 张。值得注意的是,团队保留了原始的类别比例,没有强行平衡样本 —— 因为现实中流动摊贩本身占比更低,强行平衡反而会引入偏差,影响研究真实性。
【数据增强效果示例图】此外,团队还提供了分辨率降低 25% 的轻量版本,可大幅缩短训练时长,适合模型快速迭代,研究者也可通过配套脚本自定义降低比例。
PART/4
亮点与局限
1. 相比同类研究的核心优势
和过往街头摊贩检测研究相比,这份数据集的差异化价值非常明确:
【相关研究对比表】- 完全开源可获取
:是目前首个公开的街头摊贩目标检测数据集,支持免费学术研究;
- 原创自主采集
:不依赖第三方街景 API,无版权与使用限制,采集流程可完整复制;
- 三类精细标注
:首次按流动性对摊贩做细分标注,更适配城市治理、摊贩行为研究场景;
- 全流程隐私合规
:双重脱敏机制确保符合 GDPR 标准,规避数据伦理风险。
2. 现有局限与注意事项
样本规模有限:总图像量不足 3000 张,直接训练大模型泛化能力有上限,适合搭配迁移学习使用;
地域单一性:数据仅来自哥伦比亚麦德林市,应用到其他城市、其他国家时,需考虑场景适配;
画质存在差异:受天气、拍摄条件影响,部分图像存在模糊、色彩不均问题;
高清文件偏大:原始分辨率图像体积大,对存储和训练硬件有一定要求。
StreetVendor-SLI 的价值不止于一份数据集本身,更在于它提供了一套 “低成本采集 - 合规脱敏 - 精细标注 - 质量控制” 的完整方法论。对于全球研究城市非正式经济、城市治理的学者来说,这是一套可以直接复用的方案。
当 AI 可以高效、低成本地盘点城市里的烟火气,管理者也能更科学地平衡城市秩序与民生温度,让街头摊贩真正成为城市的一部分。
有相关需求的你可以联系我们!
官方网站-首页



