官方网站-首页官方网站-首页

动态

2794 张标注图 + 三类细分,这份开源数据集搞定街头摊贩检测

发布时间:2026-07-16 16:14:52       阅读量: 61

  (来源:计算机视觉研究院)

  计算机视觉研究院

  公众号ID计算机视觉研究院

  学习群扫码在主页获取加入方式

  https://pmc.ncbi.nlm.nih.gov/articles/PMC12337018/pdf/main.pdf

  计算机视觉研究院专栏

  Column of Computer Vision Institute

  本文发布了StreetVendor-SLI 街头摊贩检测数据集,全程用消费级运动相机实拍制作,完全开源免费,还通过了 GDPR 隐私合规校验。今天就带大家快速拆解这份数据。

  PART/1

  背景   

  为什么我们急需一份摊贩检测数据集?

  街头摊贩是非正式就业的重要组成部分,准确掌握其规模与分布,是评估经济贡献、保障从业者权益、制定城市管理政策的基础。

  但传统调研方式痛点非常突出:

  •   摊贩流动性强、空间分散,常规问卷和访谈难以全面覆盖,数据缺口大;

  •   人工实地普查成本高、效率低,还存在一定侵入性,跨城市数据难以对比;

  •   过往研究大多依赖谷歌街景等第三方平台数据,不仅 API 费用逐年上涨,使用条款受限,且绝大多数数据集不公开,研究结果无法复现。

  这份 StreetVendor-SLI 数据集填补了公开领域的空白,同时提供了一套可复制的低成本制作流程,研究者可以参照方案在本地城市自行采集扩展。

  PART/2

  数据集

  这份数据集里都有什么内容?

  数据集最终包含 2794 张高清街景图像(原始图像 1397 张 + 数据增强后新增 1397 张),单图分辨率 2416×1359 像素,所有标注均采用 YOLO 格式,总数据量 4.63GB,已在 Zenodo 平台开源。

【数据集规格汇总表】

  整套数据分为 4 个独立文件夹,适配不同研究需求:

  :完成隐私脱敏的原始无标注图像,支持研究者自定义标注规则

  :原始图像 + 对应 YOLO 格式标注文件,可直接用于模型训练

  :经过数据增强的图像 + 同步调整的标注文件

  :分辨率降低 25% 的轻量版本,用于快速训练迭代

  标注方面,团队按照经营的流动性,将摊贩分为 3 个互斥类别,累计标注 2357 个目标框:

  • 固定摊位(1774 个)

      :全天固定在同一位置经营,如带遮阳伞的固定售货亭、常设摊位桌

  • 半固定摊位(459 个)

      :配备三轮车、手推车等移动设施,但经营时保持静止,可在不同时段转移位置

  • 流动摊贩(124 个)

      :随身携带商品边走边卖,使用篮子、背包、小型推车等轻便载具,商品存量有限

【三类街头摊贩分类示例图】
【LabelImg 工具标注效果示意图】

  PART/3

  实验    

  从街景实拍可用数据集,完整流程拆解

  整个数据集制作全程采用消费级设备和开源工具,可复现性极强,核心分为 4 个环节:

  1. 街景影像采集

  团队将 GoPro Hero 7 Black 运动相机固定在摩托车车把上,采用侧视视角拍摄。采集范围为哥伦比亚麦德林市中心 La Candelaria 区域,沿 10 条预设路线累计行驶 37 公里,单次行程 30-35 分钟。拍摄均在白天 9:00-12:00 进行,通过 Python 脚本从视频中每 2 秒提取 1 帧图像。

【数据采集路线样例图】

  采集过程也存在现实局限:雨天易造成镜头脏污、画面模糊;不同时段光照与相机参数差异,会导致图像尺寸、色彩不均衡;高分辨率图像也对存储和算力提出了更高要求。

  2. 隐私合规脱敏

  为严格符合欧盟 GDPR 个人数据保护法规,团队采用 “自动检测 + 人工复核” 的双重脱敏机制:

  •   自动阶段:基于 YOLOv7-tiny 模型自动识别行人面部与机动车车牌,通过高斯模糊完成打码;

  •   人工阶段:至少 2 名研究人员逐张核验,未完全脱敏的图像重新处理或直接剔除,确保无任何可识别个人信息。

【人脸检测与打码前后对比图】

  3. 精细化人工标注

  使用开源标注工具 LabelImg,为每张图像中的摊贩绘制轴对齐边界框,并按照上述三类标准分配类别标签。所有标注完成后,团队进行了二次人工校验,确保边界框位置准确、类别划分一致,最终筛选出 1397 张包含摊贩的有效图像。

  4. 数据增强扩容

  为缓解类别不平衡问题、提升模型泛化能力,团队通过 Albumentations 库对原始数据做了两类增强处理:

  •   几何变换:旋转、翻转、缩放、剪切

  •   光谱变换:亮度、对比度、饱和度、色调调整,以及模糊、直方图均衡化

  最终数据集规模扩充一倍至 2794 张。值得注意的是,团队保留了原始的类别比例,没有强行平衡样本 —— 因为现实中流动摊贩本身占比更低,强行平衡反而会引入偏差,影响研究真实性。

【数据增强效果示例图】

  此外,团队还提供了分辨率降低 25% 的轻量版本,可大幅缩短训练时长,适合模型快速迭代,研究者也可通过配套脚本自定义降低比例。

  PART/4

  亮点与局限

  1. 相比同类研究的核心优势

  和过往街头摊贩检测研究相比,这份数据集的差异化价值非常明确:

【相关研究对比表】
  • 完全开源可获取

      :是目前首个公开的街头摊贩目标检测数据集,支持免费学术研究;

  • 原创自主采集

      :不依赖第三方街景 API,无版权与使用限制,采集流程可完整复制;

  • 三类精细标注

      :首次按流动性对摊贩做细分标注,更适配城市治理、摊贩行为研究场景;

  • 全流程隐私合规

      :双重脱敏机制确保符合 GDPR 标准,规避数据伦理风险。

  2. 现有局限与注意事项

  •   样本规模有限:总图像量不足 3000 张,直接训练大模型泛化能力有上限,适合搭配迁移学习使用;

  •   地域单一性:数据仅来自哥伦比亚麦德林市,应用到其他城市、其他国家时,需考虑场景适配;

  •   画质存在差异:受天气、拍摄条件影响,部分图像存在模糊、色彩不均问题;

  •   高清文件偏大:原始分辨率图像体积大,对存储和训练硬件有一定要求。

  StreetVendor-SLI 的价值不止于一份数据集本身,更在于它提供了一套 “低成本采集 - 合规脱敏 - 精细标注 - 质量控制” 的完整方法论。对于全球研究城市非正式经济、城市治理的学者来说,这是一套可以直接复用的方案。

  当 AI 可以高效、低成本地盘点城市里的烟火气,管理者也能更科学地平衡城市秩序与民生温度,让街头摊贩真正成为城市的一部分。

  有相关需求的你可以联系我们!

特别声明:以上文章内容仅代表作者本人观点,不代表新浪网观点或立场。如有关于作品内容、版权或其它问题请于作品发表后的30日内与新浪网联系。
为了您更好的体验,请竖屏浏览
为了您更好的体验,请竖屏浏览。