官方网站-首页官方网站-首页

动态

1ms 推理 + 99.16% 准确率!YOLOv10 搞定 “地狱难度” 双语车牌识别

发布时间:2026-07-16 16:14:46       阅读量: 65

  (来源:计算机视觉研究院)

  计算机视觉研究院

  公众号ID计算机视觉研究院

  学习群扫码在主页获取加入方式

  https://pmc.ncbi.nlm.nih.gov/articles/PMC12639091/pdf/41598_2025_Article_24967.pdf

  计算机视觉研究院专栏

  Column of Computer Vision Institute

  本文提出YOLOv10 目标检测 + 定制微调的 Tesseract OCR搭建了一套完整方案,将泰英混合车牌的检测准确率提升至 99.16%,单图推理仅需 1 毫秒,甚至在低功耗的 Jetson Nano 开发板上都能实现 30 帧的实时运行。

  PART/1

  行业痛点   

  很多人好奇,不就是识别车牌吗,能有多难?泰国车牌的特殊之处,恰好戳中了传统 ALPR 系统的所有短板:

  :同一块车牌同时包含泰文与罗马字母,字符形态、书写逻辑差异巨大,通用 OCR 引擎适配性极差

  :私家车、商用车、公务车的配色、字体、布局各不相同,依赖固定特征的传统图像处理方法直接失效

  :光照变化、雨水雾气、运动模糊、污渍遮挡都会让识别准确率大幅波动

  :过往方案普遍数据集规模小、多在理想环境下测试,缺少极端场景验证,也很少考虑边缘设备的落地需求

  PART/2

  核心技术   

  针对这些痛点,研究团队设计了一套模块化的完整 ALPR 系统,从图像输入到数据输出全流程打通,整体分为 7 个功能层。

【The Proposed Automatic License Plate Recognition 系统整体架构图】

  整套方案的核心,是 “强检测 + 专识别” 的组合思路:

  • 检测端:YOLOv10 担纲主力

      凭借动态卷积核(DCK)与高级数据增强策略,YOLOv10 对小目标、复杂背景下的车牌定位能力显著提升,相比前代模型在精度和速度上都有明显优势。

  • 识别端:专项微调的 Tesseract OCR

      团队针对泰文 + 罗马双脚本的特点,对 Tesseract OCR 做了定制化训练,配合二值化、去噪、对比度归一化等预处理步骤,大幅提升了混合字体、特殊字符的识别准确率。

  除此之外,系统还加入了基于卡尔曼滤波的车牌跟踪模块,保证视频流中车牌身份的连续性;配套了数据库存储与 API 接口模块,可以直接对接交通管理、停车收费等业务系统。

【数据集训练 - 测试拆分与算法数据流向图】

  PART/3

  实验   

  为了验证方案的真实力,团队搭建了超大规模的泰国车牌数据集:包含 50000 张图片、10000 段 10-15 秒的视频片段,覆盖白天、夜间、雨天、雾天全场景,包含不同车型、不同字体、不同角度的车牌样本。

  基于这套数据集,研究团队用 SSD、Faster R-CNN、YOLOv5、YOLOv8、YOLOv9、YOLOv10 共 6 款主流模型做了横向对比,结果差距非常明显。

  1. 综合性能:精度速度双第一

【6 款模型训练效率、检测性能与特异性汇总表】

  从核心指标来看,YOLOv10 实现了全方位领跑:

  •   检测准确率 99.16%,位列所有模型第一,比第二名 YOLOv9 高出 0.2 个百分点,比传统 SSD 高出 9 个百分点

  •   单图推理仅需 1.0ms,是所有参测模型中最快的,速度是 Faster R-CNN 的 4.5 倍

  •   F1 分数达到 0.992,精准度与召回率做到了极致平衡

  •   训练时长 25 小时,在高精度模型中处于合理水平,兼顾了效果与训练成本

  2. 极端环境:性能衰减微乎其微

  真正体现方案含金量的,是复杂环境下的稳定性。

【不同环境条件下检测准确率对比柱状图】
【不同环境下各模型平均准确率与标准差详情表】
  •   白天场景:准确率 99.16%,表现拉满

  •   夜间场景:准确率仍保持 96.91%,远高于其他模型

  •   雨天、雾天场景:分别保持 96.34%、95.46% 的准确率,性能下降幅度远小于竞品

  哪怕是在最恶劣的雾天环境下,YOLOv10 的准确率依然超过 95%,这背后离不开高质量的数据集与完善的预处理、数据增强策略。

  3. 边缘落地:低算力设备也能跑实时

  不止实验室跑分好看,团队还把整套系统部署到了 NVIDIA Jetson Nano 这款低功耗边缘开发板上,最终实现了 30FPS 的实时处理能力,完全满足路口监控、停车场、收费站等场景的落地需求。这意味着这套方案不是 “实验室花瓶”,是真正可以低成本、规模化落地的实用技术。

  PART/4

  未来优化方向   

  这项研究的价值,远不止解决了泰国一个国家的车牌识别问题,更为非标准化、多语言的区域化 ALPR 方案提供了可复用的成熟范式。

  :“最新 YOLO 检测模型 + 场景化微调 OCR + 针对性预处理” 的组合思路,可以快速复制到其他多语言、非标准车牌的地区。

  :在低算力边缘设备上实现高精度实时运行,为智慧交通的前端分布式部署提供了可行路径。

  :5 万张图片 + 1 万段视频的多场景标注数据集,填补了泰语车牌领域的空白,为后续研究提供了高质量基准。

  研究团队也提到,后续会开展更大规模的实地道路测试,对比验证 EasyOCR、PaddleOCR 等更多 OCR 引擎,同时通过模型剪枝、量化等压缩技术进一步降低部署门槛。

  从实验室的高分数据,到边缘设备的真实落地,这套方案把车牌识别的精度和实用性拉到了新高度,也给场景化 AI 视觉的落地打了一个很好的样。

  有相关需求的你可以联系我们!

特别声明:以上文章内容仅代表作者本人观点,不代表新浪网观点或立场。如有关于作品内容、版权或其它问题请于作品发表后的30日内与新浪网联系。
为了您更好的体验,请竖屏浏览
为了您更好的体验,请竖屏浏览。