(来源:计算机视觉研究院)
计算机视觉研究院

公众号ID|计算机视觉研究院
学习群|扫码在主页获取加入方式
https://pmc.ncbi.nlm.nih.gov/articles/PMC12639091/pdf/41598_2025_Article_24967.pdf
计算机视觉研究院专栏
Column of Computer Vision Institute
本文提出YOLOv10 目标检测 + 定制微调的 Tesseract OCR搭建了一套完整方案,将泰英混合车牌的检测准确率提升至 99.16%,单图推理仅需 1 毫秒,甚至在低功耗的 Jetson Nano 开发板上都能实现 30 帧的实时运行。
PART/1
行业痛点
很多人好奇,不就是识别车牌吗,能有多难?泰国车牌的特殊之处,恰好戳中了传统 ALPR 系统的所有短板:
:同一块车牌同时包含泰文与罗马字母,字符形态、书写逻辑差异巨大,通用 OCR 引擎适配性极差
:私家车、商用车、公务车的配色、字体、布局各不相同,依赖固定特征的传统图像处理方法直接失效
:光照变化、雨水雾气、运动模糊、污渍遮挡都会让识别准确率大幅波动
:过往方案普遍数据集规模小、多在理想环境下测试,缺少极端场景验证,也很少考虑边缘设备的落地需求
PART/2
核心技术
针对这些痛点,研究团队设计了一套模块化的完整 ALPR 系统,从图像输入到数据输出全流程打通,整体分为 7 个功能层。
【The Proposed Automatic License Plate Recognition 系统整体架构图】整套方案的核心,是 “强检测 + 专识别” 的组合思路:
- 检测端:YOLOv10 担纲主力
凭借动态卷积核(DCK)与高级数据增强策略,YOLOv10 对小目标、复杂背景下的车牌定位能力显著提升,相比前代模型在精度和速度上都有明显优势。
- 识别端:专项微调的 Tesseract OCR
团队针对泰文 + 罗马双脚本的特点,对 Tesseract OCR 做了定制化训练,配合二值化、去噪、对比度归一化等预处理步骤,大幅提升了混合字体、特殊字符的识别准确率。
除此之外,系统还加入了基于卡尔曼滤波的车牌跟踪模块,保证视频流中车牌身份的连续性;配套了数据库存储与 API 接口模块,可以直接对接交通管理、停车收费等业务系统。
【数据集训练 - 测试拆分与算法数据流向图】PART/3
实验
为了验证方案的真实力,团队搭建了超大规模的泰国车牌数据集:包含 50000 张图片、10000 段 10-15 秒的视频片段,覆盖白天、夜间、雨天、雾天全场景,包含不同车型、不同字体、不同角度的车牌样本。
基于这套数据集,研究团队用 SSD、Faster R-CNN、YOLOv5、YOLOv8、YOLOv9、YOLOv10 共 6 款主流模型做了横向对比,结果差距非常明显。
1. 综合性能:精度速度双第一
【6 款模型训练效率、检测性能与特异性汇总表】从核心指标来看,YOLOv10 实现了全方位领跑:
检测准确率 99.16%,位列所有模型第一,比第二名 YOLOv9 高出 0.2 个百分点,比传统 SSD 高出 9 个百分点
单图推理仅需 1.0ms,是所有参测模型中最快的,速度是 Faster R-CNN 的 4.5 倍
F1 分数达到 0.992,精准度与召回率做到了极致平衡
训练时长 25 小时,在高精度模型中处于合理水平,兼顾了效果与训练成本
2. 极端环境:性能衰减微乎其微
真正体现方案含金量的,是复杂环境下的稳定性。
【不同环境条件下检测准确率对比柱状图】
【不同环境下各模型平均准确率与标准差详情表】白天场景:准确率 99.16%,表现拉满
夜间场景:准确率仍保持 96.91%,远高于其他模型
雨天、雾天场景:分别保持 96.34%、95.46% 的准确率,性能下降幅度远小于竞品
哪怕是在最恶劣的雾天环境下,YOLOv10 的准确率依然超过 95%,这背后离不开高质量的数据集与完善的预处理、数据增强策略。
3. 边缘落地:低算力设备也能跑实时
不止实验室跑分好看,团队还把整套系统部署到了 NVIDIA Jetson Nano 这款低功耗边缘开发板上,最终实现了 30FPS 的实时处理能力,完全满足路口监控、停车场、收费站等场景的落地需求。这意味着这套方案不是 “实验室花瓶”,是真正可以低成本、规模化落地的实用技术。
PART/4
未来优化方向
这项研究的价值,远不止解决了泰国一个国家的车牌识别问题,更为非标准化、多语言的区域化 ALPR 方案提供了可复用的成熟范式。
:“最新 YOLO 检测模型 + 场景化微调 OCR + 针对性预处理” 的组合思路,可以快速复制到其他多语言、非标准车牌的地区。
:在低算力边缘设备上实现高精度实时运行,为智慧交通的前端分布式部署提供了可行路径。
:5 万张图片 + 1 万段视频的多场景标注数据集,填补了泰语车牌领域的空白,为后续研究提供了高质量基准。
研究团队也提到,后续会开展更大规模的实地道路测试,对比验证 EasyOCR、PaddleOCR 等更多 OCR 引擎,同时通过模型剪枝、量化等压缩技术进一步降低部署门槛。
从实验室的高分数据,到边缘设备的真实落地,这套方案把车牌识别的精度和实用性拉到了新高度,也给场景化 AI 视觉的落地打了一个很好的样。
有相关需求的你可以联系我们!
官方网站-首页



