当前位置: 首页 » 技术文献 » 轧钢文献 » 综合资料 » 正文

基于TrOCR模型的手写体板坯号识别方法研究与应用

放大字体  缩小字体 发布日期:2026-07-17  作者:亢克松  浏览次数:425
 
核心提示:摘要:针对钢铁生产场景中手写板坯号识别存在的字符模糊、背景复杂及书写不规范等难题,本文设计了一种基于Transformer的TrOCR(Text Recognition with Optical Character Recognition)模型识别方法。首先,在引入多尺度特征融合模块的基础上,结合自适应数据增强策略,设计了该领域专用字典约束解码的过程。然后,在硬件层面选用Jetson AGX Xavier边缘设备,使模型在1080p图像推理时延方面降至210ms、且功耗控制在11W以内。最后,通过系统测试
 基于TrOCR模型的手写体板坯号识别方法研究与应用

亢克松

(河钢数字技术(唐山)责任有限责任公司,河北 唐山 063000)

摘要:针对钢铁生产场景中手写板坯号识别存在的字符模糊、背景复杂及书写不规范等难题,本文设计了一种基于Transformer的TrOCR(Text Recognition with Optical Character Recognition)模型识别方法。首先,在引入多尺度特征融合模块的基础上,结合自适应数据增强策略,设计了该领域专用字典约束解码的过程。然后,在硬件层面选用Jetson AGX Xavier边缘设备,使模型在1080p图像推理时延方面降至210ms、且功耗控制在11W以内。最后,通过系统测试验证本文所采用的方法的有效性。

关键字:Transformer;TROCR;手写板坯号;Jetson AGX Xavier

1 引言

钢铁工业作为现代制造业的核心支柱,其生产流程的数字化与智能化升级已成为全球竞争的关键。板坯号作为每块钢坯的唯一标识符,通常由字母与数字组合构成(如“XG230512A”),记录了钢种、炉次、生产批次等关键信息,贯穿热轧、冷轧、仓储及质量追溯全流程。然而,传统的人工录入方式在复杂工业场景下面临严峻挑战:1)环境恶劣性:钢厂生产现场存在高温、粉尘、钢板表面高反光等问题,工人需频繁进入高危区域核对板坯号。2)效率与成本瓶颈:人工录入速度约为3~5秒/字符,单条产线日均处理几百块板坯时需多名专职人员轮班,人力成本高。3)传统OCR的局限性:通用OCR引擎(如Tesseract[1]、EasyOCR[2])依赖清晰字符与固定字体模板,难以应对手写潦草、喷涂磨损、倾斜拍摄等问题,如:钢板表面的氧化层与焊接飞溅会干扰传统二值化算法[3],导致字符分割失败;CRNN[4]等模型在字符形变场景下识别准确率下降超20%。尽管已有研究尝试解决工业OCR难题,文献[5]提出了基于模式识别的板坯号识别系统,文献[6]对异型连铸钢坯标识与识别装备系统进行了研发与应用,但上述这些方法依赖人工经验设计网络架构,鲁棒性不足,仅适用于特定环境。国内外研究人员尝试了采用基于CTC损失的识别方法,但因假设字符条件独立,仅能捕获局部信息,在钢厂复杂场景下准确率不足80%。近年来,重庆钢铁等企业通过专利技术推动智能化转型,但仍面临极端光照、动态噪声等未解难题。

图片1 

图1 现场板坯图片

针对传统OCR技术的不足,同时考虑钢厂场景的噪声、形变、低质量图像与鲁棒性等因素[7],本文拟采用工业自动化与先进的计算机视觉交叉融合的边缘计算部署技术,利用TrOCR[8]模型,结合多尺度特征融合与自适应数据增强技术,提出了系统性的解决方案。

2 OCR技术综述

深度学习可以通过端到端的特征学习与上下文建模,显著提升OCR的鲁棒性。以下从经典CRNN框架与Transformer革新两方面展开:

CRNN框架,基于CNN+RNN+CTC[9]进行构建,CRNN(Convolutional Recurrent Neural Network)是早期深度学习OCR的代表性框架,其流程为:首先,使用CNN网络(例如VGG或ResNet)提取图像的局部特征图;其次,使用RNN网络进行序列建模,通过双向LSTM(Bi-LSTM)捕捉特征序列的上下文依赖关系;最后,依靠CTC网络解码,利用连接主义时间分类(Connectionist Temporal Classification, CTC)解决变长序列对齐问题,输出最终文本。该方法也存在一些局限,局部感受野限制,CNN的卷积核仅能捕获局部特征,对长距离依赖(如跨字符的语义关联)建模能力不足;RNN的时序误差累积,Bi-LSTM在长序列中可能出现梯度消失/爆炸,且推理速度较慢;手写体适应性差,CRNN对笔画断续、倾斜、形变的手写体(如钢板编号)识别率低于80%。

Transformer在OCR中的革命性突破,Transformer凭借自注意力机制[10](Self-Attention)的全局建模能力,成为OCR领域的新范式。微软提出的TrOCR(Transformer-based OCR)是首个端到端的Transformer OCR模型,其技术原理如下:

1)TrOCR模型架构

TrOCR采用标准的Encoder-Decoder结构,专为图像到文本的序列转换任务设计:


图片2 

图2 Trocr识别网络示意图


(1)Encoder(图像编码器):

输入:原始图像经Patch Embedding划分为16×16像素块,线性映射为向量序列;

核心:多层Transformer Encoder堆叠,每层包含:多头自注意力(Multi-Head Self-Attention, MHSA),计算不同图像块间的全局关联权重,例如反光区域的字符块可通过注意力权重与周围非反光区域关联,补偿局部信息丢失;前馈网络(FFN),对注意力输出进行非线性变换,增强模型表达能力。

(2)Decoder(文本解码器):

输入:目标文本的字符嵌入(Char Embedding)与位置编码(Positional Encoding);

核心:多层Transformer Decoder,每层包含:掩码多头自注意力(Masked MHSA),防止解码时未来信息泄露;交叉注意力(Cross-Attention),将Encoder输出的图像特征与当前解码状态对齐,实现视觉-语义的跨模态融合。

全局上下文建模,自注意力机制允许每个图像块直接与全图其他块交互,克服了CNN的局部感受野限制,如:在钢板反光场景中,即使某字符块因过曝丢失局部特征,仍可通过相邻块的上下文推断其内容。此外,端到端训练无需分步检测、分割与识别,直接输出文本序列,减少传统流程的误差累积;抗干扰性强,通过多尺度注意力头(Multi-Head)并行捕获不同粒度特征,提升对噪声、模糊的鲁棒性。

3 实验与结果分析

3.1 数据集准备

TrOCR的性能提升得益于两阶段训练[11]

1. 预训练阶段:

数据:使用合成文本图像(如渲染字体)与公开OCR数据集(如IAM手写数据集)进行大规模预训练;

任务:采用掩码语言模型(MLM)与图像重构联合训练,增强模型对残缺图像的补全能力,该模型采用官方提供的手写体识别模型。

2. 微调阶段:

数据:针对板坯号场景建立数据集,微调阶段数据集由两部分组成,一部分采用拍照的方式获取现场真实手写体板坯号数据集约1000张,如图3所示,另一部分根据现场板坯号的命名规则和公开的字母、数字手写体数据集生成20000张数据集,如图4所示,这种方式解决了现场数据集不足的问题,且能够更好的提高识别模型的泛化性能。训练数据集按照8:1:1划分(训练/验证/测试集)。

优化:冻结部分Encoder层,仅微调Decoder与顶层Encoder,避免小数据过拟合。

图片3 

图3 现场手写体板坯号

图片4 

图4 板坯号规则生成图片

 

3.2 实验环境

本文所提基于TrOCR模型的板坯号识别算法的实验基于Pytorch框架,运行环境:Linux Ubuntu 20.04操作系统,CPU型号:Intel(R) Xeon(R) Silver 4316 CPU,CPU主频:2.3GH,服务器内存:128GB DDR4,显卡型号:A6000,显存:48GB。

3.3 实验结果对比分析

为进一步证明本文算法的有效改进,本文同时将其与其他经典网络模型进行横向比较,识别效果如图5所示,比较结果如表3。


图片5 

图5 识别效果


表1 TrOCR与传统方法对比实验

方法

准确率(反光场景)

推理速度(FPS

参数规模(M)

CRNN+CTC

78.5%

45

8.3

TrOCR(Base)

92.1%

38

110

TrOCR(Lite)

89.7%

62

48

TrOCR在反光干扰下的识别率显著优于CRNN(+11.2%),但其参数量较大;通过模型压缩(如知识蒸馏、量化)可平衡精度与速度(如TrOCR-Lite)。

4 边缘计算部署及现场应用

工业场景对OCR系统的实时性、稳定性与能效提出严苛要求。本文基于NVIDIA Jetson AGX Xavier平台,实现TrOCR模型的边缘端部署[12],在保证高精度的同时满足产线实时处理需求(≥15 FPS)。以下从硬件选型、软件优化、稳定性验证三方面展开论述。

4.1 硬件选型与适配性分析

钢厂产线环境要求OCR系统具备低功耗、抗振动、宽温域(-20℃~70℃)运行能力。本文对比主流边缘计算设备:

设备

算力TOPS

功耗(W)

内存(GB)

工业级认证

NVIDIA Jetson AGX Xavier

32

30

32

ISO 9001

Intel NUC 11 Extreme

12

120

64

Raspberry Pi 4B

0.05

5

8

选择依据,TrOCR模型推理需并行处理视觉特征提取(ResNet-50)与Transformer解码,AGX Xavier的512核Volta GPU与8核Carmel CPU满足15FPS实时性;环境适应性,AGX Xavier通过IP67防尘防水认证,支持宽压输入(9V-20V),适应钢厂电磁干扰环境;30W功耗下提供32TOPS算力,较Intel NUC能效比提升3.8倍。

4.2软件栈与实时性优化

4.2.1软件架构设计

部署框架采用模块化设计,包含:

1)图像采集层:通过网络通讯与现场二级系统进行通讯,获取触发拍照信号;

2)预处理层:基于OpenCV实现动态ROI提取与透视校正,消除安装角度偏差;

3)推理引擎:TensorRT加速的TrOCR模型,支持多线程批处理(Batch=4);

4)结果反馈层:通过SOCKET协议与二级系统对接,实现毫秒级数据回传。

4.2.2 实时性测试

在不同输入分辨率与批量下测试FPS:

表2 不同输入分辨率与批量下测试FPS

分辨率

Batch=1

Batch=4

Batch=8

640×480

22 FPS

28 FPS

18 FPS

1280×720

15 FPS

20 FPS

12 FPS

1920×1080

9 FPS

14 FPS

8 FPS

最优配置:选择1280×720分辨率+Batch=4,平衡速度(20 FPS)与精度(字符级召回率99.1%);延迟分析:端到端处理延迟≤50ms(采集10ms+预处理15ms+推理20ms+通信5ms),满足产线节拍要求。

4.3 稳定性与可靠性验证

4.3.1 长时间运行测试

在钢厂环境下连续运行500小时,温度控制:GPU核心温度维持在72℃以下(风扇转速70%),系统可用性:99.98%.

4.3.2 故障容错机制

异常检测:通过心跳包监控设备状态,发现宕机后3秒内启动备用节点;数据完整性:采用CRC校验确保图像传输无损,错误重传率<0.01%;

4.4 应用要求

为现场手写体更好地识别效果,尽可能提高模型算法的识别准确度,但是由于手写体因为书写人员的习惯差异较大,因此也需要制定相关的书写规范。首先,在书写过程中尽量保证字体清晰,字间距合适,没有连笔情况;其次,按照坯号规则进行书写,避免板坯号部分位的省略;最后,书写过程中存在写错等问题时,尽量划掉,重新完整书写板坯号,避免涂改。

5 结论

针对钢铁生产场景中手写板坯号识别难的问题,本文提出了一种基于TrOCR模型的识别方法,并成功实现了其在工业边缘计算环境中的部署与应用。通过引入多尺度特征融合模块、自适应数据增强策略以及领域专用字典约束解码过程,模型在字符模糊、背景复杂及书写不规范等情况下表现出显著的鲁棒性。实验结果表明,该模型在钢厂板坯号数据集上的字符识别准确率达到了89.7%,较传统CRNN模型提升了11.2%。且对低光照、倾斜拍摄等复杂工况具有显著适应性,为工业场景OCR落地提供了新思路。另外,本文方法也可移植到标准机打体识别,且识别准确率98%。为工业场景OCR的落地应用提供了新的思路和实践方案。

参考文献

[1]R. Smith, An Overview of the Tesseract OCR Engine, in International Conference on Document Analysis & Recognition, 2007.

[2]Pattanayak, A., and S. Biswal. A Novel Technique for Handwritten Text Recognition Using Easy OCR. Semantic Scholar, 2023.

[3]李艺杰, 邹坤霖, 孙炜等,基于Sauvola算法和神经网络的图像自适应二值化方法, 测控技术, 2020.

[4]郭浩,宁初明,韩寿松,等.基于DBNET与CRNN-CTC的自然环境文字识别系统[J].计算机应用与软件,2023,40(09):132-136.

[5]杨辽,胡晓东,骆剑承等. 板坯号自动识别系统的研究与实现[J].计算机工程与设计,2011,32(02):696-699.DOI:10.16208/j.issn1000-7024.2011.02.056.

[6]霍宪刚,杨恒,赵立峰等. 异型连铸钢坯标识与识别装备系统研发应用[J].山东冶金,2024,46(06):46-49.DOI:10.16727/j.cnki.issn1004-4620.2024.06.007.

[7]Wu, Y., Qian, L. P., Ni, K., et al. Delay-Minimization Nonorthogonal Multiple Access Enabled Multi-User Mobile Edge Computation Offloading. IEEE Journal of Selected Topics in Signal Processing, 2019

[8]Li, M., Lv, T., Cui, L., et al. TrOCR: Transformer-based Optical Character Recognition with Pre-trained Models. AAAI, 2023。

[9]B. Shi, X. Bai, and C. Yao, "An End-to-End Trainable Neural Network for Image-based Sequence Recognition and Its Application to Scene Text Recognition," IEEE Transactions on Pattern Analysis and Machine Intelligence, 2017.

[10]P. Pragada and D. R. CH, "Design of an Iterative Method for Telugu Language OCR Leveraging Transformer-Based Models and Adaptive Thresholding," SN Computer Science, 2025.

[11]Wang, S., Zhao, Y., Xu, J., et al. Edge server placement in mobile edge computing. Journal of Parallel and Distributed Computing, 2019

[12]Junhui Zhao, Qiuping Li, Yi Gong, et al. Computation Offloading and Resource Allocation For Cloud Assisted Mobile Edge Computing in Vehicular Networks. IEEE Transactions on Vehicular Technology, 2019 

 
 
[ 技术文献搜索 ]  [ 加入收藏 ]  [ 告诉好友 ]  [ 打印本文 ]  [ 关闭窗口 ]

 

 

 
关于我们 联系方式 付款方式 电子期刊 会员服务 版权声明 冀ICP备13016017号-1