xuancx【学习笔记】从零开始的OCR-1 中发帖

摘要:引入OCR,以及对OCR整体流程的解释。 
该系列为学习OCR的过程,后续会发布有关OCR经典论文的讲解以及技术探讨
OCR是什么
Optical Character Recognition,全称为光学字符识别,简称OCR。是目前各个公司都在发展的技术,基本上聊到VLM就绕不开OCR。例如 百度(PaddleOCR 系列),阿里巴巴(LayoutLM 系列),商汤(ABCNet),旷视(DBNet),合合信息,腾讯(优图)…
核心就是一句话,把 图片上的文字信息 转化为 计算机的文字
难点在于,图片中的各种不稳定因素(遮挡,光照,角度,字体(多语言,多样性,大小))
分类
一般根据用途,可以是

文档文字识别,例如报纸,图书,PDF
自然场景识别,例如车牌,广告
票据,表格,证件等识别。其中表格还是很重要的,因为大部分做不好都是因为表格的问题。

按照文字的形成方式,又有: ...