手写评语散在纸质表和手机相册里查起来费劲。本文记录用 PaddleOCR 把评语图片批量转成文本、再用规则清洗入库的过程以及中文手写识别在真实场景中的表现。关键词标签OCR, PaddleOCR, Python, 数字化, 教育信息化一、评语都在纸上数据却在别处我管理一间小画室的日常。每节课结束老师会在纸质表上给学员写几句评语比如构图大胆线条控制还需要练习。这些纸大部分被收进文件夹偶尔有家长问起某节课的情况翻找一次要几分钟。2026 年 8 月开始我要求老师课后用工作手机把评语页拍一张照片上传到共享相册。一个月下来攒了四百多张图片。照片多了之后新的问题出现了图片里的文字没法搜索也没法统计。于是我决定用 OCR 把这批图片批量转成文本。二、技术选型和处理流程方案选了 PaddleOCR原因是它对中文手写体的识别在国内社区验证较多离线运行不依赖云服务学员照片不需要离开本地电脑这一点对儿童信息的隐私比较关键。处理流程分三步第一步用 Python 遍历共享相册导出的图片按文件名里的日期排序。文件名遵循之前定的命名规则形如 20260824_XX_学号_01.jpg班级和学员信息都能从文件名解析出来。第二步调用 PaddleOCR 识别图片区域。实测发现评语页通常是固定表格先用一个简单的坐标裁剪把评语列单独切出来再送入识别干扰会少不少。直接识别整页时表格线和页边的手写涂鸦会被误识别成标点。第三步把识别结果连同文件名解析出的日期、班级、学员编号一起写入 SQLite 表。整个流程一个脚本五十行左右跑完四百张图大约六分钟。三、识别率的真实情况数据要诚实说印刷体接近全对手写体就没这么理想。老师评语是行书加连笔PaddleOCR 的通用模型对它的字符准确率大概在七成上下。整段文字里几乎每两三句就有一两个错字比如需要识别成篅要“控笔识别成拧笔”。不过对使用场景来说七成的字符准确率加上模糊搜索已经够用了。我把识别文本入库后用 LIKE 查询加常见错字映射表来补偿比如建一个篅要→需要的替换词典跑完一轮人工抽查再补充词条。两周后按学员编号查询历史评语人工再核一遍原图一分钟内能定位到具体某节课写了什么。真正难识别的是课堂速记的缩写。老师习惯写构g.d这类自造缩写OCR 忠实地识别出字母但语义完全靠人补。这提醒我数据结构化的瓶颈往往不在算法而在原始记录的书写规范。后来我给老师提了一条要求评语里不用自造缩写识别准确率随之又抬了一点。四、跑通之后想到的这个尝试最大的收获不是那个脚本而是确认了一个判断手写场景下OCR 只能解决文字进库这一段后面的错字补偿、书写规范、人工抽查每一环都要设计。对小机构来说PaddleOCR 加 SQLite 这套组合零成本、离线可跑门槛主要在写规则和持续维护词典的耐心。后面我打算把同样的流程用到考勤签到表上那是另一批手写数据。我所在的机构叫画绛集美术做少儿美术教育快十年了。本文案例基于本人所在机构内部实践仅供同业参考不构成具体教学方案推荐
