如何把 PaddleOCR Agent Skills 装进 AI 应用:一句话文字识别与文档解析完整指南
如何把 PaddleOCR Agent Skills 装进 AI 应用一句话文字识别与文档解析完整指南【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR把 PaddleOCR Agent Skills 装进 Claude Code、OpenClaw 这类支持 Skills 的 AI 应用后一句自然语言就能完成 PaddleOCR 文字识别或文档解析全程不写代码。从环境准备到验收我们一次跑通。一、是什么、怎么选两个 Skill 各管一件事Skill 可以把一项任务的触发规则、调用步骤、配置要求和结果处理实践打包成一个模块AI 应用按需加载它自己就知道该调什么命令、怎么报错了。PaddleOCR 官方目前提供两个分工如下你的目标对应 Skill你能拿到什么只要图片或 PDF 里的纯文本paddleocr-text-recognition行级文本 边界框 置信度要保留标题、段落、表格、公式等结构paddleocr-doc-parsingMarkdown / 结构化结果判断标准很直接目标是纯文本走文字识别文档里含表格、公式、图表或多栏版面走文档解析。前者相当于把字读给我后者相当于把这份文档还给我。二、动手前的环境清单三件事先备好所有操作都在同一台设备完成开工前把下面三条勾掉即可Python 版本 ≥ 3.9运行python3 --version确认一下。装好 PaddleOCR 3.7.0 及以上pip install paddleocr3.7.0。拿到 access token登录百度 AI Studio在账户设置里的 Access Token 页面复制。后面要配给它。可以放心的是Skill 背后调用的paddleocr api是把文件提交到官方托管服务、等它跑完再取结果的子命令不做本地推理所以既不需要 GPU也不用装额外依赖组。三、把 Skill 装进 AI 应用按顺序试三条路两条 Skill 的源码都在仓库的 skills 目录规则细节可看文字识别 Skill 规则文件和文档解析 Skill 规则文件。安装按下面顺序来任一条走通即可停。路线 1skillsCLI需要先装 Node.jsnpx skills add PaddlePaddle/PaddleOCR -g --skill paddleocr-text-recognition -y npx skills add PaddlePaddle/PaddleOCR -g --skill paddleocr-doc-parsing -y这条方式会把 Skill 全局装到设备上装完各 AI 应用都能用。因为 PaddleOCR 仓库体积较大网络慢时命令可能超时此时先把仓库克隆下来再从本地路径安装git clone https://gitcode.com/GitHub_Trending/pa/PaddleOCR npx skills add ./PaddleOCR/skills/paddleocr-text-recognition npx skills add ./PaddleOCR/skills/paddleocr-doc-parsing路线 2clawhubOpenClaw 用户clawhub install paddleocr-text-recognition clawhub install paddleocr-doc-parsing路线 3手动拷贝兜底克隆仓库后把PaddleOCR/skills下你要的那个 Skill 目录拷到你 AI 应用指定的 Skills 位置。拷到哪里以 Claude Code、claude.ai、OpenClaw 各自的安装说明为准。只装一个 Skill 时上面所有命令也只保留对应那一条。四、把 token 交给你的应用PADDLEOCR_ACCESS_TOKEN 配置方法核心就是一个环境变量PADDLEOCR_ACCESS_TOKEN必填另有PADDLEOCR_BASE_URL可选API 服务地址不填就用官方服务。Claude Code在项目根目录的.claude/settings.local.json里加env字段把ACCESS_TOKEN换成你的 token{ env: { PADDLEOCR_ACCESS_TOKEN: ACCESS_TOKEN } }OpenClaw在~/.openclaw/openclaw.json里给对应 Skill 加上配置enabled置truetoken 填进env{ skills: { entries: { paddleocr-text-recognition: { enabled: true, env: { PADDLEOCR_ACCESS_TOKEN: ACCESS_TOKEN } }, paddleocr-doc-parsing: { enabled: true, env: { PADDLEOCR_ACCESS_TOKEN: ACCESS_TOKEN } } } } }其他应用直接把 token 以PADDLEOCR_ACCESS_TOKEN环境变量的形式提供给应用即可也可以不用环境变量在单次调用时用--token参数显式传入。五、第一次触发与验收提示词、关键参数和成功输出配置完就可以开口了。直接用自然语言描述任务再附上文件 URL 或本地路径AI 应用会自己挑对应的 Skill。下面四种说法都管用帮我把这张截图里的文字认出来逐行列出来你的图片链接把这个本地 PDF 里的文本都取出来C:\docs\invoice.pdf解析这份 PDF我要标题、正文和里面所有表格你的 PDF 链接解析本地文件 C:\docs\report.pdf给我完整的结构化结果。Skill 实际执行的是paddleocr api命令。--model_type必填取值ocr或doc_parsing--file_url与--file_path二选一手动验证时可以直接跑paddleocr api \ --model_type ocr \ --file_path ./document.pdf完整参数见 官方 API CLI 文档 或执行paddleocr api --help。成功时你会得到一段格式化 JSON未指定--output时打印到标准输出。文字识别结果重点看这几个字段{ jobId: job-xxx, pages: [ { prunedResult: { rec_texts: [Line 1, Line 2], rec_scores: [0.98, 0.95] }, ocrImageUrl: https://... } ] }验收就看两点pages是否覆盖目标页码、rec_texts内容是否与文档实际内容一致。文档解析--model_type doc_parsing的 JSON 结构不同每页带markdownText、markdownImages、outputImages验收时主要比对markdownText里的 Markdown 正文。六、排错、边界与提速失败输出怎么判断失败输出怎么判断命令出错时信息打到标准错误流stderr且退出码非零凭这两点就能判定失败。常见三类认证错误PADDLEOCR_ACCESS_TOKEN缺失或无效。先确认环境变量配没配、token 是否来自 AI Studio 且未过期。配额错误API 限流或配额用完稍后重试。未检测到内容输入是空白页或图里压根没有文字。SKILL.md 的要求是CLI 报错时向用户说明具体问题不要静默失败也不要悄悄回退到应用自身的视觉能力。两个 Skill 的适用范围paddleocr-text-recognition明确不接含表格、公式、图表或复杂版面的文档这类任务交给paddleocr-doc-parsing另一条展示规则结果要完整呈现给用户只有内容超过 10,000 字符时才允许省略。预处理开关何时关、何时留API 默认开着扭曲矫正use_doc_unwarping和方向分类use_doc_orientation_classify两项预处理。截图、扫描规范的文档这类平整且方向正确的输入可以直接关掉提速paddleocr api --model_type ocr --file_path ./document.pdf \ --use_doc_unwarping False --use_doc_orientation_classify False反过来文档照片弯曲折叠、透视变形明显或页面转了 90、180、270 度时预处理要保留别关。收尾拿真实文件跑一遍就通了到这里安装、token 配置、调用方式就都齐了。验收动作很简单从手头挑一份真实 PDF 或图片用上面任一句提示词发给你装好 Skill 的 AI 应用。输出 JSON 里的rec_texts或markdownText和文档实际内容对得上说明整条链路已经打通之后一句话就能出结果。【免费下载链接】PaddleOCRTurn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages.项目地址: https://gitcode.com/GitHub_Trending/pa/PaddleOCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考