将任意文档与图像转化为
结构化 AI 就绪数据。
PaddleOCR 是由百度飞桨团队打造的高性能、超轻量开源 OCR 与文档 AI 引擎。精准解析 PDF、复杂表格、数学公式与多语言文本,无缝赋能大模型与 RAG 知识库。
为什么开发者与企业选择 PaddleOCR
从边缘设备轻量推理到大型私有化企业级文档 AI 流水线,提供一站式完整解决方案。
PP-OCRv6 旗舰识别引擎
最新一代核心模型,检测准确率提升 +4.6%,识别准确率提升 +5.1%。统一模型支持 50 种主要语言,具备 Tiny (1.5M)、Small (7.7M) 与 Medium (34.5M) 三种硬件档位。
PP-StructureV3 表格与版面分析
复杂 PDF 与扫描件的一站式文档解析。智能提取表格单元格坐标、公式位置、印章以及多栏阅读顺序。
PaddleOCR-VL 视觉语言模型
0.9B 专用端到端多模态文档解析大模型。在 OmniDocBench v1.6 基准评测中达到 96.33% 顶级高分,直接输出 Markdown。
100% 本地离线执行与数据隐私
零外部 API 调用,零数据上传云端。完全满足金融、政务、医疗等严苛的企业数据安全合规要求。
极致跨平台算力优化
原生支持 Windows、Linux、macOS (Apple Silicon M系列),完美适配 NVIDIA GPU (CUDA)、Intel XPU 与国产昆仑芯 NPU。
大模型与 RAG 生态集成
已被 Dify、RAGFlow、Cherry Studio 等主流 LLM 框架深度集成,支持标准 Model Context Protocol (MCP) 服务端运行。
几行命令即可在本地部署运行
根据您的运行环境(CPU 或 GPU)选择合适的安装指令:
通用环境快速上手
适用于普通开发机器、轻量服务器及 macOS / Linux / Windows 纯 CPU 环境:
企业级生产加速环境
适用于配备 NVIDIA 显卡的服务器或主机,提供数十倍的批量推理吞吐:
PaddleOCR 在线交互式沙盒
直接在浏览器中测试 PP-OCRv6 文档文字检测、表格提取与 Markdown 自动生成效果:
常用 Python 场景示例
点击复制即可直接运行的高频 PaddleOCR 实战代码片段:
from paddleocr import PaddleOCR
# 初始化 OCR 引擎(默认使用中英文模型)
ocr = PaddleOCR(use_angle_cls=True, lang='ch')
# 预测图片中的文字
result = ocr.ocr('invoice.jpg', cls=True)
# 打印识别结果与置信度
for idx in range(len(result)):
res = result[idx]
for line in res:
box, (text, score) = line
print(f"文本: {text} | 置信度: {score:.4f}")
from paddleocr import PPStructureV3
# 初始化文档结构分析引擎
table_engine = PPStructureV3(show_log=True, lang='ch')
# 解析多页 PDF 或表格图片
result = table_engine('annual_report.pdf')
# 提取还原后的 HTML/Markdown 表格与段落
for region in result:
if region['type'] == 'table':
print("识别到表格 HTML 内容:")
print(region['res']['html'])
elif region['type'] == 'text':
print(f"正文段落: {region['res']}")
from paddleocr import PaddleOCRVL
# 初始化 0.9B 多模态文档大模型
vl_model = PaddleOCRVL(model_name='PaddleOCR-VL-1.6')
# 直接输出精准排版的 Markdown 文本
markdown_text = vl_model.predict(
image='complex_layout_paper.pdf',
output_format='markdown'
)
print(markdown_text)
PaddleOCR Python 代码生成器
根据您的实际业务需求自由勾选参数,一键生成生产可用的 Python 脚本:
# 正在生成配置...
PaddleOCR vs Docling vs Surya vs Tesseract vs EasyOCR
全方位对比 PaddleOCR 与前沿大模型文档解析库、传统 OCR 及商业云端 API:
| 评测指标 | PaddleOCR v3.7 | IBM Docling | Surya OCR | Tesseract OCR | EasyOCR | AWS Textract |
|---|---|---|---|---|---|---|
| 开源协议与商用 | Apache 2.0 (完全免费商用) | MIT (免费) | GPL-3.0 / 双协议 | Apache 2.0 (免费) | Apache 2.0 (免费) | 按页计费商业 API |
| 中文/多语言识别准确率 | 96.33% (SOTA 顶级) | 92.8% 复杂文档 | 90.4% 文字布局 | 约 70%–78% | 约 85%–88% | 92%–94% |
| 表格与版面结构化还原 | 原生支持 (PP-StructureV3) | 支持 (Docling Layout) | 支持 (Surya Layout) | 不支持 (需二次开发) | 仅基础文字框 | 支持 (高额费用) |
| CPU 推理速度与模型体积 | 极快 (Tiny 1.5M / OpenVINO) | CPU 较慢 (模型较大) | CPU 中等 | 快 (C++) | 较慢 (PyTorch 开销大) | 依赖网络往返延迟 |
| 大模型 (RAG) 友好格式 | 原生输出 Markdown / JSON / LaTeX | 原生输出 Markdown / JSON | 仅输出 JSON | 纯文本 | 纯文本 | 复杂专属 JSON |
| 浏览器纯前端运行 (WASM) | 支持 (PaddleOCR.js) | 不支持 | 不支持 | 支持 (Tesseract.js) | 不支持 | 不支持 (云端) |
| 本地离线运行与数据合规 | 100% 本地完全私有化 | 100% 本地私有化 | 100% 本地私有化 | 支持本地 | 支持本地 | 必须上传第三方云端 |
关于 PaddleOCR 的高频问题解答
解答开发者在选型、安装与生产部署中最关心的技术细节:
PaddleOCR 真的可以免费商用吗?
是的。PaddleOCR 基于 Apache License 2.0 协议开源发布。无论是个人开发者、科研人员还是企业商业产品,都可以免费集成并部署在私有化服务器或商用软件中,无需向百度或任何人支付许可费用。
如何选择 PP-OCRv6 的 Tiny、Small 与 Medium 算力档位?
Tiny (1.5M 参数): 适合树莓派、移动端 App、嵌入式设备及低配置纯 CPU 服务器,毫秒级极速响应。
Small (7.7M 参数): 最平衡的通用推荐档位,兼顾极致准确率与低资源消耗。
Medium (34.5M 参数): 适合配有 GPU 的服务器集群,追求最高精度的复杂单据识别。
Windows 环境安装常见报错该如何解决?
1. 确保使用 Python 3.8 至 3.12 版本(目前 Python 3.13 暂未支持编译 Wheel)。
2. 若报错 ImportError: DLL load failed,请安装最新的 Microsoft Visual C++ 2015-2022 Redistributable。
3. 如遇模型下载超时,可配置国内镜像源或手动将官方预训练模型文件放置于 ~/.paddleocr/ 目录下。
PaddleOCR 如何与大语言模型 (LLM) 和 RAG 配合使用?
在 RAG 知识库构建中,普通 OCR 丢失了表格结构和阅读层次。使用 PaddleOCR 的 PP-StructureV3 或 PaddleOCR-VL,可直接将 PDF 转换为保留 Markdown 表格与标题层级的纯净文档,极大提升大模型向量检索与回答的精准度。