最新发布:v3.7.0 — PP-OCRv6 旗舰模型全面升级

将任意文档与图像转化为
结构化 AI 就绪数据。

PaddleOCR 是由百度飞桨团队打造的高性能、超轻量开源 OCR 与文档 AI 引擎。精准解析 PDF、复杂表格、数学公式与多语言文本,无缝赋能大模型与 RAG 知识库。

bash — 一键安装
$ pip install paddlepaddle paddleocr
86,000+
GitHub Stars
100+
支持语言
96.33%
SOTA 准确率
6,000+
开源项目集成
强大特性

为什么开发者与企业选择 PaddleOCR

从边缘设备轻量推理到大型私有化企业级文档 AI 流水线,提供一站式完整解决方案。

PP-OCRv6 旗舰识别引擎

最新一代核心模型,检测准确率提升 +4.6%,识别准确率提升 +5.1%。统一模型支持 50 种主要语言,具备 Tiny (1.5M)、Small (7.7M) 与 Medium (34.5M) 三种硬件档位。

1.5M Tiny 模型 多语言统一架构 OpenVINO 5.2x 加速

PP-StructureV3 表格与版面分析

复杂 PDF 与扫描件的一站式文档解析。智能提取表格单元格坐标、公式位置、印章以及多栏阅读顺序。

PaddleOCR-VL 视觉语言模型

0.9B 专用端到端多模态文档解析大模型。在 OmniDocBench v1.6 基准评测中达到 96.33% 顶级高分,直接输出 Markdown。

100% 本地离线执行与数据隐私

零外部 API 调用,零数据上传云端。完全满足金融、政务、医疗等严苛的企业数据安全合规要求。

极致跨平台算力优化

原生支持 Windows、Linux、macOS (Apple Silicon M系列),完美适配 NVIDIA GPU (CUDA)、Intel XPU 与国产昆仑芯 NPU。

大模型与 RAG 生态集成

已被 Dify、RAGFlow、Cherry Studio 等主流 LLM 框架深度集成,支持标准 Model Context Protocol (MCP) 服务端运行。

快速安装

几行命令即可在本地部署运行

根据您的运行环境(CPU 或 GPU)选择合适的安装指令:

标准推荐 (CPU / 基础版)

通用环境快速上手

适用于普通开发机器、轻量服务器及 macOS / Linux / Windows 纯 CPU 环境:

pip 安装
$ pip install paddlepaddle
$ pip install paddleocr
GPU 加速 (CUDA)

企业级生产加速环境

适用于配备 NVIDIA 显卡的服务器或主机,提供数十倍的批量推理吞吐:

CUDA GPU 安装
$ pip install paddlepaddle-gpu
$ pip install paddleocr
在线体验

PaddleOCR 在线交互式沙盒

直接在浏览器中测试 PP-OCRv6 文档文字检测、表格提取与 Markdown 自动生成效果:

预设样例:
云端 GPU Space 完整演示
🔍 鼠标悬停查看检测到的文本定位框与坐标:

              

              
代码速查

常用 Python 场景示例

点击复制即可直接运行的高频 PaddleOCR 实战代码片段:

1. 基础图像文字检测与识别 (PP-OCRv6)
from paddleocr import PaddleOCR

# 初始化 OCR 引擎(默认使用中英文模型)
ocr = PaddleOCR(use_angle_cls=True, lang='ch')

# 预测图片中的文字
result = ocr.ocr('invoice.jpg', cls=True)

# 打印识别结果与置信度
for idx in range(len(result)):
    res = result[idx]
    for line in res:
        box, (text, score) = line
        print(f"文本: {text} | 置信度: {score:.4f}")
2. PDF 文档与复杂表格结构化解析 (PP-StructureV3)
from paddleocr import PPStructureV3

# 初始化文档结构分析引擎
table_engine = PPStructureV3(show_log=True, lang='ch')

# 解析多页 PDF 或表格图片
result = table_engine('annual_report.pdf')

# 提取还原后的 HTML/Markdown 表格与段落
for region in result:
    if region['type'] == 'table':
        print("识别到表格 HTML 内容:")
        print(region['res']['html'])
    elif region['type'] == 'text':
        print(f"正文段落: {region['res']}")
3. 使用 PaddleOCR-VL 视觉语言大模型直接提取 Markdown
from paddleocr import PaddleOCRVL

# 初始化 0.9B 多模态文档大模型
vl_model = PaddleOCRVL(model_name='PaddleOCR-VL-1.6')

# 直接输出精准排版的 Markdown 文本
markdown_text = vl_model.predict(
    image='complex_layout_paper.pdf',
    output_format='markdown'
)

print(markdown_text)
实用工具

PaddleOCR Python 代码生成器

根据您的实际业务需求自由勾选参数,一键生成生产可用的 Python 脚本:

生成的 Python 脚本 (paddleocr_config.py)
# 正在生成配置...
2026 主流方案对比

PaddleOCR vs Docling vs Surya vs Tesseract vs EasyOCR

全方位对比 PaddleOCR 与前沿大模型文档解析库、传统 OCR 及商业云端 API:

评测指标 PaddleOCR v3.7 IBM Docling Surya OCR Tesseract OCR EasyOCR AWS Textract
开源协议与商用 Apache 2.0 (完全免费商用) MIT (免费) GPL-3.0 / 双协议 Apache 2.0 (免费) Apache 2.0 (免费) 按页计费商业 API
中文/多语言识别准确率 96.33% (SOTA 顶级) 92.8% 复杂文档 90.4% 文字布局 约 70%–78% 约 85%–88% 92%–94%
表格与版面结构化还原 原生支持 (PP-StructureV3) 支持 (Docling Layout) 支持 (Surya Layout) 不支持 (需二次开发) 仅基础文字框 支持 (高额费用)
CPU 推理速度与模型体积 极快 (Tiny 1.5M / OpenVINO) CPU 较慢 (模型较大) CPU 中等 快 (C++) 较慢 (PyTorch 开销大) 依赖网络往返延迟
大模型 (RAG) 友好格式 原生输出 Markdown / JSON / LaTeX 原生输出 Markdown / JSON 仅输出 JSON 纯文本 纯文本 复杂专属 JSON
浏览器纯前端运行 (WASM) 支持 (PaddleOCR.js) 不支持 不支持 支持 (Tesseract.js) 不支持 不支持 (云端)
本地离线运行与数据合规 100% 本地完全私有化 100% 本地私有化 100% 本地私有化 支持本地 支持本地 必须上传第三方云端
常见问题

关于 PaddleOCR 的高频问题解答

解答开发者在选型、安装与生产部署中最关心的技术细节:

PaddleOCR 真的可以免费商用吗?

是的。PaddleOCR 基于 Apache License 2.0 协议开源发布。无论是个人开发者、科研人员还是企业商业产品,都可以免费集成并部署在私有化服务器或商用软件中,无需向百度或任何人支付许可费用。

如何选择 PP-OCRv6 的 Tiny、Small 与 Medium 算力档位?

Tiny (1.5M 参数): 适合树莓派、移动端 App、嵌入式设备及低配置纯 CPU 服务器,毫秒级极速响应。
Small (7.7M 参数): 最平衡的通用推荐档位,兼顾极致准确率与低资源消耗。
Medium (34.5M 参数): 适合配有 GPU 的服务器集群,追求最高精度的复杂单据识别。

Windows 环境安装常见报错该如何解决?

1. 确保使用 Python 3.8 至 3.12 版本(目前 Python 3.13 暂未支持编译 Wheel)。
2. 若报错 ImportError: DLL load failed,请安装最新的 Microsoft Visual C++ 2015-2022 Redistributable。
3. 如遇模型下载超时,可配置国内镜像源或手动将官方预训练模型文件放置于 ~/.paddleocr/ 目录下。

PaddleOCR 如何与大语言模型 (LLM) 和 RAG 配合使用?

在 RAG 知识库构建中,普通 OCR 丢失了表格结构和阅读层次。使用 PaddleOCR 的 PP-StructureV3PaddleOCR-VL,可直接将 PDF 转换为保留 Markdown 表格与标题层级的纯净文档,极大提升大模型向量检索与回答的精准度。