先在线评估PP-OCRv6,再通过PaddlePaddle、Transformers或ONNX Runtime后端,将轻量、面向生产的OCR集成到应用中。
PP-OCRv6是PaddleOCR通用OCR模型家族的最新一代,面向现实场景中的文字检测与识别,覆盖文档、截图、多语言图像、数字显示屏、工业标签和场景文字。
这个模型家族的参数规模从150万到3450万,包含tiny、small和medium三个档位。medium和small支持50种语言,包括简体中文、繁体中文、英语、日语以及46种拉丁字母语言。可以通过PP-OCRv6在线演示快速试用。
在PaddleOCR官方内部多场景OCR基准中,PP-OCRv6_medium的检测Hmean达到86.2%,识别准确率达到83.2%。相较PP-OCRv5_server,文字检测提高4.6个百分点,文字识别提高5.1个百分点。这些数字对应原文所述的内部基准条件。
PP-OCRv6关注一种实际需求:用小模型和灵活部署方式,产出准确、结构化的文字结果。关于为什么在视觉语言模型(VLM)时代专用OCR模型仍有价值,更深入的讨论见此前的PP-OCRv5 on Hugging Face:专用OCR方法。
PP-OCRv6有哪些新变化
PP-OCRv6对检测和识别的架构、训练及数据进行了改进。主要设计目标是在提高OCR准确率的同时,使模型大小适合不同部署条件。
三个模型档位
PP-OCRv6提供三个档位,覆盖不同模型规模及OCR准确率水平。
| 模型 | 模型大小 | 检测Hmean | 识别准确率 | 典型应用场景 |
|---|---|---|---|---|
| PP-OCRv6_tiny | 150万参数 | 80.6% | 73.5% | 边缘设备、轻量本地OCR、对延迟敏感的演示、资源受限环境 |
| PP-OCRv6_small | 770万参数 | 84.1% | 81.3% | 移动端、桌面端、均衡型OCR服务、计算成本较低的多语言OCR |
| PP-OCRv6_medium | 3450万参数 | 86.2% | 83.2% | 以准确率为重点的OCR、服务端流水线、工业OCR、文档导入、多语言OCR |
PPLCNetV4骨干网络
PP-OCRv6使用PPLCNetV4作为文字检测与识别的统一骨干网络。
对开发者而言,主要收益是模型家族的一致性。tiny、small和medium并非互不相关的模型,而属于同一OCR家族,共享一致的架构方向。
用于文字检测的RepLKFPN
文字检测是OCR流水线的第一阶段。检测质量会影响送入识别器的裁剪图像,而质量差的裁剪通常会导致较差的识别结果。
PP-OCRv6将检测模块升级为RepLKFPN。这是一种轻量的大核特征金字塔网络,设计用于多尺度文字检测,同时保持高效推理。
这对现实OCR输入很有意义,因为文字可能很小、密集、旋转、低分辨率,或者处于复杂背景中。
用于识别的EncoderWithLightSVTR
文字识别使用EncoderWithLightSVTR,将局部上下文建模与全局注意力结合,以改善难处理的文字裁剪区域的识别质量。
这些识别改进尤其适用于多语言文字、屏幕文字、工业字符、特殊符号、密集文字以及含噪图像区域。
统一的多语言OCR
medium和small档位在同一模型家族中支持50种语言,覆盖简体中文、繁体中文、英语、日语及46种拉丁字母语言。
这有助于减少常见多语言OCR场景对单独模型的需求。
通过PaddleOCR快速开始
安装PaddleOCR:
pip install paddleocr
使用Paddle Inference运行OCR,它是默认后端:
from paddleocr import PaddleOCR
# Model: PP-OCRv6_medium(Default)
# Backend: Paddle Inference(Default)
ocr = PaddleOCR(
use_doc_orientation_classify=False,
use_doc_unwarping=False,
use_textline_orientation=False,
)
result = ocr.predict("https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png")
for res in result:
res.print()
res.save_to_img("output")
res.save_to_json("output")
OCR结果可以保存为可视化图像和结构化JSON。结构化输出随后可以用于文档解析、搜索、信息提取、RAG、分析或智能体工作流等下游系统。
可用的推理后端
PP-OCRv6可通过PaddleOCR使用多种推理后端。PaddleOCR 3.7提供统一推理引擎接口:engine选择底层运行时,相关配置可通过流水线或模块API传入。
| 后端 | 说明 |
|---|---|
| Transformers | 面向Hugging Face/PyTorch的推理路径,用于受支持的PaddleOCR模型 |
| ONNX Runtime | 用于基于ONNX部署环境的可移植推理路径 |
| Paddle Inference | 原生Paddle推理格式 |
对于Hugging Face用户,PaddleOCR支持通过Transformers后端运行部分OCR和文档解析模型,可以通过以下设置启用:
engine="transformers"
Transformers后端在PaddleOCR中的工作方式,见PaddleOCR:使用Transformers后端运行OCR与文档解析任务。
使用Transformers后端运行PP-OCRv6的示例:
from paddleocr import PaddleOCR
# Model: PP-OCRv6_medium(Default)
# Backend: transformers
ocr = PaddleOCR(
use_doc_orientation_classify=False,
use_doc_unwarping=False,
use_textline_orientation=False,
engine="transformers",
)
result = ocr.predict("https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png")
PP-OCRv6模型集合中也提供ONNX版本,可在ONNX Runtime环境中使用engine="onnxruntime":
from paddleocr import PaddleOCR
# Model: PP-OCRv6_medium(Default)
# Backend: ONNX Runtime
ocr = PaddleOCR(
use_doc_orientation_classify=False,
use_doc_unwarping=False,
use_textline_orientation=False,
engine="onnxruntime",
)
result = ocr.predict("https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png")
这些后端让PP-OCRv6能够用于不同运行环境,同时继续使用Hugging Face Hub上的同一OCR模型家族。
结语
PP-OCRv6为PaddleOCR带来了面向现实文字检测与识别的轻量多语言OCR模型家族。
本次发布包含从150万到3450万参数的三个档位、最多50种语言支持、相对PP-OCRv5_server更高的检测与识别准确率,以及Hugging Face Hub上的多种模型格式,包括safetensors、Paddle推理模型和ONNX模型。
结合托管的Hugging Face Space及PaddleOCR推理后端,可以从以下入口评估和集成:
- 在线演示:PP-OCRv6 Online Demo
- 模型集合:PP-OCRv6 Collection
- Transformers后端博客:PaddleOCR with Transformers Backend
- PaddleOCR文档:PP-OCRv6文档
- PaddleOCR官网:https://www.paddleocr.com
可以先用在线演示评估PP-OCRv6,在模型集合中探索可用资产,再根据自己的OCR工作流选择合适的推理后端。
原文:PP-OCRv6 on Hugging Face: 50-Language OCR from 1.5M to 34.5M Parameters;作者:AlexZhang、cuicheng、Jun Zhang、Manhui Lin、Yue Zhang、leo-q8、yubo、Yi Liu(PaddlePaddle);发表于2026年6月22日。原文和模型、源码的权利及具体许可证归相应权利人所有。











暂无评论内容