Hugging Face上的PP-OCRv6:150万至3450万参数的50语言OCR

先在线评估PP-OCRv6,再通过PaddlePaddle、Transformers或ONNX Runtime后端,将轻量、面向生产的OCR集成到应用中。

PP-OCRv6是PaddleOCR通用OCR模型家族的最新一代,面向现实场景中的文字检测与识别,覆盖文档、截图、多语言图像、数字显示屏、工业标签和场景文字。

这个模型家族的参数规模从150万到3450万,包含tiny、small和medium三个档位。medium和small支持50种语言,包括简体中文、繁体中文、英语、日语以及46种拉丁字母语言。可以通过PP-OCRv6在线演示快速试用。

在PaddleOCR官方内部多场景OCR基准中,PP-OCRv6_medium的检测Hmean达到86.2%,识别准确率达到83.2%。相较PP-OCRv5_server,文字检测提高4.6个百分点,文字识别提高5.1个百分点。这些数字对应原文所述的内部基准条件。

PP-OCRv6关注一种实际需求:用小模型和灵活部署方式,产出准确、结构化的文字结果。关于为什么在视觉语言模型(VLM)时代专用OCR模型仍有价值,更深入的讨论见此前的PP-OCRv5 on Hugging Face:专用OCR方法。

PP-OCRv6有哪些新变化

PP-OCRv6对检测和识别的架构、训练及数据进行了改进。主要设计目标是在提高OCR准确率的同时,使模型大小适合不同部署条件。

三个模型档位

PP-OCRv6提供三个档位,覆盖不同模型规模及OCR准确率水平。

模型 模型大小 检测Hmean 识别准确率 典型应用场景
PP-OCRv6_tiny 150万参数 80.6% 73.5% 边缘设备、轻量本地OCR、对延迟敏感的演示、资源受限环境
PP-OCRv6_small 770万参数 84.1% 81.3% 移动端、桌面端、均衡型OCR服务、计算成本较低的多语言OCR
PP-OCRv6_medium 3450万参数 86.2% 83.2% 以准确率为重点的OCR、服务端流水线、工业OCR、文档导入、多语言OCR

PPLCNetV4骨干网络

PP-OCRv6使用PPLCNetV4作为文字检测与识别的统一骨干网络。

对开发者而言,主要收益是模型家族的一致性。tiny、small和medium并非互不相关的模型,而属于同一OCR家族,共享一致的架构方向。

用于文字检测的RepLKFPN

文字检测是OCR流水线的第一阶段。检测质量会影响送入识别器的裁剪图像,而质量差的裁剪通常会导致较差的识别结果。

PP-OCRv6将检测模块升级为RepLKFPN。这是一种轻量的大核特征金字塔网络,设计用于多尺度文字检测,同时保持高效推理。

这对现实OCR输入很有意义,因为文字可能很小、密集、旋转、低分辨率,或者处于复杂背景中。

用于识别的EncoderWithLightSVTR

文字识别使用EncoderWithLightSVTR,将局部上下文建模与全局注意力结合,以改善难处理的文字裁剪区域的识别质量。

这些识别改进尤其适用于多语言文字、屏幕文字、工业字符、特殊符号、密集文字以及含噪图像区域。

统一的多语言OCR

medium和small档位在同一模型家族中支持50种语言,覆盖简体中文、繁体中文、英语、日语及46种拉丁字母语言。

这有助于减少常见多语言OCR场景对单独模型的需求。

通过PaddleOCR快速开始

安装PaddleOCR:

pip install paddleocr

使用Paddle Inference运行OCR,它是默认后端:

from paddleocr import PaddleOCR

# Model: PP-OCRv6_medium(Default)
# Backend: Paddle Inference(Default)
ocr = PaddleOCR(
    use_doc_orientation_classify=False,
    use_doc_unwarping=False,
    use_textline_orientation=False,
)
result = ocr.predict("https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png")

for res in result:
    res.print()
    res.save_to_img("output")
    res.save_to_json("output")

OCR结果可以保存为可视化图像和结构化JSON。结构化输出随后可以用于文档解析、搜索、信息提取、RAG、分析或智能体工作流等下游系统。

可用的推理后端

PP-OCRv6可通过PaddleOCR使用多种推理后端。PaddleOCR 3.7提供统一推理引擎接口:engine选择底层运行时,相关配置可通过流水线或模块API传入。

后端 说明
Transformers 面向Hugging Face/PyTorch的推理路径,用于受支持的PaddleOCR模型
ONNX Runtime 用于基于ONNX部署环境的可移植推理路径
Paddle Inference 原生Paddle推理格式

对于Hugging Face用户,PaddleOCR支持通过Transformers后端运行部分OCR和文档解析模型,可以通过以下设置启用:

engine="transformers"

Transformers后端在PaddleOCR中的工作方式,见PaddleOCR:使用Transformers后端运行OCR与文档解析任务。

使用Transformers后端运行PP-OCRv6的示例:


from paddleocr import PaddleOCR

# Model: PP-OCRv6_medium(Default)
# Backend: transformers
ocr = PaddleOCR(
    use_doc_orientation_classify=False,
    use_doc_unwarping=False,
    use_textline_orientation=False,
    engine="transformers",
)
result = ocr.predict("https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png")

PP-OCRv6模型集合中也提供ONNX版本,可在ONNX Runtime环境中使用engine="onnxruntime":

from paddleocr import PaddleOCR

# Model: PP-OCRv6_medium(Default)
# Backend: ONNX Runtime
ocr = PaddleOCR(
    use_doc_orientation_classify=False,
    use_doc_unwarping=False,
    use_textline_orientation=False,
    engine="onnxruntime",
)
result = ocr.predict("https://paddle-model-ecology.bj.bcebos.com/paddlex/imgs/demo_image/general_ocr_002.png")

这些后端让PP-OCRv6能够用于不同运行环境,同时继续使用Hugging Face Hub上的同一OCR模型家族。

结语

PP-OCRv6为PaddleOCR带来了面向现实文字检测与识别的轻量多语言OCR模型家族。

本次发布包含从150万到3450万参数的三个档位、最多50种语言支持、相对PP-OCRv5_server更高的检测与识别准确率,以及Hugging Face Hub上的多种模型格式,包括safetensors、Paddle推理模型和ONNX模型。

结合托管的Hugging Face Space及PaddleOCR推理后端,可以从以下入口评估和集成:

可以先用在线演示评估PP-OCRv6,在模型集合中探索可用资产,再根据自己的OCR工作流选择合适的推理后端。


原文:PP-OCRv6 on Hugging Face: 50-Language OCR from 1.5M to 34.5M Parameters;作者:AlexZhang、cuicheng、Jun Zhang、Manhui Lin、Yue Zhang、leo-q8、yubo、Yi Liu(PaddlePaddle);发表于2026年6月22日。原文和模型、源码的权利及具体许可证归相应权利人所有。

© 版权声明
THE END
喜欢就支持一下吧
点赞0 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容