百度最新开源模型PaddleOCR-VL登顶HuggingFace Trending全球第一
北京日报客户端

2025-10-20 17:02 语音播报

产经新闻

10月17日消息,HuggingFace官网显示,百度16日晚发布的自研多模态文档解析模型PaddleOCR-VL,发布20小时内即登顶HuggingFace Trending全球第一。

据了解,该模型核心参数仅0.9B,轻量高效,能以极低计算开销精准识别文本、手写汉字、表格、公式、图表等复杂元素,支持109种语言。在OmniBenchDoc V1.5榜单中,它以92.6分获综合性能全球第一,四大核心能力全线SOTA,刷新OCR VL模型性能纪录。

作为文心4.5衍生模型,PaddleOCR-VL融合了NaViT动态分辨率视觉编码器与ERNIE-4.5-0.3B语言模型,实现精度与效率双突破。

校检:孙朝阳 陈沙

审核:李凤怡


编辑:李濛

打开APP阅读全文
APP内打开