返回新闻列表
2026-06-03 10:23

百度文心发布PaddleOCR-VL-1.6:准确率破96.33%刷新文档解析SOTA

文本核心速览
  1. 准确率96.33%刷新SOTA百度发布PaddleOCR-VL-1.6,在OmniDocBench v1.6评测中以96.33%准确率超越Gemini-3-Pro等主流模型,综合性能全球第一。
  2. 轻量化架构与多语言支持模型保持0.9B参数量,支持超100种语言识别,用户覆盖全球170多个国家和地区,提升表格、古籍、生僻字等复杂场景识别能力。
  3. 真实场景评测领先在Real5-OmniDocBench评测中总指标93.19%,攻克扫描件、弯折、屏幕拍照、光照变化及倾斜文档等解析痛点。
  4. 开源生态与产业落地GitHub Star数超79.2K,超越谷歌Tesseract,成为最受欢迎开源OCR项目。新模型已上线官网并开源,支持企业平滑迁移。

PaddleOCR-VL-1.6 以96.33%准确率超越GPT-5.2和Gemini-3-Pro,拿下全球第一

百度开源的PaddleOCR-VL-1.6在OmniDocBench v1.6评测中以96.33%准确率登顶,压过了Gemini-3-Pro、GPT-5.2和GLM-OCR等一票主流大模型——这意味着每处理100份文档,它只认错不到4份,直接刷新业界SOTA,综合性能被第三方榜单列为全球第一。

拆了谁的台

有开发者试了说,这个模型在复杂文档理解和真实场景解析上确实狠,把之前那些大厂砸重金堆参数量的模型全干下去了。群里在传,这波操作让谷歌Tesseract OCR的用户开始犹豫——毕竟PaddleOCR在GitHub上Star数已经突破79.2K,正好压过谷歌的项目,成了全球最火的开源OCR项目。

轻量但能打

新版本只用了0.9B参数量的轻量化架构——相当于一个小脑瓜里塞进了超强识别能力。通过模型驱动的数据构建机制和渐进式训练优化,在表格、古籍、生僻字、印章和图表识别这些谁做谁头疼的复杂场景里,识别能力明显上了一个台阶。有跑过实际业务的人说,古籍里的残损字和印章叠加噪点,以前肯定翻车,现在居然能输出正确内容。

真实场景也不虚

在专门折腾真实复杂场景的Real5-OmniDocBench评测中,这个模型拿了93.19%总指标,同样领先。群里的测试报告提到,扫描件、弯折、屏幕拍照、光照变化、倾斜文档这些OCR老毛病,它基本都撑住了。尤其屏幕拍照反光导致文字断裂,之前很多模型直接摆烂,现在PaddleOCR能找回大半。

迁移不用改代码

因为延续了前代架构,企业或者开发者可以直接把自己之前搭的PaddleOCR服务换上这个新模型权重,不用修改任何适配代码。GitHub上已经同步放出新模型和代码权重,想玩的人现在就能拉下来跑。

支持百种语言,覆盖170+国家

作为文心大模型多模态能力的核心组成部分,PaddleOCR目前支持超100种语言识别,用户覆盖全球170多个国家和地区。这次升级虽然没扩语言数量,但在已有语言上的复杂场景解析力是实打实提升了。

接下来盯着看什么

  • 谷歌Tesseract会不会跟一个版本?Star数被超之后,开源生态地位开始动摇。
  • **那些靠商用OCR吃饭的厂家(比如ABBYY、Textract)**会难受,因为一个免费开源的模型直接冲到了第一,而且文档数字化这波需求会加速往开源方案倾斜。
  • 还能不能再往上卷?现在是0.9B,如果放开参数限制,会不会把准确率再顶到97%以上?三天后估计就有社区大神拿更大的底座去魔改。
来源: aibase阅读原文

其他新闻

查看全部