百度文心发布PaddleOCR-VL-1.6:准确率破96.33%刷新文档解析SOTA
- 准确率96.33%刷新SOTA—百度发布PaddleOCR-VL-1.6,在OmniDocBench v1.6评测中以96.33%准确率超越Gemini-3-Pro等主流模型,综合性能全球第一。
- 轻量化架构与多语言支持—模型保持0.9B参数量,支持超100种语言识别,用户覆盖全球170多个国家和地区,提升表格、古籍、生僻字等复杂场景识别能力。
- 真实场景评测领先—在Real5-OmniDocBench评测中总指标93.19%,攻克扫描件、弯折、屏幕拍照、光照变化及倾斜文档等解析痛点。
- 开源生态与产业落地—GitHub Star数超79.2K,超越谷歌Tesseract,成为最受欢迎开源OCR项目。新模型已上线官网并开源,支持企业平滑迁移。
PaddleOCR-VL-1.6 以96.33%准确率超越GPT-5.2和Gemini-3-Pro,拿下全球第一
百度开源的PaddleOCR-VL-1.6在OmniDocBench v1.6评测中以96.33%准确率登顶,压过了Gemini-3-Pro、GPT-5.2和GLM-OCR等一票主流大模型——这意味着每处理100份文档,它只认错不到4份,直接刷新业界SOTA,综合性能被第三方榜单列为全球第一。
拆了谁的台
有开发者试了说,这个模型在复杂文档理解和真实场景解析上确实狠,把之前那些大厂砸重金堆参数量的模型全干下去了。群里在传,这波操作让谷歌Tesseract OCR的用户开始犹豫——毕竟PaddleOCR在GitHub上Star数已经突破79.2K,正好压过谷歌的项目,成了全球最火的开源OCR项目。
轻量但能打
新版本只用了0.9B参数量的轻量化架构——相当于一个小脑瓜里塞进了超强识别能力。通过模型驱动的数据构建机制和渐进式训练优化,在表格、古籍、生僻字、印章和图表识别这些谁做谁头疼的复杂场景里,识别能力明显上了一个台阶。有跑过实际业务的人说,古籍里的残损字和印章叠加噪点,以前肯定翻车,现在居然能输出正确内容。
真实场景也不虚
在专门折腾真实复杂场景的Real5-OmniDocBench评测中,这个模型拿了93.19%总指标,同样领先。群里的测试报告提到,扫描件、弯折、屏幕拍照、光照变化、倾斜文档这些OCR老毛病,它基本都撑住了。尤其屏幕拍照反光导致文字断裂,之前很多模型直接摆烂,现在PaddleOCR能找回大半。
迁移不用改代码
因为延续了前代架构,企业或者开发者可以直接把自己之前搭的PaddleOCR服务换上这个新模型权重,不用修改任何适配代码。GitHub上已经同步放出新模型和代码权重,想玩的人现在就能拉下来跑。
支持百种语言,覆盖170+国家
作为文心大模型多模态能力的核心组成部分,PaddleOCR目前支持超100种语言识别,用户覆盖全球170多个国家和地区。这次升级虽然没扩语言数量,但在已有语言上的复杂场景解析力是实打实提升了。
接下来盯着看什么
- 谷歌Tesseract会不会跟一个版本?Star数被超之后,开源生态地位开始动摇。
- **那些靠商用OCR吃饭的厂家(比如ABBYY、Textract)**会难受,因为一个免费开源的模型直接冲到了第一,而且文档数字化这波需求会加速往开源方案倾斜。
- 还能不能再往上卷?现在是0.9B,如果放开参数限制,会不会把准确率再顶到97%以上?三天后估计就有社区大神拿更大的底座去魔改。