订阅 AI123 精选资讯,每周获取最新动态

立即订阅
返回新闻列表
新闻
2026-06-30
16

百度开源3B模型Unlimited OCR:5天Star破万,刷新长文档解析纪录

百度开源3B模型Unlimited OCR:5天Star破万,刷新长文档解析纪录
百度开源3B参数端到端OCR模型Unlimited OCR,专攻书籍论文等长文档。项目上线5天GitHub Star破万,登顶四项趋势榜。技术上,推理激活约570M参数,创新引入Reference Sliding Window Attention机制,突破逐页拼接限制,支持数十页一次性连续解析,大幅提升长文档处理效率。

核心要点

  • 1.百度开源3B参数端到端OCR模型Unlimited OCR
  • 2.专攻书籍论文等长文档,支持数十页连续解析
  • 3.创新引入Reference Sliding Window Attention机制
  • 4.推理时仅激活约570M参数,效率高
  • 5.项目上线5天GitHub Star破万,登顶四项趋势榜

关键数据

模型总参数量: 3B(Unlimited OCR模型参数规模)推理激活参数量: 约570M(实际推理时激活的参数,体现高效)GitHub Star数: 破万(上线5天即获得超过1万星标)趋势榜登顶数: 四项(在GitHub上登顶四项趋势榜单)

影响评估

正面

该模型显著提升长文档OCR处理效率,推动开源OCR技术发展

通过Reference Sliding Window Attention突破逐页拼接限制,有效解决长文档连续解析难题,对学术、出版等场景有重要价值

相关工具

Unlimited OCR百度开源的3B参数端到端OCR模型

 百度近日发布并开源了3B参数规模的端到端OCR模型——Unlimited OCR,专为书籍、论文等长文档解析场景打造。该项目上线后迅速登顶GitHub与HuggingFace四项趋势榜,开源仅5天GitHub Star即破万。

技术上,Unlimited OCR推理时激活参数约570M,并首次引入Reference Sliding Window Attention(R-SWA)机制。该机制打破了传统“逐页解析+拼接”的限制,实现数十页文档的一次性连续解析;同时,它将解码阶段的KV Cache控制在恒定规模,使显存占用和计算成本不再随输出长度增长而暴涨。

在OmniDocBench v1.6基准测试中,该模型以93.92%的成绩刷新纪录。真实场景下,其推理速度较DeepSeek OCR提升约12.7%,在6000Tokens输出长度下速度优势扩大至35%,为海量文档数字化和大模型长程记忆管理提供了全新路径。