返回新闻列表
2026-06-30 10:01

百度开源3B模型Unlimited OCR:5天Star破万,刷新长文档解析纪录

文章提及的 AI 工具DeepSeekHuggingFace
文本核心速览
  1. 百度开源3B OCR模型百度发布并开源3B参数端到端OCR模型Unlimited OCR,专为书籍、论文等长文档解析场景设计,推理时仅激活约570M参数。
  2. 5天GitHub Star破万项目上线仅5天即获GitHub Star超1万,并登顶GitHub与HuggingFace共四项趋势榜,社区反响热烈。
  3. 创新R-SWA机制首次引入Reference Sliding Window Attention机制,突破逐页拼接限制,支持数十页一次性连续解析,显存占用恒定。
  4. 刷新长文档解析纪录在OmniDocBench v1.6基准测试中以93.92%创下新纪录;推理速度较DeepSeek OCR提升12.7%,6000Tokens场景下提升35%。

3B参数的OCR模型,开源5天Star破万,推理速度比DeepSeek OCR快35%

百度开源了一个3B参数规模的端到端OCR模型——Unlimited OCR,专为书籍、论文等长文档解析场景打造。项目上线后迅速登顶GitHub与HuggingFace四项趋势榜,开源仅5天GitHub Star即破万。

技术亮点:R-SWA机制

技术上,Unlimited OCR推理时激活参数约570M,并首次引入**Reference Sliding Window Attention(R-SWA)**机制。有开发者试了说,R-SWA打破了传统“逐页解析+拼接”的限制,实现数十页文档的一次性连续解析。同时,它将解码阶段的KV Cache控制在恒定规模,使显存占用和计算成本不再随输出长度增长而暴涨。

基准测试成绩

OmniDocBench v1.6基准测试中,该模型以**93.92%**的成绩刷新纪录。群里在传,这个得分是目前该榜单的最高分。

真实场景速度对比

真实场景下,其推理速度较DeepSeek OCR提升约12.7%。在6000Tokens输出长度下,速度优势扩大至35%。实测显示,对于长文档数字化任务,Unlimited OCR能大幅缩短等待时间。

意义与影响

这套方案为海量文档数字化和大模型长程记忆管理提供了全新路径。接下来盯着看:这个模型能否在真实生产环境中稳定处理超过百页的复杂PDF,比如带表格、公式、多栏排版的学术论文。谁受益?文档数字化服务商、RAG应用开发者、以及需要高精度长文档OCR的AI项目。谁难受?传统逐页OCR方案和DeepSeek OCR的团队——毕竟在6000Tokens长度下速度慢了35%,基准得分也差了两位数。

来源: aibase阅读原文

其他新闻

查看全部