返回新闻列表
2026-07-15 09:14
aibase

腾讯混元发布 HyOCR-1.5:仅 1B 参数 推理提速 6.37 倍

文章提及的 AI 工具腾讯混元大模型
文本核心速览
  1. HyOCR-1.5发布腾讯混元发布轻量级端到端OCR模型HyOCR-1.5,仅1B参数,在保持轻量化架构的同时实现性能与效率的显著跃升。
  2. 全栈开源作为首个全栈开源OCR模型,全面开放权重、训练配方、数据构造方法及推理加速框架,大幅降低开发门槛,可在消费级显卡或笔记本上部署。
  3. 推理提速6.37倍引入DFlash投机解码框架,通过约90.7M参数草稿模型并行预测,在OmniDocBench中实现Transformers架构下高达6.37倍加速。
  4. 智能体补齐长尾短板采用“智能体驱动数据流”策略,将薄弱环节转化为任务,由智能体自主拆解、搜集语料并清洗验证,补齐古文字、低资源语种及跨页多图问答等短板。
  5. 性能越级比肩8B模型仅1B参数的HyOCR-1.5在OmniDocBench v1.6稳居端到端第一梯队,古文字识别及图表解析性能可与8B规模通用模型比肩。

1B参数的HyOCR-1.5古文字识别能打8B模型

HyOCR-1.5模型权重、训练配方、数据构造方法及推理加速框架全部开源,有开发者试了说拿着消费级显卡甚至普通笔记本电脑就能复现和微调,门槛直接打下来了。这是第一个全栈开源的轻量端到端OCR专家模型——不仅公开了模型权重,还把训练配方、数据构造方法及推理加速框架向社区全面开放了。

加速6倍怎么做到的?

为了解决长自回归解码带来的延迟瓶颈,研发团队塞了一个叫 DFlash 的投机解码框架进去。核心是一个只有 90.7M 参数的轻量级草稿模型(差不多是让一个小模型先猜,大模型再验一验),在保证输出准确性的前提下实现了推理速度数倍提升。在权威测评 OmniDocBench 里,Transformers 架构下直接拉出了 6.37倍的加速——群里在传这个数字是目前端到端OCR模型里最狠的。

智能体补短板

模型能力进化上用了“智能体驱动数据流”策略。团队把模型的薄弱环节(比如古文字识别、低资源语种处理、跨页多图问答)转成具体任务,交给智能体自主拆解、搜集语料并清洗验证。这种闭环训练模式把长尾场景的短板全补上了。配合 4K分辨率输入和 128K上下文窗口的训练优化,复杂文档的稳健性明显增强。

越级打大模型

评测数据显示,只有 1B参数的HyOCR-1.5(小到可以塞进笔记本)在 OmniDocBench v1.6 上不仅稳居端到端第一梯队,在古文字识别和图表解析任务里,性能甚至能跟 8B参数的通用模型掰手腕——有开发者试了说这等于拿一把折叠刀干掉了瑞士军刀。

接下来盯着看:这个模型能不能在手机或边缘设备上跑起来。最慌的应该是那些靠闭源大模型+高算力堆起来的OCR服务商——用户可能直接在自己的破电脑上本地跑,不用再买他们的API了。

来源: aibase阅读原文

其他新闻

查看全部