返回新闻列表
2026-08-05 09:21

腾讯混元发布 Hy ASR 3.0 preview:语音识别不再逐字硬转

文章提及的 AI 工具腾讯混元大模型
文本核心速览
  1. 发布融合大模型新模型腾讯混元发布Hy ASR 3.0 preview,融合Hy3大语言模型能力,将高精度识别与深度语义理解结合,实现从逐字转写到理解语境的升级。
  2. 多语种WER低至3%左右海外评测中普通话WER为3.34%,英语2.62%,粤语3.12%;自建评测在方言、高噪、耳语等场景均保持低错词率,鲁棒性优异。
  3. 上下文纠错更懂意图模型可结合上下文纠正同音词、消弭歧义,例如区分“工行”与“攻行”,准确理解用户真实意图,而非机械转写。
  4. 专业场景热词注入支持热词注入增强,无需大量定制训练即可识别品牌名、人名及行业术语,在金融、医疗、法律等垂直领域降低成本。
  5. 智能助手意义与开放标志语音识别转向具备语义理解的智能助手,未来可应用于智能客服、语音纪要等;目前Hy ASR 3.0 preview已开放体验。

腾讯混元发布 Hy ASR 3.0 preview:语音识别不再逐字硬转

腾讯混元今日正式发布新一代语音识别模型 Hy ASR 3.0 preview。该模型背靠最新一代大语言模型 Hy3 的语言理解能力,将高精度语音识别与深度语义理解深度融合,在通用识别、上下文感知、多场景鲁棒性和方言覆盖等核心维度实现全面升级。官方表示,这标志着语音识别从“逐字转写、单点优化”进化到“理解语境、兼容场景、一键直出”。

核心指标:多语种 WER 低至 3% 左右

在海外开源评测集上,Hy ASR 3.0 preview 表现出色:

  • 中文普通话词错误率(WER):3.34%
  • 英语:2.62%
  • 粤语:3.12%

在腾讯自建评测集中,无论是通用识别、方言识别、上下文理解、专词理解,还是高噪、耳语等复杂声学场景,WER 均维持在低位,综合评测集上取得最低错词率。这显示出模型在多样化和真实复杂音频条件下的鲁棒性。

三大体验升级

1. 通用识别更精准

在通用语音、方言、中英混说等场景下,Hy ASR 3.0 preview 进一步压低错字和漏字,同时缓解了长音频中错误累积的顽疾。对于需要长时间录音转写的会议、采访等场景,这一改进将显著提升效率与准确性。

2. 更懂用户意图

模型能够结合上下文精准捕捉用户语境,智能纠正同音词,消弭语义歧义。例如,在“我要去工行”与“我要去攻行”这类容易混淆的表述中,模型可通过上下文判断用户真实意图,输出更符合本意的文字,而非机械地逐字转换。

3. 专业场景适配

支持热词注入增强,让模型快速识别品牌名、产品名、人名和行业术语。企业接入时无需大量定制训练,即可在金融、医疗、法律等垂直领域获得高准确率,降低业务部署和后续模型维护成本。

官方评价:这是一次“理解语境、兼容场景、一键直出”的进化。

意义与展望

Hy ASR 3.0 preview 的发布,意味着语音识别正从单纯的“声音到文字”工具,转向具备语义理解能力的智能助手。结合大语言模型的推理能力,未来语音交互将进一步突破传统 ASR 的天花板,在智能客服、语音纪要、实时字幕等场景释放更大价值。

腾讯混元表示,Hy ASR 3.0 preview 已开放体验,开发者与企业可通过官方渠道申请试用。后续版本预计将在更多语言和场景上持续提升。

(本文基于公开信息整理,具体技术细节以腾讯混元官方发布为准。)

来源: aibase阅读原文

其他新闻

查看全部