腾讯混元发布 Hy ASR 3.0 preview:语音识别不再逐字硬转
- 发布融合大模型新模型—腾讯混元发布Hy ASR 3.0 preview,融合Hy3大语言模型能力,将高精度识别与深度语义理解结合,实现从逐字转写到理解语境的升级。
- 多语种WER低至3%左右—海外评测中普通话WER为3.34%,英语2.62%,粤语3.12%;自建评测在方言、高噪、耳语等场景均保持低错词率,鲁棒性优异。
- 上下文纠错更懂意图—模型可结合上下文纠正同音词、消弭歧义,例如区分“工行”与“攻行”,准确理解用户真实意图,而非机械转写。
- 专业场景热词注入—支持热词注入增强,无需大量定制训练即可识别品牌名、人名及行业术语,在金融、医疗、法律等垂直领域降低成本。
- 智能助手意义与开放—标志语音识别转向具备语义理解的智能助手,未来可应用于智能客服、语音纪要等;目前Hy ASR 3.0 preview已开放体验。
腾讯混元发布 Hy ASR 3.0 preview:语音识别不再逐字硬转
腾讯混元今日正式发布新一代语音识别模型 Hy ASR 3.0 preview。该模型背靠最新一代大语言模型 Hy3 的语言理解能力,将高精度语音识别与深度语义理解深度融合,在通用识别、上下文感知、多场景鲁棒性和方言覆盖等核心维度实现全面升级。官方表示,这标志着语音识别从“逐字转写、单点优化”进化到“理解语境、兼容场景、一键直出”。
核心指标:多语种 WER 低至 3% 左右
在海外开源评测集上,Hy ASR 3.0 preview 表现出色:
- 中文普通话词错误率(WER):3.34%
- 英语:2.62%
- 粤语:3.12%
在腾讯自建评测集中,无论是通用识别、方言识别、上下文理解、专词理解,还是高噪、耳语等复杂声学场景,WER 均维持在低位,综合评测集上取得最低错词率。这显示出模型在多样化和真实复杂音频条件下的鲁棒性。
三大体验升级
1. 通用识别更精准
在通用语音、方言、中英混说等场景下,Hy ASR 3.0 preview 进一步压低错字和漏字,同时缓解了长音频中错误累积的顽疾。对于需要长时间录音转写的会议、采访等场景,这一改进将显著提升效率与准确性。
2. 更懂用户意图
模型能够结合上下文精准捕捉用户语境,智能纠正同音词,消弭语义歧义。例如,在“我要去工行”与“我要去攻行”这类容易混淆的表述中,模型可通过上下文判断用户真实意图,输出更符合本意的文字,而非机械地逐字转换。
3. 专业场景适配
支持热词注入增强,让模型快速识别品牌名、产品名、人名和行业术语。企业接入时无需大量定制训练,即可在金融、医疗、法律等垂直领域获得高准确率,降低业务部署和后续模型维护成本。
官方评价:这是一次“理解语境、兼容场景、一键直出”的进化。
意义与展望
Hy ASR 3.0 preview 的发布,意味着语音识别正从单纯的“声音到文字”工具,转向具备语义理解能力的智能助手。结合大语言模型的推理能力,未来语音交互将进一步突破传统 ASR 的天花板,在智能客服、语音纪要、实时字幕等场景释放更大价值。
腾讯混元表示,Hy ASR 3.0 preview 已开放体验,开发者与企业可通过官方渠道申请试用。后续版本预计将在更多语言和场景上持续提升。
(本文基于公开信息整理,具体技术细节以腾讯混元官方发布为准。)