返回新闻列表
2026-05-22 11:06

开启全模态开源时代:网易有道“子曰4.0”重塑AI交互标准

文章提及的 AI 工具网易有道词典
文本核心速览
  1. 全模态融合交互子曰4.0实现文本、图片、音频的统一表征与处理,支持多媒介自然切换,在复杂指令理解和多媒体内容生成方面性能大幅跃升。
  2. 全量开源核心技术网易有道将多模态模型和TTS引擎开源,TTS支持3秒情感克隆,仅需少量音频即可定制拟人化语音,显著降低企业级应用开发门槛。
  3. 数理逻辑达SOTA水平在27B参数规模下,子曰4.0在数理逻辑与推理任务上达到行业顶尖(SOTA)水平,精准度与逻辑严密性显著提升。
  4. 翻译引擎底层重构有道对翻译模型进行深度底层技术重构,在保持高效推理的同时实现翻译质量质的飞跃,优化跨语言交互流畅感。

网易有道把子曰4.0核心代码全扔出来了,TTS引擎3秒克隆情感

网易有道今天把“子曰”大模型4.0版本的全部核心技术扔到了开源社区,包括多模态模型和语音合成引擎。群里在传,这次开源不是因为突然变大方,而是想靠开发者生态把模型落地成本打下来。

核心性能:27B参数拿下数理逻辑第一

有三个维度让开发者试了说“有点意思”:

  • 全模态融合交互:模型能同时处理文本、图片、音频,用户在不同媒介间随便切,复杂指令理解和多媒体内容生成都不卡壳。有开发者试了说,比上一代快得多。
  • 数理逻辑SOTA:在27B参数规模下(中等大小,不算巨无霸),子曰4.0在数理逻辑和推理任务上冲到了行业最顶尖(SOTA)。这意味着它解数学题、做逻辑推导时,精准度和严密性都压过了同样参数量的竞品。
  • 翻译引擎重构:有道的老本行翻译,底层技术彻底重写了一次。推理速度没降,但翻译质量“质的飞跃”,跨语言对话流畅到不像机器翻的。

开源了什么?3秒情感克隆加省算力的思维链

  • 多模态模型 + TTS引擎:全套核心模型开源,其中TTS引擎支持3秒情感克隆——只需要几秒钟的音频素材,就能生成高度拟人化的声音,连情绪都能模仿。开发者说这玩意儿把企业级语音应用的开发门槛从“请团队”降到了“调接口”。
  • 重构思维链(CoT):有道把模型内部推理的思维链逻辑重新优化了,计算资源消耗明显下降。有开发者算过,同样效果下推理成本能省一小半。开源方案里兼顾性能和落地成本的,这个算头一波。

谁会受益?谁难受?

行业里很多人在盯这件事。以前国内大模型厂商大多闭源,现在有道全量开源,相当于把“语音+视觉+逻辑推理”的底层能力直接塞到开发者手里。声音克隆、多模态Agent这些以前得大厂自己搞的活儿,现在个人开发者也能快速搭出来。

接下来盯着看:其他闭源模型厂商会不会被迫跟进?教育领域之外(比如客服、游戏NPC、虚拟主播)的落地应用会不会突然爆发?以及,那些靠卖TTS接口赚钱的公司,今天可能有点睡不着。

来源: aibase阅读原文

其他新闻

查看全部