返回新闻列表
2026-07-24 09:35

微软自研双模型MAI-Image-2.5-Pro与MAI-Voice-2-Flash发布,已落地Bing和PowerPoint

文本核心速览
  1. 发布自研双模型微软推出MAI-Image-2.5-Pro与MAI-Voice-2-Flash两款自研AI模型,均进入公开预览阶段,强调不使用第三方蒸馏,训练数据可追踪。
  2. 图像模型性能提升MAI-Image-2.5-Pro支持自然语言编辑,GPU成本较GPT-Image-2最高降低84%,已作为Bing Image Creator默认模型,并在PowerPoint中启用图像编辑功能。
  3. 语音模型成本与速度优化MAI-Voice-2-Flash针对高并发场景优化,速度提升约2倍,成本降低32%,已接入Dynamics 365 Contact Center,为T-Mobile、EasyJet等客户提供服务。
  4. 医疗转录应用进展同系列MAI-Transcribe-1.5用于Dragon Copilot,被17万医护人员使用,上季度处理2800万次问诊,支持58种语言,多数语言错误率相对下降50%。

微软双模型上线:MAI-Image-2.5-Pro GPU成本比GPT-Image-2低84%

7月23日,微软把两款自研AI模型MAI-Image-2.5-ProMAI-Voice-2-Flash直接扔进了公开预览。有开发者试用后说,这俩模型一个主打高质量图像生成,一个专攻高并发语音交互,而且训练数据都经过清理和可追踪,不依赖第三方模型蒸馏——从底层设计就是奔着微软自家产品用户去的。

图像模型 MAI-Image-2.5-Pro

这是微软目前精度最高的图像模型,能搞定主视觉图片生成、细节编辑和图像内文字渲染这些硬活儿,还支持自然语言编辑指令。群里在传,这模型已经是Bing Image Creator的默认图像生成模型,在PowerPoint里也被拿来搞图像到图像编辑。跟GPT-Image-2比,GPU成本能降84%(省了一大截)。部署到OneDrive后,相关场景保存成功率提升26%,P95延迟降低约25%,中等负载生产环境效率直接翻了2.5倍

  • 定价:文本输入每百万Token收5美元(大概能生成几千张图的指令),图像输出每百万Token收106美元(差不多一张高清图几美分)。

语音模型 MAI-Voice-2-Flash

这个模型专为高频语音应用优化,速度比上一代快了2倍,成本反而降了32%(适合客服中心和语音助手这种要秒回的活儿)。已经接入了Dynamics 365 Contact Center,T-Mobile、EasyJet这些客户正在用,GPU成本最高能降89%。微软还把它塞进了Azure Voice Live服务,开发者可以用它搭语音到语音的交互智能体。

其他进展

同系列的MAI-Transcribe-1.5已经在医疗语音方案Dragon Copilot里跑起来了,17万名医疗服务提供者用,上季度处理了2800万次患者问诊记录,支持58种语言,多数语言转录错误率相对下降50%。有消息说下一代GB200计算集群已经投入运行,MAI系列模型还会继续扩。

接下来盯着看:这俩模型会不会让OpenAI的API定价承压?Bing Image Creator和PowerPoint里的效果到底香不香?以及微软能不能靠“不蒸馏、自研”这张牌从开发者口袋里抢预算。

来源: aibase阅读原文

其他新闻

查看全部