微软自研双模型MAI-Image-2.5-Pro与MAI-Voice-2-Flash发布,已落地Bing和PowerPoint
- 发布自研双模型—微软推出MAI-Image-2.5-Pro与MAI-Voice-2-Flash两款自研AI模型,均进入公开预览阶段,强调不使用第三方蒸馏,训练数据可追踪。
- 图像模型性能提升—MAI-Image-2.5-Pro支持自然语言编辑,GPU成本较GPT-Image-2最高降低84%,已作为Bing Image Creator默认模型,并在PowerPoint中启用图像编辑功能。
- 语音模型成本与速度优化—MAI-Voice-2-Flash针对高并发场景优化,速度提升约2倍,成本降低32%,已接入Dynamics 365 Contact Center,为T-Mobile、EasyJet等客户提供服务。
- 医疗转录应用进展—同系列MAI-Transcribe-1.5用于Dragon Copilot,被17万医护人员使用,上季度处理2800万次问诊,支持58种语言,多数语言错误率相对下降50%。
微软双模型上线:MAI-Image-2.5-Pro GPU成本比GPT-Image-2低84%
7月23日,微软把两款自研AI模型MAI-Image-2.5-Pro和MAI-Voice-2-Flash直接扔进了公开预览。有开发者试用后说,这俩模型一个主打高质量图像生成,一个专攻高并发语音交互,而且训练数据都经过清理和可追踪,不依赖第三方模型蒸馏——从底层设计就是奔着微软自家产品用户去的。
图像模型 MAI-Image-2.5-Pro
这是微软目前精度最高的图像模型,能搞定主视觉图片生成、细节编辑和图像内文字渲染这些硬活儿,还支持自然语言编辑指令。群里在传,这模型已经是Bing Image Creator的默认图像生成模型,在PowerPoint里也被拿来搞图像到图像编辑。跟GPT-Image-2比,GPU成本能降84%(省了一大截)。部署到OneDrive后,相关场景保存成功率提升26%,P95延迟降低约25%,中等负载生产环境效率直接翻了2.5倍。
- 定价:文本输入每百万Token收5美元(大概能生成几千张图的指令),图像输出每百万Token收106美元(差不多一张高清图几美分)。
语音模型 MAI-Voice-2-Flash
这个模型专为高频语音应用优化,速度比上一代快了2倍,成本反而降了32%(适合客服中心和语音助手这种要秒回的活儿)。已经接入了Dynamics 365 Contact Center,T-Mobile、EasyJet这些客户正在用,GPU成本最高能降89%。微软还把它塞进了Azure Voice Live服务,开发者可以用它搭语音到语音的交互智能体。
其他进展
同系列的MAI-Transcribe-1.5已经在医疗语音方案Dragon Copilot里跑起来了,17万名医疗服务提供者用,上季度处理了2800万次患者问诊记录,支持58种语言,多数语言转录错误率相对下降50%。有消息说下一代GB200计算集群已经投入运行,MAI系列模型还会继续扩。
接下来盯着看:这俩模型会不会让OpenAI的API定价承压?Bing Image Creator和PowerPoint里的效果到底香不香?以及微软能不能靠“不蒸馏、自研”这张牌从开发者口袋里抢预算。