8月31日,MiniMax再度加码多模态赛道:H3 Max 768P与480P版本正式登陆MiniMax开放平台及Design工具,开发者可直接调用。该模型由fal基于MiniMax H3开源权重深度优化,生成一段5秒、768P高清音视频耗时不足3秒,效率惊人。消息公布当日,MiniMax-W股价收盘大涨逾16%,盘中一度逼近20%。交银国际则透露,MiniMax上半年收入同比激增2.8倍,8月ARR突破8亿美元大关,远超外界预期。对AI应用开发者而言,可尽快试用以抢占音视频生成红利。
千问发布语音合成大模型Qwen-Audio-3.0-TTS,主打Free-style自然语言指令控制,用户无需调整工程参数,仅用日常语言描述即可让AI按指定语气、节奏、风格说话,极大简化操作门槛。
阿里通义千问推出的Qwen-Audio-3.0-TTS语音合成模型,不再只是机械发声,而是能真正“带感情”地表达。其Plus版本在Artificial Analysis Speech Arena榜单上力压Gemini3.1TTS等对手,拿下全球第一。该模型提供了两套方案:Flash版专为实时交互优化,首包延迟低至约300ms,适合语音助手、直播等场景;Plus版则在细腻度与自然度上更胜一筹,适合有声书、客服语音等需要高表现力的应用。挑选时,若追求响应速度选Flash,若在意语音品质选Plus。
火山引擎发布豆包音频生成模型1.0,支持文本或音频输入,端到端生成完整音频作品。核心突破是单条Prompt即可同步生成对白、音效和背景音乐,无需传统多轨剪辑。该技术大幅简化音频制作流程,让用户像“音频导演”一样高效产出成片级音频,彻底告别手动对齐混音的复杂后期工作。
Spotify在2026年投资者日推出核心AI战略载体——Studio by Spotify Labs,标志其从音频播放器转型为生成式音频平台。该桌面应用内置全能AI助理,可连接日历、邮箱、笔记,具备网页浏览与信息整理能力,并支持根据用户日程表定制个人音频内容。