Google宣布将于太平洋时间9月10日11:30在Gemini Discord演示中展示Lyria 3.5的新创意控制功能,包括选择音乐时长、流派和人声,以及使用模板获取灵感。
谷歌9月5日发布公告,宣布在Gemini应用和Gemini API中上线最新音乐生成模型Lyria 3.5,同步开放给开发者,通过Google AI Studio、Vertex AI及Gemini API提供调用接口。模型可生成时长数分钟的完整歌曲,支持MP3和WAV输出,并嵌入SynthID隐形水印。
微软9月3日发布AI语音转文字模型MAI-Transcribe-2,限时收费0.10美元/小时至2026年底。在FLEURS测试中平均词错误率5.2%,优于Gemini 3.1 Pro、GPT-Transcribe等竞品,速度比GPT-Transcribe快10倍。支持60种语言、说话人分离、逐词时间戳等功能,开发者可在Microsoft Foundry等平台调用。
Google于今日凌晨正式上线Gemini 3.8 Flash模型,这是其六周内发布的第三款Flash模型。该模型主打长程软件工程和自主Agent能力,在DeepSWE v1.1等测试中得分提升,价格与3.7 Flash保持一致,并同步发布了面向网络安全机构的3.8 Flash Cyber版本。
Google宣布为Android推出五项新功能,包括缓解晕车的Motion Assist、辅助视障用户的Guided Vision、物品定位及消息个性化等,其中部分功能利用Gemini模型。
菲尔兹奖得主陶哲轩在2026年8月接受《新科学家》杂志深度访谈,警告数学界只剩几个月应对AI带来的结构性危机。他称AI以每周攻克数道数学难题的速度推进,数学正从“证明稀缺”转向“证明过剩”,人类消化能力跟不上AI产出。他列举了Gemini十分钟解决Erdős问题367、Astra产出10项成果、Claude Fable 5参与雅可比猜想反例等案例,并指出AI解决真实难题成功率仅1%-2%。
当地时间8月27日,谷歌宣布推出Gemini Omni 1.1 Flash视频生成AI模型,最高可生成4K视频。新模型支持场景扩展、指定首尾帧、生成360p预览、最高4K分辨率及视频参考等功能,并公布了各分辨率下的生成价格。
Barret Zoph 在离开 OpenAI 后,已加入谷歌担任研究副总裁。谷歌发言人向《华尔街日报》确认了这一消息,并表示期待 Zoph 回归谷歌,将其强化学习(RL)和后期训练(post-training)的专业知识带到 Gemini 项目。
谷歌宣布推出全球首个针对前沿专有AI模型的双盲评估,在加密黑箱环境中进行机密基准测试,防止基准污染。该技术联合新加坡AI安全研究所、OpenMined、AVERI及MLCommons,利用谷歌云Confidential Space实现加密验证,保护模型权重和测试数据隐私,适用于高敏感度评估场景。
2026年8月26日,谷歌扩展Gemini Enterprise人工智能平台,推出面向律师和律所的Gemini Enterprise for Legal工具,可帮助处理日常及复杂法律工作,还推出金融服务行业相关AI工具。