返回新闻列表
2026-04-07 00:00

谷歌Gemma 4开源:31B参数性能比肩顶级大模型

文本核心速览
  1. 开源协议升级为Apache 2.0谷歌DeepMind发布Gemma4系列,将许可证更换为Apache 2.0,降低商用与二次开发门槛,同时推出31B Dense、26B A4B MoE、E4B及E2B四款模型,覆盖端侧到服务器全场景。
  2. 数学与代码能力飞跃相比前代Gemma 327B,AIME2026数学测试从20.8%提升至89.2%,Codeforces ELO评分从110升至2150,GPQA Diamond推理得分从42.4%增至84.3%,MMMLU多语言评分达88.4%。
  3. 内置思考模式与Agent能力模型内置可开关的思考模式,支持函数调用与结构化JSON输出,同步发布开源Agent开发工具包(ADK),全系列支持图像视频输入,小模型还集成音频编码器支持语音识别与翻译。
  4. 极致的端侧工程化E2B版本内存占用可低于1.5GB,31B旗舰版仅需一张H100即可运行,谷歌凭借极致工程化与开放协议重返开源主战场,有望拓宽全球AI开发者的创作边界。

Gemma4数学竞赛得分从20.8%飙到89.2%,Apache2.0让商用无门槛

4月3日凌晨,Google DeepMind 丢出了新一代开源模型系列 Gemma4,距离上一代整整一年。这次谷歌不仅把性能拉了一大截,还把许可证从自有协议彻底换成了全球通用的 Apache2.0——开发者可以直接拿去商用和二次开发,不用再纠结协议限制。

四款规格:从手机到工作站全覆盖

  • 31B Dense(旗舰版):310亿全激活参数,支持 256K 超长上下文。在 Arena AI 开源排行榜排第三,未量化版本一张 H100 就能跑——算下来单卡就能玩,不算贵。
  • 26B A4B MoE(性价比之王):混合专家架构,总参数252亿,但激活参数只有38亿。推理速度接近4B模型,质量却远超同级别,排行榜第六。群里在传这货跑起来跟小模型一样快,但智商高一大截。
  • E4B & E2B(端侧精英):专为手机和嵌入式设备优化,通过 Per-Layer Embeddings 技术把有效参数压到45亿和23亿。其中 E2B 在部分设备上内存占用能压到 1.5GB 以下——相当于一个大型App的内存,手机也能扛。

性能:代码和数学直接翻番

跟上一代 Gemma3 27B 比,Gemma4 的核心指标变化让开发者直呼离谱:

  • 数学竞赛:AIME2026 测试从 20.8% 飙到 89.2%——几乎从及格线边缘跳到接近满分。
  • 编程进化:Codeforces ELO 评分从 110 拉到 2150,LiveCodeBench 测试从 29.1% 涨到 80.0%。有开发者试了说,现在写代码比上一代强太多,已经能当主力辅助模型用。
  • 综合推理:GPQA Diamond(研究生级科学问答)从 42.4% 几乎翻倍到 84.3%
  • 多语言能力:原生支持 140多种 语言,MMMLU 评分达 88.4%

核心特性:自带思考模式,还能当Agent

Gemma4 不光是参数堆料,交互逻辑也向旗舰 Gemini 看齐:

  • Thinking Mode:内置可开关的思考模式,模型输出答案前先内部推理一遍。群里在传这玩意儿做多步骤规划任务时准确率高得吓人,比如写复杂代码或解数学题。
  • 原生 Agent 支持:支持函数调用和结构化 JSON 输出。谷歌同步放出了开源 Agent 开发工具包(ADK),让端侧模型也能摇身变成智能体。有开发者试了说,直接在手机上跑个小Agent,调用API完全没问题。
  • 深度多模态:所有版本都支持图像和视频输入,小模型版本还额外自带音频编码器,能搞语音识别和翻译。

开源赛道:谷歌重新下场

过去一年,国内开源模型(DeepSeek、Qwen、GLM 等)迭代飞快,谷歌在开源圈的存在感一度被抽干。Gemma4 这次甩出来,等于把球踢回给所有人——极致端侧工程化 + 完全开放协议,很多开发者觉得谷歌终于像个大厂该有的样子了。

接下来盯着看什么

31B模型能跑出接近闭源旗舰的性能,并且能在消费级显卡甚至手机上流畅运行。这会让哪些人难受?那些靠卖闭源小模型赚钱的公司。哪些人受益?搞端侧AI应用的开发者、做私有化部署的企业、还有想薅开源模型羊毛的初创团队。Apache2.0 一放,商用门槛直接归零,接下来就看各家怎么接招了。

来源: aibase阅读原文

其他新闻

查看全部