2026-04-07 00:00
谷歌Gemma 4开源:31B参数性能比肩顶级大模型
文本核心速览
- 开源协议升级为Apache 2.0—谷歌DeepMind发布Gemma4系列,将许可证更换为Apache 2.0,降低商用与二次开发门槛,同时推出31B Dense、26B A4B MoE、E4B及E2B四款模型,覆盖端侧到服务器全场景。
- 数学与代码能力飞跃—相比前代Gemma 327B,AIME2026数学测试从20.8%提升至89.2%,Codeforces ELO评分从110升至2150,GPQA Diamond推理得分从42.4%增至84.3%,MMMLU多语言评分达88.4%。
- 内置思考模式与Agent能力—模型内置可开关的思考模式,支持函数调用与结构化JSON输出,同步发布开源Agent开发工具包(ADK),全系列支持图像视频输入,小模型还集成音频编码器支持语音识别与翻译。
- 极致的端侧工程化—E2B版本内存占用可低于1.5GB,31B旗舰版仅需一张H100即可运行,谷歌凭借极致工程化与开放协议重返开源主战场,有望拓宽全球AI开发者的创作边界。
Gemma4数学竞赛得分从20.8%飙到89.2%,Apache2.0让商用无门槛
4月3日凌晨,Google DeepMind 丢出了新一代开源模型系列 Gemma4,距离上一代整整一年。这次谷歌不仅把性能拉了一大截,还把许可证从自有协议彻底换成了全球通用的 Apache2.0——开发者可以直接拿去商用和二次开发,不用再纠结协议限制。
四款规格:从手机到工作站全覆盖
- 31B Dense(旗舰版):310亿全激活参数,支持 256K 超长上下文。在 Arena AI 开源排行榜排第三,未量化版本一张 H100 就能跑——算下来单卡就能玩,不算贵。
- 26B A4B MoE(性价比之王):混合专家架构,总参数252亿,但激活参数只有38亿。推理速度接近4B模型,质量却远超同级别,排行榜第六。群里在传这货跑起来跟小模型一样快,但智商高一大截。
- E4B & E2B(端侧精英):专为手机和嵌入式设备优化,通过 Per-Layer Embeddings 技术把有效参数压到45亿和23亿。其中 E2B 在部分设备上内存占用能压到 1.5GB 以下——相当于一个大型App的内存,手机也能扛。
性能:代码和数学直接翻番
跟上一代 Gemma3 27B 比,Gemma4 的核心指标变化让开发者直呼离谱:
- 数学竞赛:AIME2026 测试从 20.8% 飙到 89.2%——几乎从及格线边缘跳到接近满分。
- 编程进化:Codeforces ELO 评分从 110 拉到 2150,LiveCodeBench 测试从 29.1% 涨到 80.0%。有开发者试了说,现在写代码比上一代强太多,已经能当主力辅助模型用。
- 综合推理:GPQA Diamond(研究生级科学问答)从 42.4% 几乎翻倍到 84.3%。
- 多语言能力:原生支持 140多种 语言,MMMLU 评分达 88.4%。
核心特性:自带思考模式,还能当Agent
Gemma4 不光是参数堆料,交互逻辑也向旗舰 Gemini 看齐:
- Thinking Mode:内置可开关的思考模式,模型输出答案前先内部推理一遍。群里在传这玩意儿做多步骤规划任务时准确率高得吓人,比如写复杂代码或解数学题。
- 原生 Agent 支持:支持函数调用和结构化 JSON 输出。谷歌同步放出了开源 Agent 开发工具包(ADK),让端侧模型也能摇身变成智能体。有开发者试了说,直接在手机上跑个小Agent,调用API完全没问题。
- 深度多模态:所有版本都支持图像和视频输入,小模型版本还额外自带音频编码器,能搞语音识别和翻译。
开源赛道:谷歌重新下场
过去一年,国内开源模型(DeepSeek、Qwen、GLM 等)迭代飞快,谷歌在开源圈的存在感一度被抽干。Gemma4 这次甩出来,等于把球踢回给所有人——极致端侧工程化 + 完全开放协议,很多开发者觉得谷歌终于像个大厂该有的样子了。
接下来盯着看什么
31B模型能跑出接近闭源旗舰的性能,并且能在消费级显卡甚至手机上流畅运行。这会让哪些人难受?那些靠卖闭源小模型赚钱的公司。哪些人受益?搞端侧AI应用的开发者、做私有化部署的企业、还有想薅开源模型羊毛的初创团队。Apache2.0 一放,商用门槛直接归零,接下来就看各家怎么接招了。
来源: aibase阅读原文