返回新闻列表
2026-06-05 09:26

16GB内存本地即时响应!谷歌发布Gemma 4 12B,颠覆性“无编码器”架构引爆开源社区

文本核心速览
  1. 颠覆性“无编码器”架构谷歌发布Gemma4 12B,彻底取消传统多模态模型的独立视觉/音频编码器,改用轻量嵌入层直接处理输入,显著降低计算复杂度与模型体积。
  2. 消费级硬件本地部署该120亿参数模型仅需16GB显存或统一内存即可在高端笔记本电脑上流畅运行,摆脱云端依赖,实现离线处理复杂视觉与音频任务。
  3. 性能逼近更大模型多步推理与代理工作流能力接近谷歌自身26B MoE模型,并配备多Token预测技术,大幅提升端侧推理响应速度。
  4. 开源生态全面支持模型以Apache 2.0许可证开源,兼容Ollama、LM Studio、vLLM等主流推理框架,谷歌AI Edge Gallery同步提供端侧部署包,累计下载量突破1.5亿次。

谷歌砍掉编码器,Gemma4 12B 只用16GB显存就能本地跑

谷歌在6月3日开源了Gemma4 12B模型,直接取消了传统多模态模型必须配备的视觉和音频编码器,改用轻量级嵌入层处理视觉输入,120亿参数(比很多闭源小模型略大,但结构更精简)的模型被压进了消费级硬件的运行门槛内。

架构革新

传统多模态模型依赖独立的视觉和音频编码器,把图像和声音信号转换成和文本Token匹配的维度,这增加了模型体积和计算复杂度。Gemma4 12B用轻量级嵌入层直接处理视觉输入——只通过单次矩阵乘法、位置嵌入和归一化操作就能完成转换;音频信号也直接投影到文本Token的维度空间。有开发者试了说这种“无编码器”设计大幅降低了计算步骤,整个模型变得极其轻量。

得益于底层架构瘦身,120亿参数的高性能模型被完美压缩在消费级硬件门槛内。开发者或普通用户只需16GB显存或统一内存(相当于游戏本入门配置),就能在高端笔记本电脑上直接本地部署并流畅运行。这意味着用户不需要依赖昂贵的云端算力,就能离线处理复杂的视觉和音频任务。

性能表现

在实际性能上,Gemma4 12B的多步推理与代理工作流(Agent)能力已经逼近谷歌更大规模的26B MoE模型(26B专家混合模型)。群里在传,为了进一步榨干性能,模型配备了多Token预测(MTP)技术,能同时预测多个Token,显著加快了端侧推理响应速度。

开源生态

Gemma4 12B采用 Apache 2.0许可证 正式开源,模型权重已同步上架。新模型获得了主流开发生态的全面支持:无缝支持 Ollama、LM Studio、MLX、SGLang 和 vLLM 等多种推理框架;谷歌自家的AI Edge Gallery第一时间提供了端侧部署包。对于企业级生产环境,开发者还能通过谷歌云的相关工具进行大规模集群部署。

随着Gemma4系列模型累计下载量突破 1.5亿次,这一全新架构无疑会引发开源开发者社区的新一轮技术狂欢。

接下来盯着看社区能不能在消费级显卡上跑出接近26B MoE的效果,这会让云端推理厂商难受,但让普通用户和创业者受益。

来源: aibase阅读原文

其他新闻

查看全部