Token导航 LogoToken导航TokenDH.com

内存最少只要1G!谷歌Gemma 4全新量化版发布,手机和轻薄本本地运行起飞

更新时间 2026-06-06来源 AI寒武纪正文 1580字阅读约 5分钟3 张图片
图片

两个月前,谷歌发布了 Gemma 4 系列模型。此后,他们一直没停:先是引入了多token预测(MTP)加速推理,两天前补发了 12B 参数版本,填上 E4B 和 26B MoE 之间的空白。

今天,谷歌又推出了新的检查点版本,核心技术是量化感知训练(QAT),目标只有一个:让 Gemma 4 能在手机、笔记本这类普通消费硬件上跑起来,质量几乎持平量化之前

其中最关键的结果是:Gemma 4 E2B 的内存占用被压缩到了 1GB。

另外12B虽然可以在16G内存/显存本上跑,但是速度太慢了,这次全新量化后12B-QAT,我在16G内存 M5 Macbook Air用LM Studio用了一下,果然比量化前的12B好用多了,token速度已经能接受了,建议上32G内存/显存的本子,本地就有了真正可用的多模态模型了。

图片

以下是详细内容


量化为什么难

量化是大模型上设备的核心手段,原理是减少模型参数的精度,从而降低内存占用、提高推理速度。但问题也在这里:精度一低,模型质量往往跟着掉。

传统方案叫"训练后量化"(PTQ),即先训练好模型,再压缩。简单粗暴,但质量损失难以避免。

谷歌这次采用的 QAT 方案不同。它把量化过程直接嵌入训练阶段,让模型在训练时就学会如何在压缩状态下正常工作。结果是:同等压缩比下,QAT 的质量比 PTQ 更高。


各型号内存占用一览

谷歌为 Gemma 4 全系发布了 Q4_0 格式的 QAT 检查点,同时为 E2B 和 E4B 这两款边缘模型专门设计了一套移动端量化方案:

模型

格式

约需显存

E2B

Q4_0

约 2 GB

E2B

移动版

约 1 GB

E4B

Q4_0

约 4 GB

E4B

移动版

约 2 GB

12B

Q4_0

约 8 GB

26B MoE

Q4_0

约 16 GB

对于只需要文本功能的场景,由于音频和视觉编码器可以不加载,Gemma 4 E2B 纯文本模型的内存占用可以低于 1 GB。

图片

移动端量化方案的细节

标准压缩格式往往对手机芯片不友好,计算效率低。谷歌针对移动端硬件特性,专门设计了一套量化方案,主要包含以下几个机制:

静态激活值。 通常模型在推理时需要实时计算激活值的缩放参数,这会消耗额外算力。谷歌把这些参数在训练阶段就预先算好固定下来,减少了手机芯片在运行时的负担,响应速度也更快。

通道级量化。 压缩后的数据结构按照移动端加速器的设计方式来组织,让手机可以直接原生执行计算,不需要额外的转换步骤。

2 位定向量化。 对负责生成token的部分进行高强度的 2 位量化压缩,而核心推理层仍保持较高精度。这样可以大幅节省存储空间,同时不损害模型的理解和推理能力。

嵌入层与 KV 缓存优化。 重点压缩模型的词汇表(嵌入层)和对话短期记忆(KV 缓存),大幅降低运行时的活跃内存占用,让用户可以进行更长的对话而不会内存溢出。


怎么用

谷歌已经和多个主流开发工具完成了对接,今天起即可使用:

获取权重: Q4_0 和移动版模型权重已在 Hugging Face 上线。GGUF 格式可直接用于 llama.cpp,压缩张量版本适配 vLLM。

本地桌面运行: 支持 llama.cpp、Ollama、LM Studio 等常用工具,下载即用。

端侧部署: 可以使用谷歌的轻量化运行时 LiteRT-LM,也可以通过 Transformers.js 直接在网页端运行。

开发工具链: 大模型服务支持 SGLang 和 vLLM,Apple Silicon 平台可用 MLX 优化,微调支持 Hugging Face Transformers 和 Unsloth。MTP QAT 检查点可在量化的同时保留 MTP 带来的推理加速效果。


参考:

https://blog.google/innovation-and-ai/technology/developers-tools/quantization-aware-training-gemma-4/

--end--

最后记得⭐️我,每天都在更新:如果觉得文章还不错的话可以点赞转发推荐评论

/...@作者:你说的完全正确(YAR师)

文章标签Google模型发布大模型
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多