Gemma 4 QAT 模型:优化压缩,提升移动和笔记本电脑效率
- #Gemma
- #量化感知训练
- #模型压缩
- #边缘计算
- #AI工程
Gemma 4 QAT 模型:优化压缩,提升移动和笔记本电脑效率
2026年6月5日 · 分享
我们推出了 Gemma 4 系列的新版本,这些版本通过量化感知训练(QAT)进行了优化,以大幅降低内存需求并最大化设备端性能。
Olivier Lacombe,Google DeepMind 产品管理总监 Omar Sanseviero,Google DeepMind 技术团队成员
自两个月前发布 Gemma 4 以来,我们一直在持续扩展其能力。首先,我们引入了多令牌预测(MTP)以加速推理;就在几天前,我们发布了 12B 模型,以填补 E4B 和 26B MOE 模型之间的空白。
今天,我们发布了经过量化感知训练(QAT)优化的新检查点,使 Gemma 4 更加高效,从而您可以在日常边缘设备和消费级 GPU 上本地运行模型。
通过在训练过程中模拟量化,QAT 在模型压缩时最大限度地减少质量损失。此次发布包括流行 Q4_0 量化格式的 QAT 检查点,以及一种专为移动用例设计的新型量化格式。使用这种移动格式,我们将 Gemma 4 E2B 的内存占用降至 1GB。这些技术共同大幅降低了内存需求,同时保留了您对 Gemma 4 所期望的能力和质量。
在缩小模型的同时保持质量
量化是在消费级硬件上运行模型的关键技术,它通过减少内存占用并加速解码速度来实现。然而,标准的训练后量化(PTQ)通常会导致性能下降。QAT 不是简单地在训练后量化模型,而是将量化过程直接集成到训练中。尽管 PTQ 在保留质量方面已经有效,但与标准 PTQ 基线相比,我们的 QAT 结果实现了更高的整体质量。
我们将这种 QAT 方法应用于流行的 Q4_0 格式,以最大化所有模型的性能。对于边缘模型(E2B 和 E4B),我们重新思考了量化方法,采用了一种专门针对移动设备的量化方案。
节省 VRAM 和存储空间
以下是加载模型所需的大致内存需求(VRAM):
- Gemma 4 E2B(移动格式):约 1 GB
- Gemma 4 E2B(Q4_0):约 2 GB
- Gemma 4 E4B(Q4_0):约 4 GB
- Gemma 4 9B(Q4_0):约 6 GB
- Gemma 4 26B(Q4_0):约 16 GB
移动设备底层优化
标准压缩格式往往难以在移动处理器上高效运行。为了确保 Gemma 4 在移动设备上流畅运行,我们设计了一种针对边缘硬件的自定义移动量化方案:
- 静态激活:通常,模型会浪费处理能力来实时计算如何缩放数据。我们在训练过程中预先计算这些设置,从而减少移动芯片的工作负载,使响应更快。
- 通道级量化:我们将压缩数据的结构设计为适应移动加速器的设计。这使手机能够本地执行计算,无需缓慢的变通方法。
- 针对性 2-bit 量化:我们对模型中生成令牌的特定部分进行了大幅压缩(至 2-bit),同时保持核心推理层的高精度。这节省了存储空间,同时不会降低模型的智能程度。
- 嵌入和 KV 缓存优化:我们将压缩重点放在模型的词汇列表和短期记忆上。这显著减少了活动内存占用,让您可以进行长时间对话而不会耗尽空间。
由于在许多用例中不需要音频和视觉编码器,您可以通过仅部署所需的模态来进一步优化内存占用。例如,Gemma 4 E2B 纯文本模型(不含逐层嵌入)所需内存不到 1 GB。
立即开始使用
为了使这些模型能够轻松地用于您首选的工作流程,我们从今天起与生态系统中流行的开发者工具合作,无缝支持 Gemma 4 QAT 检查点:
- 下载权重:立即在 Hugging Face 上获取 Q4_0 和移动模型权重。我们根据您的工作流程定制了格式:GGUF 格式可直接用于 llama.cpp,同时为 vLLM 提供了压缩张量。对于其他情况,我们共享未量化的检查点,这些检查点可以转换并量化为支持 Q4_0 的格式。
- 集成与学习:查阅我们的文档,了解如何最佳部署 QAT 检查点。
- 在桌面上尝试:使用 llama.cpp、Ollama 和 LM Studio 等用户友好界面,轻松在桌面上下载、管理和运行 Gemma 4 QAT 模型。
- 设备端部署:使用 Google 的轻量级 LiteRT-LM 运行时进行优化的边缘部署,或通过 Transformers.js 直接在网页上运行模型。
- 使用您喜爱的开发工具:使用 SGLang 和 vLLM 高效服务更大模型,使用 MLX 优化 Apple Silicon。使用 MTP QAT 检查点在量化模型的同时保留 MTP 的加速效果。直接使用 Hugging Face Transformers 和 Unsloth 微调权重。
我们迫不及待地想看到您使用本地运行的 Gemma 4 构建的应用!
评论