C
发布于 2026/09/03 · 阅读 4
Gemma 4 12B:统一的无编码器多模态模型
- #Gemma
- #多模态
- #开源模型
- #Hacker News
今天,我们推出 Gemma 4 12B,这是我们最新的模型,旨在将具备代理能力的多模态智能直接带到笔记本电脑上。该模型填补了边缘友好型 E4B 与更先进的 26B 专家混合(MoE)模型之间的空白,以更小的内存占用封装了强大的能力。它也是我们首款支持原生音频输入的中型模型。
感谢开发者社区,Gemma 4 模型下载量已突破 1.5 亿次。你们构建了从可穿戴机械臂到企业级 AI 安全等各类应用。我们期待看到你们利用这一最新模型创造的新成果。
以下是 Gemma 4 12B 的独特之处:
- 新颖的统一架构:没有多模态编码器。视觉和音频输入直接流入 LLM 主干。
- 高级推理:基准测试性能接近我们的 26B 模型,支持强大的多步推理和代理工作流。
- 笔记本就绪:足够小,仅需 16GB 显存或统一内存即可本地运行。
- 开放与可访问:基于 Apache 2.0 许可证发布,获得开发者生态系统的支持。
- 草稿器就绪:Gemma 4 12B 配备了多令牌预测(MTP)草稿器以减少延迟。
这些特性共同将先进的多模态能力带到了日常硬件上,且不牺牲速度或推理能力。下面我们详细看看 Gemma 4 12B 如何实现这一点。
本地运行最先进的代理
Gemma 4 12B 在标准基准测试中性能接近我们更大的 26B MoE 模型,但总内存占用不到后者的一半。它小到足以在配备 16GB 内存的消费级笔记本电脑上本地运行,释放强大的多模态和代理体验。
体验独特高效的统一架构
Gemma 4 12B 的与众不同之处在于其处理视觉和音频输入的简化方法。传统的多模态模型通常依赖独立的编码器来转换图像和音频,然后将这些表示传递给语言模型。由于这些分离的编码器会增加延迟和内存使用,我们使用无编码器架构训练了 Gemma 4 12B,以直接集成音频和视觉输入。
Gemma 4 12B 原生处理多模态输入的方式如下:
- 视觉:我们用轻量级嵌入模块替换了 Gemma 4 的视觉编码器,该模块由单次矩阵乘法、位置嵌入和归一化组成。这使得 LLM 主干接管视觉处理。
- 音频:我们进一步简化了音频处理。完全移除了音频编码器,将原始音频信号投影到与文本令牌相同的维度空间。
想要详细了解的开发者,请查阅我们的配套文档《Gemma 4 12B 开发者指南》。
立即开始
- 亲自尝试:在 LM Studio、Ollama、Google AI Edge Gallery App、Google AI Edge Eloquent app 和 LiteRT-LM CLI 中点击几下即可实验。
- 下载权重:直接从 Hugging Face 和 Kaggle 下载预训练和指令微调的检查点。
- 集成与学习:查看开发者文档和快速入门笔记本。
- 使用你喜爱的开发工具:通过 Hugging Face Transformers、llama.cpp、MLX、SGLang 和 vLLM 实现本地推理管道,或使用 Unsloth 高效微调。
- 解锁基于 Gemma Skills 的代理开发:为了支持代理利用最新的 Gemma 进展进行构建,我们发布了官方 Skills Repository。这是一个专门为使代理能够基于 Gemma 模型构建而设计的技能库。
- 按需部署:通过 Google Cloud 在生产环境中启动端点。可通过 Gemini Enterprise Agent Platform Model Garden、Cloud Run 和 GKE 进行部署。
4 阅读0 评论0 点赞
评论