尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Google 把视觉编码器砍了:12B 模型直接吃原始像素和波形,端侧跑通音画文三位一体——Gemma 4 技术报告精读

Google 把视觉编码器砍了:12B 模型直接吃原始像素和波形,端侧跑通音画文三位一体——Gemma 4 技术报告精读 系列第 4 篇 · 子领域多模态 / Multimodal【来源信息】 - 类型机构技术报告 - 标题Gemma 4 Technical Report - 作者/机构Google DeepMindGemma Team300 作者 - 出处Google DeepMind 官方技术报告 · 2026-07-02 · arXiv:2607.02770 - 原文https://arxiv.org/abs/2607.02770 - 本文性质技术解读非原创研究关键结论以原文为准一句话结论传统多模态靠「视觉编码器 音频编码器」两个翻译官把像素/波形塞进 LLMGemma 4 的 12B 直接把这俩砍了用 35M 投影层把原始图像块和 40 毫秒音频块喂进同一个 Transformer——端侧第一次跑通原生音画文。背景与痛点多模态模型的标准做法挂一个几亿参数的 ViT 当「眼睛」再挂一个 Whisper 式编码器当「耳朵」各自把信号翻成向量再粗暴塞给 LLM。这套「胶水架构」有三个老毛病——显存被撕裂无法端到端协同优化编码器本身占大量内存与预处理延迟想微调多模态得分别适配多个编码器。更要命的是过去直接灌原始波形和像素极易让文本能力崩盘。所以大家一直不敢砍。核心方法讲人话Gemma 4 12B 做了件「看似疯狂」的事encoder-free无编码器统一架构。原始图像像素块、原始音频 40ms 波形块通过一个35M 参数投影层直接投进 LLM 自身的统一嵌入空间没有中间人没有信息损耗只有一个 Unified Transformer 同时「看 / 听 / 想」靠惊人的联合预训练把文本、视觉、音频三者深度融合文本能力没退化。再加上一个内置推理thinking模式先产出一段中间推理轨迹再给最终答案把 Anthropic / OpenAI 闭源模型的 extended-thinking 搬到了开放权重上。实验与数字模型家族三个尺寸2.3B / 12B / 31BDense 与 MoE 变体都有原生多模态文本 / 图像 / 音频256K 上下文。4-bit QAT 检查点把 12B 的内存需求从26.7 GB 压到约 6.7 GBE2B / E4B 边缘变体更是低到1.1 GB / 2.5 GB。这意味着 12B 能在普通消费级显卡、甚至16GB 显存的 MacBook上本地实时跑原生音画文交互E2B/E4B 可在 iPhone 完全离线运行。旗舰 31B 多任务多语言理解基准85.2%支持 140 语言Gemma 系列累计下载超4 亿次。为什么重要反直觉点多模态不一定需要「专用编码器」。Gemma 4 证明统一嵌入空间 联合预训练这条路能走通而且带来三个实打实好处——架构更简单、预处理延迟消失、文本/图像/音频在同一个表示空间训练。这对端侧是质变一个 LoRA 就能微调整个多模态模型不用分别适配编码器动态加载部分模块还能进一步降 RAM。开放权重Apache 2.0意味着你能直接在笔记本上改、在手机上跑。复现 / 落地思路权重已在 Hugging Face / Ollama 放出下载 Gemma 4 12B 的 4-bit QAT 检查点在消费级显卡上本地部署用 LiteRT-LM 做细粒度硬件控制不需要图像时只加载文本模块省内存想定制领域能力直接对 12B 做 LoRA无需碰编码器。今日可做的 3 件事在本地拉一个 Gemma 4 12B 4-bit 检查点用一张图 一段语音测「原生多模态」是否真能同时理解。对比你现在的多模态方案把 ViTLLM 两阶段换成单 Transformer 统一架构看延迟和显存差多少。给你的端侧场景算笔账E2B1.1GB能否直接上手机离线跑通。下篇预告第 5 期我们读对齐与安全看 Anthropic 发了一份 244 页安全报告却不敢发布模型——「最对齐」和「最危险」为什么可能同时成立。
返回列表