Gemma 4 家族里,E4B(7.5B)和 26B(25.2B,激活 4B)是核显用户最纠结的两款:都是 MoE、都在核显上实测跑通、生成速度还几乎一样。那是不是闭眼买大的就行?实测数据告诉我没那么简单。
同机对比:Intel Arc 140T 核显 / 23.5GB 内存 / llama.cpp b10621 / llama-bench pp512·tg128 / 8 线程。26B 为调显存后 Vulkan 全量 offload 成绩。2026-09 实测。
硬碰硬
| 项目 | gemma-4-E4B | supergemma4-26B |
|---|---|---|
| 参数量 | 7.52 B | 25.23 B(26B.A4B) |
| 文件体积(Q4_K_M) | 4.62 GiB | 15.63 GiB |
| 能否整体进核显 | ✅ 天生能 | ⚠️ 需调显存后 |
| 生成 tg128 | 20.34 t/s | 21.38 t/s |
| 预填充 pp512 | 380.8 t/s | 243.6 t/s |
| 内存门槛 | 8G 机器可跑 | 32G 机器才舒服 |
柱状图对比生成速度:
三个关键发现
1. 生成速度几乎打平(20.3 vs 21.4 t/s)
两款都是 MoE,解码瓶颈都在内存带宽——激活参数量级相近(E4B 激活约 1-2B,26B 激活 4B),速度自然拉不开。为 21.4 vs 20.3 的 5% 差距多背 11GB 文件,不划算。速度从来不是选 26B 的理由。
2. 但预填充 26B 反而更慢(244 vs 381 t/s)
预填充要遍历全部参数权重,26B 权重文件是 E4B 的 3.4 倍,即使激活只差几倍,读取成本也把它拖下来。Agent 场景(长系统提示词反复 prefill)反而是 E4B 的主场。
3. 内存门槛天壤之别
E4B 4.6GB 文件 + 运行开销,8G 内存的小主机就能跑;26B 15.6GB + KV + 临时区,32G 才舒服,16G 机器连文件都塞不下。选 26B 之前先看自己的内存预算。
质量差距有多大
这没法用跑分量化,只能看产出。我在8 模型小说横评里测过:26B 档(supergemma4-26b)文笔金句密度明显高于 E4B 档,E4B 风格更「规整」但记忆点少。翻译、总结这类任务差距缩小。
怎么选
| 你的情况 | 推荐 |
|---|---|
| 8~16G 内存 / 小主机 / NAS | E4B |
| Agent / 长系统提示词 / RAG | E4B(prefill 更快) |
| 32G 内存 + 愿意调显存 | 26B(质量优先) |
| 创作、长文写作 | 26B |
| 快速试水 / 不折腾 | E4B(下载小、门槛低) |
一句话:E4B 是日用甜点,26B 是质量上限。内存够、愿意为质量多花 11GB,就上 26B;否则 E4B 的速度、体积和门槛让它更值得常驻。
