返回 讨论 apply CMS 文章

感谢 Mradermacher:双 4060 8GB 跑 Gemma 4 26B 达 75 tok/s

用两块 4060 8GB 和 Mradermacher 的 IQ 量化,在 LM Studio 中让 Gemma 4 26B 达到 75 tok/s 生成速度。

本地推理量化GemmaLM Studio
成长分 / 100 59 综合收获、行动、留存与影响

为什么值得读了解在有限显存(2x 4060 8GB)下运行 26B 模型的实际性能表现。

获取关于 IQ 量化在本地推理中作用的一手用户反馈。

关键洞察
  1. Mradermacher 的 IQ 量化被用户称为业内最佳。
  2. 在 2 块 4060 8GB 显卡上,Gemma 4 26B 实现了 75 tok/s 的生成速度。
  3. 提示处理速度达到 1500 pp。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:211

业内最优秀的 IQ 量化,让我用 2 块 4060 8GB 显卡,通过 lmstudio 服务到 hermes,让 gemma 4 26b 跑出了 75tok/s 的 tg 和 1500 pp,做了很多工作。

阅读更多

讨论精选

Klutzy-Snow8016 (6↑):哪个量化?