返回 讨论 build CMS 文章

12GB 显存跑 Qwen3.8-Flash-Next:自研推理引擎实现 65 tok/s 输出

在 12GB 显存消费级 PC 上,用自研引擎把 Qwen3.8-Flash-Next 的推理速度提升数倍。

本地推理Qwen3.8-Flash-Next12GB显存量化
成长分 / 100 66 综合收获、行动、留存与影响

为什么值得读了解在 12GB 显存 + 64GB 内存的普通 PC 上运行大模型的实际速度与内存门槛。

对比 Q2_0、IQ2_XS、IQ3_XXS 三种量化在 128K 上下文下的输出与提示处理速度。

关键洞察
  1. 同一 IQ3_XXS 量化在自研引擎下输出约 65 tok/s、提示处理约 430 tok/s,远高于此前 llama.cpp 的 15 tok/s 与 100-120 tok/s。
  2. 128K 上下文下,Q2_0 输出 65.1 tok/s、IQ2_XS 52.0 tok/s、IQ3_XXS 44.8 tok/s;提示处理分别为 543、472、414 tok/s。
  3. 内存需求随量化精度上升:Q2_0 最低 37.6GB、IQ2_XS 39.2GB、IQ3_XXS 47GB(RAM+VRAM),视觉编码器额外 0.91GB。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:1950

不久前,我发布过在 12GB RTX 5070 上使用 llama.cpp 和 IQ3_XXS 量化时,输出速度为 15 tok/s、提示处理速度为 100-120 tok/s。自那以后,我为这一个模型和这类 PC 构建了自己的推理引擎。同样的 IQ3_XXS 现在运行速度达到

~65 tok/s 输出

以及

~430 tok/s 提示处理

,而使用 RCO-GSQ 量化时,2-bit 量化版本运行得更快。

使用:

64GB DDR5 (5600)

12GB RTX 5070 SFF (Gigabyte)

Ryzen 5 7600 CPU

Windows

128K 上下文下的输出(tokens/s):

Q2_0(相当于 unsloth Q3):65.1

IQ2_XS(相当于 unsloth Q4):52.0

IQ3_XXS(相当于 unsloth Q5):44.8

128K 下的提示处理(tokens/s):

Q2_0:543

IQ2_XS:472

IQ3_XXS:414

要求:

Q2_0 = RAM+VRAM 最低 37.6GB

IQ2_XS = RAM+VRAM 最低 39.2GB

IQ3_XXS = RAM+VRAM 最低 47GB

视觉编码器 = 额外 0.91GB

你现在可以用低成本硬件一键安装并运行该引擎(目前仅针对 CUDA 优化)。

GitHub:

https://github.com/Niko1221/Strata

模型:

https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF

阅读更多

讨论精选

nasone32 (67↑):你验证过它与普通推理引擎的 logit 完全一致吗?我对这些结果有点怀疑,有些捷径可以让速度变快,但会让模型与原始版本产生很大偏差。 编辑:我无意以任何方式贬低你的成果,恭喜你的引擎,如果它有效,这些数字确实令人印象深刻,我只是基于其他推理引擎的结果应用一些科学怀疑精神。

nok01101011a (5↑):有意思,我在 lmstudio 中使用同样的 q3 模型,在我的双 5090FE 上只有 80ts,昨天还试了一个 llama 分支,结果只有 70ts。当人们在更慢的硬件上报告更高的数字时,我有点沮丧,但我只是在尝试进入 LLM 领域。希望用你的分支/引擎能获得更快的速度。谢谢

sn2006gy (4↑):TPS 总是很有趣,但是呃,它在实际工作中表现如何?