不久前,我发布过在 12GB RTX 5070 上使用 llama.cpp 和 IQ3_XXS 量化时,输出速度为 15 tok/s、提示处理速度为 100-120 tok/s。自那以后,我为这一个模型和这类 PC 构建了自己的推理引擎。同样的 IQ3_XXS 现在运行速度达到
~65 tok/s 输出
以及
~430 tok/s 提示处理
,而使用 RCO-GSQ 量化时,2-bit 量化版本运行得更快。
使用:
64GB DDR5 (5600)
12GB RTX 5070 SFF (Gigabyte)
Ryzen 5 7600 CPU
Windows
128K 上下文下的输出(tokens/s):
Q2_0(相当于 unsloth Q3):65.1
IQ2_XS(相当于 unsloth Q4):52.0
IQ3_XXS(相当于 unsloth Q5):44.8
128K 下的提示处理(tokens/s):
Q2_0:543
IQ2_XS:472
IQ3_XXS:414
要求:
Q2_0 = RAM+VRAM 最低 37.6GB
IQ2_XS = RAM+VRAM 最低 39.2GB
IQ3_XXS = RAM+VRAM 最低 47GB
视觉编码器 = 额外 0.91GB
你现在可以用低成本硬件一键安装并运行该引擎(目前仅针对 CUDA 优化)。
GitHub:
https://github.com/Niko1221/Strata
模型:
https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF
阅读更多
讨论精选
nasone32 (67↑):你验证过它与普通推理引擎的 logit 完全一致吗?我对这些结果有点怀疑,有些捷径可以让速度变快,但会让模型与原始版本产生很大偏差。 编辑:我无意以任何方式贬低你的成果,恭喜你的引擎,如果它有效,这些数字确实令人印象深刻,我只是基于其他推理引擎的结果应用一些科学怀疑精神。
nok01101011a (5↑):有意思,我在 lmstudio 中使用同样的 q3 模型,在我的双 5090FE 上只有 80ts,昨天还试了一个 llama 分支,结果只有 70ts。当人们在更慢的硬件上报告更高的数字时,我有点沮丧,但我只是在尝试进入 LLM 领域。希望用你的分支/引擎能获得更快的速度。谢谢
sn2006gy (4↑):TPS 总是很有趣,但是呃,它在实际工作中表现如何?