返回 讨论 apply CMS 文章

Strata 推理引擎实测:12GB 显存笔记本本地运行 Qwen3.8 Flash Next,速度远超 llama.cpp

12GB 显存笔记本跑前沿模型:Strata 引擎让 Qwen3.8 Flash Next 的推理速度达到 llama.cpp 的两倍以上。

Stratallama.cppQwen3.8GGUF
成长分 / 100 66 综合收获、行动、留存与影响

为什么值得读了解一个被低估的推理引擎 Strata 在消费级笔记本硬件上的实际性能表现。

获取 12GB 显存 + 64GB 内存配置下运行前沿量化模型的真实速度与内存占用数据。

关键洞察
  1. Strata 引擎在相同量化下,43k 上下文深度生成速度达 51 t/s,而原版 llama.cpp 仅 23 t/s。
  2. 32k 上下文读取速度达 1500 t/s,原版 llama.cpp 相同量化下 PP 仅 100 t/s。
  3. 内存占用为 11GB 显存和 56GB 内存(含系统/操作系统程序)。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:2449

我觉得大多数人都低估了这个推理引擎。我试过多个 llama.cpp 的分支,没有一个能接近 Strata 的推理速度。最初的版本在 kv cache、CPU 降频方面有一些 bug,开发者已经修复了。

推理引擎(目前仅支持 Nvidia;AMD 支持仍处于实验阶段):

https://github.com/Niko1221/Strata

以下是一些指标和截图。我的笔记本配备 5070ti 12GB 显存、64GB ddr5 内存、Intel 275HX CPU、gen4 SSD。

水族箱测试(unsloth studio 通过本地 API 连接)

我使用的模型是

https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF/tree/main/IQ3_XXS

就其体积而言质量很好。上面就是该模型生成的水族箱测试。在 43k 上下文深度下,它以 51 t/s 运行。相同量化下,原版 llama.cpp 只能达到 23t/s。

32k 上下文读取速度达到 1500t/s(unsloth studio 通过本地 API)

相同量化下,这个量化版本在原版 llama.cpp 中 PP 只能达到 100t/s。而 Strata 以 1500t/s 读取 32k 上下文文本。这远超我的预期。这个量化版本在 8bit 下最多可加载 200k 上下文。不过我只用了 131k 上下文。

内存占用

如你所见,它占用了 11GB 显存和 56GB 内存(包括系统/操作系统程序)。

这个引擎是专门为某一个模型构建的,并且只有特定的 gguf(ISTA-DASLab)才能与之配合使用。你可以使用 ISTA-DASLab 的 IQ3_S,他们声称该量化在编码基准测试中能恢复完整模型的性能。我测试了 IQ3_XXS 一段时间,我会说它是一个出色的模型。

我从没想过 12GB 显存就足以在笔记本上本地运行 6 个月前的前沿模型。生在这个时代真好!

阅读更多

讨论精选

Atretador(40↑):有没有人验证过,对于相同的输入,它输出的 token 是否与 llama.cpp 完全相同、顺序也完全一致?在 Strata 作者的帖子里这个问题一直没人回答

truejeffrey(11↑):我相当确定 Strata 的速度来自贪婪解码(也就是总是选择概率最高的 token),因为我在尝试配置它时发现,以任何方式调整 temperature 都不会影响模型的输出。

imnotzuckerberg(5↑):我已经跟不上所有推理引擎了,尤其是最近。我们应该搞个 wiki 之类的东西来汇总。随着少数模型变得关键,改进主要集中在推理部分和针对特定硬件的优化上,这让很多事情都变得非常有前景!