我觉得大多数人都低估了这个推理引擎。我试过多个 llama.cpp 的分支,没有一个能接近 Strata 的推理速度。最初的版本在 kv cache、CPU 降频方面有一些 bug,开发者已经修复了。
推理引擎(目前仅支持 Nvidia;AMD 支持仍处于实验阶段):
https://github.com/Niko1221/Strata
以下是一些指标和截图。我的笔记本配备 5070ti 12GB 显存、64GB ddr5 内存、Intel 275HX CPU、gen4 SSD。
水族箱测试(unsloth studio 通过本地 API 连接)
我使用的模型是
https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF/tree/main/IQ3_XXS
就其体积而言质量很好。上面就是该模型生成的水族箱测试。在 43k 上下文深度下,它以 51 t/s 运行。相同量化下,原版 llama.cpp 只能达到 23t/s。
32k 上下文读取速度达到 1500t/s(unsloth studio 通过本地 API)
相同量化下,这个量化版本在原版 llama.cpp 中 PP 只能达到 100t/s。而 Strata 以 1500t/s 读取 32k 上下文文本。这远超我的预期。这个量化版本在 8bit 下最多可加载 200k 上下文。不过我只用了 131k 上下文。
内存占用
如你所见,它占用了 11GB 显存和 56GB 内存(包括系统/操作系统程序)。
这个引擎是专门为某一个模型构建的,并且只有特定的 gguf(ISTA-DASLab)才能与之配合使用。你可以使用 ISTA-DASLab 的 IQ3_S,他们声称该量化在编码基准测试中能恢复完整模型的性能。我测试了 IQ3_XXS 一段时间,我会说它是一个出色的模型。
我从没想过 12GB 显存就足以在笔记本上本地运行 6 个月前的前沿模型。生在这个时代真好!
阅读更多
讨论精选
Atretador(40↑):有没有人验证过,对于相同的输入,它输出的 token 是否与 llama.cpp 完全相同、顺序也完全一致?在 Strata 作者的帖子里这个问题一直没人回答
truejeffrey(11↑):我相当确定 Strata 的速度来自贪婪解码(也就是总是选择概率最高的 token),因为我在尝试配置它时发现,以任何方式调整 temperature 都不会影响模型的输出。
imnotzuckerberg(5↑):我已经跟不上所有推理引擎了,尤其是最近。我们应该搞个 wiki 之类的东西来汇总。随着少数模型变得关键,改进主要集中在推理部分和针对特定硬件的优化上,这让很多事情都变得非常有前景!