讨论精选
JohnToFire (0↑): 这些大小挺有意思。Nvidia 是 22GB,对于 32GB 显存来说好得多。Unsloth 是 26GB。我知道它们都是混合精度,但相比 FP8 的收益比我预期的要小。
DeepOrangeSky (0↑): 我以前从未用过 FP_ / NVFP_ 模型(我只是个卑微的 GGUF 用户),所以不知道这些算不算正常。 一个 27B 模型的 NVFP4 版本 22GB 算正常吗?我原以为 NVFP4 的大小会是 Q8 的一半左右,因为它是 4 位。:(
另外,主权重精度等级中 "F8_E4M3" 里的 E4M3 是什么?
我想我可以安静地自己去谷歌查,但也许在这里问更好,因为如果得到回答,人们浏览论坛帖子时就能看到答案。
pulse77 (0↑): 我想知道它和以下模型相比如何: https://huggingface.co/unsloth/Qwen3.6-27B-NVFP4
希望有人能发布这个 Nvidia NVFP4 模型的 GGUF 版本...