返回 讨论 学习 CMS 文章

NVIDIA 发布 Qwen3.6-27B-NVFP4 模型:22GB 显存占用引发社区讨论

NVIDIA 的 Qwen3.6-27B-NVFP4 模型以 22GB 大小亮相,社区热议其与 FP8 的收益差异及 NVFP4 精度含义。

NVIDIAQwen3.6-27BNVFP4模型量化
成长分 / 100 49 综合收获、行动、留存与影响

为什么值得读了解 NVIDIA 最新 NVFP4 精度模型的实际显存占用(22GB vs Unsloth 的 26GB)。

获取社区对 NVFP4 与 FP8 混合精度收益的真实反馈。

关键洞察
  1. NVIDIA 的 Qwen3.6-27B-NVFP4 模型大小为 22GB,相比 Unsloth 版本(26GB)更节省显存。
  2. 社区用户对 NVFP4 的收益预期(相比 FP8)感到低于预期。
  3. NVFP4 是 4 位精度,但模型大小并非简单为 Q8 的一半,实际为 22GB。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:966

讨论精选

JohnToFire (0↑): 这些大小挺有意思。Nvidia 是 22GB,对于 32GB 显存来说好得多。Unsloth 是 26GB。我知道它们都是混合精度,但相比 FP8 的收益比我预期的要小。

DeepOrangeSky (0↑): 我以前从未用过 FP_ / NVFP_ 模型(我只是个卑微的 GGUF 用户),所以不知道这些算不算正常。 一个 27B 模型的 NVFP4 版本 22GB 算正常吗?我原以为 NVFP4 的大小会是 Q8 的一半左右,因为它是 4 位。:(

另外,主权重精度等级中 "F8_E4M3" 里的 E4M3 是什么?

我想我可以安静地自己去谷歌查,但也许在这里问更好,因为如果得到回答,人们浏览论坛帖子时就能看到答案。

pulse77 (0↑): 我想知道它和以下模型相比如何: https://huggingface.co/unsloth/Qwen3.6-27B-NVFP4

希望有人能发布这个 Nvidia NVFP4 模型的 GGUF 版本...