不用说,这个 sub 非常小众,而且偏向高端。这里充斥着大量极其高端的配置,配备多块 GPU 等等。
即便是 24GB 对大多数人来说在经济上也是遥不可及的,更别提 3x3090 或 5090 乃至更高的配置了。Mac/Strix Halo/dgspark 等等同样昂贵。16GB 对大多数人来说基本上就是高端了。而在世界其他大部分地区,情况则完全不同,那里即便 12GB 也是一种奢侈。
最近情况发生了变化(我认为甚至过去 6 个月的变化都是巨大的),如今即便在 16GB 显卡上,智能体编程也变得可行了(例如使用 Qwen 27B 的量化版本)。
我认为/希望情况会继续改善。当然,这些较小的模型能拥有多少世界知识,必然会有一个硬性上限。
终极目标是超越 Transformer 的新架构,以及不依赖显存/带宽的新技术。
以及
阅读更多
讨论精选
robinei (278↑):数据中心市场目前正在吸收供应量的增长(这确实正在发生)。但如果供应最终没有超过需求,我会感到惊讶。我仍然抱有希望,若干年后我能在本地拥有比今天多得多的内存(以合理的价格)。那种生产持续增长、但 AI 数据中心持续吸收而永远不会饱和的情景,对我来说太“奇点”了,我不相信。
Nameis19letterslong (143↑):你知道什么让我恼火吗?运行 LLM 的最佳甜点区,恰恰就比当前的平均显存高那么一点点。没错,12 到 16GB 很棒(我从 1660S 6GB 换到了 5060ti 16GB),但所有那些极其强大的模型,即便采用适度的量化,也至少需要 16GB 的权重,没有留下任何空间给开销或上下文等等。例如,Qwen3.8 27b、Gemma4 26b a4b 和 31b、Muse glimmer 30b,甚至据我所知 minimax h3 约 22b。 如果显卡的显存能再多 30-50%,那么在本地运行模型的可及性将提高 10 倍。
Pristine_Pick823 (70↑):就目前而言。除非关税和技术限制被推到极限,否则未来几年市场很可能会被大量性能尚可的中国 GPU 所充斥。