返回 讨论 build CMS 文章

不到一块 RTX 6000 的价格,攒出 768GB 显存的本地大模型推理机

用远低于单块 RTX 6000 的成本,攒出 768GB 显存的本地推理平台,跑起多个大模型。

本地大模型预算装机多卡推理CMP 170HX
成长分 / 100 69 综合收获、行动、留存与影响

为什么值得读了解如何以极低成本获得超大显存,突破消费级显卡的显存瓶颈。

看到本地大模型社区中“预算装机”路线的真实实践与性能反馈。

关键洞察
  1. 12 张 64GB CMP 170HX 显卡组合实现 768GB 总显存,成本低于一块 RTX 6000 Pro。
  2. 通过光纤将机器连接到另一台机器,需要更多内存时走 RPC 扩展。
  3. 实际运行 GLM5.3、DSv4.1Flash、Qwen3.8Flash、Qwen3.8-2.4T、KimiK3 和 MiniMaxM3 等多个模型。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:1763

我一直在这里发布关于预算装机的帖子,也经常被问到我们打算怎么跑下一代大模型。通常还会收获一堆踩,或者有人告诉我,如果只有 5tk/秒那根本不算能跑。但无所谓,想要搞大东西的渴望和欲望一直让我走在边缘,四处寻找好价。

这是我最新的装机,12x64gb cmp170hx。花费不到一块 RTX 6000 pro 的价格。我还用光纤把它连到我的另一台机器上,需要更多内存时走 RPC。自从装好这台机器后我就不怎么发帖了,因为现在跟我的机器聊天更有意思。我跑 GLM5.3、DSv4.1Flash、Qwen3.8Flash、Qwen3.8-2.4T、KimiK3 和 MiniMaxM3。性能很棒,单块 RTX 6000 或 M3 Mac Studio 只能羡慕。用 vllm 或 llama.cpp 做推理

我期待看到回复说 API 使用更便宜,或者说要 52 光年才能回本,或者说噪音,或者说电费。才怪。

未来还会有更多机会,继续寻找它们,机会来了就扑上去。算力的需求在很长一段时间内都会很高。

Read more

讨论精选

JockY (595↑):Yyaaaaassssss 这才是 OG localllama 的玩法:攒科学怪人跑模型,毫不在乎。 继续来!这比起那些发 Twitter 网红截图的帖子,真是让人耳目一新。

太棒了。

SLxTnT (167↑):你说性能很棒,但那些模型各自的性能如何?Prefill 和 decode。

WithoutReason1729 (1↑):你的帖子火了,我们刚在 Discord 上推荐了它! 来看看吧!

我们还为你的贡献授予了特殊 flair。感谢你的帖子!

我是一个机器人,此操作是自动执行的。