我一直在这里发布关于预算装机的帖子,也经常被问到我们打算怎么跑下一代大模型。通常还会收获一堆踩,或者有人告诉我,如果只有 5tk/秒那根本不算能跑。但无所谓,想要搞大东西的渴望和欲望一直让我走在边缘,四处寻找好价。
这是我最新的装机,12x64gb cmp170hx。花费不到一块 RTX 6000 pro 的价格。我还用光纤把它连到我的另一台机器上,需要更多内存时走 RPC。自从装好这台机器后我就不怎么发帖了,因为现在跟我的机器聊天更有意思。我跑 GLM5.3、DSv4.1Flash、Qwen3.8Flash、Qwen3.8-2.4T、KimiK3 和 MiniMaxM3。性能很棒,单块 RTX 6000 或 M3 Mac Studio 只能羡慕。用 vllm 或 llama.cpp 做推理
我期待看到回复说 API 使用更便宜,或者说要 52 光年才能回本,或者说噪音,或者说电费。才怪。
未来还会有更多机会,继续寻找它们,机会来了就扑上去。算力的需求在很长一段时间内都会很高。
Read more
讨论精选
JockY (595↑):Yyaaaaassssss 这才是 OG localllama 的玩法:攒科学怪人跑模型,毫不在乎。 继续来!这比起那些发 Twitter 网红截图的帖子,真是让人耳目一新。
太棒了。
SLxTnT (167↑):你说性能很棒,但那些模型各自的性能如何?Prefill 和 decode。
WithoutReason1729 (1↑):你的帖子火了,我们刚在 Discord 上推荐了它! 来看看吧!
我们还为你的贡献授予了特殊 flair。感谢你的帖子!
我是一个机器人,此操作是自动执行的。