讨论精选
totosse17 (0↑): 2块Spark(华硕Ascent)仅贵400美元,合计功耗200瓦,运行DeepSeek v4 Flash时单流可达60tps,c16下300tps。c1深度1M时仍有35tps。
TokenRingAI (0↑): 你完全错了。我同时拥有Strix Halo和RTX 6000。 Strix Halo在推理时功耗150W,空闲时约30W(UPS插座测量)。
RTX 6000 Max Q峰值300W,单用户推理时通常225W左右,空闲时22W。
此外,桌面系统本身也耗电。从墙插测量,GPU满载时总功耗约400W,单用户token生成时325W,空闲时约70W,具体取决于系统(我的系统有大量存储和硬盘,还用作CI运行器,因此无法...
TripleSecretSquirrel (0↑): 作为独立GPU用户,我认为这见解非常深刻。 我认为这里大多数人——包括我自己很多时候——都在不断尝试在本地机器上重现企业云API的性能体验,而速度比绝对质量更容易被关注。运营成本也隐藏在我的电费单中。
我认为更好的做法是调整工作流程和使用场景,以适应我们在硬件上的实际限制(我无法证明购买和运行多块RTX Pro 6000、A100等是合理的)。我非常喜欢我新的异步开发适配...