团队如何在不产生巨大成本的情况下降低推理延迟?
实现更快的推理并不总是意味着为更大的集群支付更多费用。在 Together AI,我们看到那些始终能够兼顾低延迟和低成本的团队共享以下关键习惯:
- 他们最大化从每个 GPU 中提取的有效工作量
- 他们主动消除不可见的计算停顿
- 他们根据特定的流量模式策略性地选择解码技术
- 他们将性能调优视为一项持续的工作,而非一次性的配置任务
在这些方面表现出色,你的集群可以提供更快的响应,同时降低每 token 的成本。
为什么推理成本效率很重要
AI 产品每周都在变得更加竞争激烈——而用户期望也在同样快速地上升。
对于领先的 AI 原生公司——比如 Cursor,它需要在不牺牲速度的情况下实现大规模吞吐量,以及 Decagon,它需要在不可预测的流量模式下实现实时响应——压力无处不在:
要快。TTFT 低于 500ms 且解码速度快
要可预测。没有意外的尾部延迟
要负担得起。GPU 账单不能随流量线性增长
为峰值做好准备。因为流量永远不会像你预期的那样
在客户中,我们始终看到同样的要求:在不使 GPU 账单翻倍的情况下,实现亚秒级响应。好消息是?你不需要奇特的架构或数百个额外的 GPU 来维持推理成本效率。
大多数团队通过优化推理的运行方式,而不是纯粹购买多少硬件,就能获得显著的收益。
推理优化如何工作
以下是可以可靠地同时改善速度和成本的杠杆。
1. 从模型层面开始:量化和蒸馏
量化
降低精度(FP16 → FP8 → FP4)使模型在内存上更轻量,运行更快——如果做得好,几乎不会损失质量,就像我们在 Together 这里所做的那样。
这带来了:
- 明显更快的 tokens/秒
- 在相同 GPU 占用下更大的批处理大小
- 更低的每 token 成本
- 实时工作负载的更平滑扩展
我们在许多生产部署中看到,FP8 或 FP4 量化可带来 20–40% 的吞吐量提升,而不会损害输出质量。
蒸馏
并非每个工作负载都需要前沿模型的全部能力。蒸馏训练一个较小的模型来模仿较大的模型,保留推理模式,同时大幅降低计算成本。
DeepSeek-R1 是一个很好的例子。它的蒸馏变体快速、轻量,并且在推理方面仍然表现出色——使其非常适合:
- 交互式聊天
- 编码助手
- 路由和分类
- 高容量企业工作负载
- 边缘推理或严格延迟预算下的推理
你可以在这篇文章中看到团队如何在 Together AI 上安全地部署 R1 及其蒸馏变体:点击这里。
蒸馏的 R1 变体提供了极具吸引力的质量与延迟比,适用于生产工作负载——通常在许多任务中,在相似质量水平下可实现 2–5 倍的成本降低。
量化与蒸馏相结合,可以在不触及硬件或集群架构的情况下,实现最大的成本削减之一。
2. 减少边缘网络延迟(区域推理代理)
有时最大的延迟优势不在于计算,而在于地理位置。即使模型速度极快,网络距离也往往是请求路径中最慢的部分。
在推理集群所在的同一区域部署轻量级代理,可以在生成开始前消除长距离往返路径。
仅此一项即可将 TTFT 减少 50–100 毫秒,并使尾部延迟更加可预测。
3. 减少不必要的计算(内存停顿、KV 效率低下、碎片化)
大多数模型并不慢——慢的是它们周围的管道。因此,你的 GPU 花费大量时间无所事事,只是……等待。最大的罪魁祸首通常是:
- 内核协同效率低下,迫使 GPU 在预填充、注意力和解码之间暂停
- MoE 层花费更多时间等待内存而非执行有用工作,尤其是在专家路由不平衡时
- 预填充路径难以处理长提示,导致启动缓慢和性能不均
- 批处理或调度间隙,导致 GPU 部分空闲,而仍有工作可做
在 Together AI,我们针对 Llama、Qwen、Mistral 和 DeepSeek 系列模型进行了基准测试(详见我们的 最快开源模型推理 博客),结果表明,内核融合、更智能的 MoE 执行、流式令牌化和更好的调度可以消除浪费的时间,从而解锁更快的响应
和更高的吞吐量。
4. 使用正确的解码优化(MTP、推测解码、草稿模型)
解码是大量时间流失的地方——也是一些最容易取得成效的地方。
- MTP: 一次预测多个令牌,提高解码速度和 GPU 效率
- 推测解码: 使用小型“草稿”模型加速可预测工作负载的生成
- 定制化推测解码
当调整得当时,这些技术通常能实现 20–50% 更快的解码 和显著更高的每 GPU 吞吐量。
5. 为你的工作负载选择正确的硬件(并使用正确的并行策略)
随着大约每年推出一种新硬件类型,硬件选择日益影响成本和延迟。
- Blackwell GPU 在每令牌吞吐量和注意力内核速度方面提供了重大改进。
- NVIDIA Grace Blackwell (GB200) 系统 紧密耦合 CPU + GPU 内存,减少数据移动开销,并提高大批量大小和长上下文下的吞吐量。
但要充分利用这些硬件,大型模型需要智能地跨设备拆分和调度。这就是并行策略发挥作用的地方:
张量并行将单个层拆分到多个 GPU 上,使超大规模模型能够高效运行而不会受限于内存。专家并行将 MoE 模型中的不同专家分布到多个 GPU 上,每个 GPU 专注于一部分专家,而非处理所有任务。
每天处理数十亿 token 的团队通常会发现,在采用合适的并行策略将繁重工作负载迁移到 NVIDIA Blackwell 级硬件后,每 token 成本显著下降。
6. 跨端点动态调整 GPU 容量
流量很少均匀分布到所有服务。例如:
特性:基于实时并发和需求在端点之间动态扩缩容工作原理:GPU 自动重新分配给最繁忙的端点,而空闲端点释放容量。结果:更高的总体利用率、更少的空闲 GPU,以及无需过度配置即可应对流量峰值的能力。
这对于混合工作负载(编码、聊天、RAG、批处理和长文本生成)的客户尤其有价值。Together AI 允许客户通过简单的 API 调用更新其端点的容量。
更好的推理优化能带来什么
实施这些优化的团队可以获得:
- 更低的 TTFT 和更快的解码
- 更高的 GPU 利用率和更少的空闲周期
- 降低每 token 成本
- 改善的可预测性和尾延迟
- 交互式和实时产品中更好的用户体验
开始使用
以下是一种实用且低门槛的入门方式:
- 测量基线(TTFT、解码 TPS、TPM/GPU、网络 RTT)
- 如果请求来自推理集群较远的位置,部署区域代理
- 启用自适应连续批处理并监控 GPU 利用率
- 根据工作负载启用 MTP 或推测解码
- 根据流量变化动态调整 GPU 容量以重新平衡端点
常见问题
吞吐量优化会增加延迟吗?
不会。连续批处理 + 融合内核可以在降低延迟的同时提高吞吐量。
NVIDIA Blackwell 仅适用于超大规模工作负载吗?
不是。任何具有有意义并发或长上下文的负载都能从其带宽和内存改进中受益。
如何判断我的 GPU 是否未充分利用?
查看解码 TPS 是否较低、活跃批次大小是否较小,或 token 生成间隔是否较长。
