AI多年来一直因训练——即构建模型所需的大规模、GPU密集型过程——而备受关注。但对于如今部署AI的大多数团队而言,持续进行的推理成本才是真正影响其单位经济学的因素。据估计,推理占生产AI系统总生命周期成本的80-90%,原因很简单:它在每个用户查询、智能体步骤和API调用中持续运行。而训练是一项有限的投资,推理却随着你推出的每个新用户和用例而扩展。
在NVIDIA GTC 2026上,NVIDIA CEO黄仁勋直截了当地阐述了这一转变:“人们为信息付费,但人们主要为工作付费。智能体系统能完成工作。”从AI作为新奇事物到AI作为主力工具的转变,正是重塑基础设施优先级的核心。
对于Together AI而言,这一切并不新鲜。推理的紧迫性正是我们一直以来的建设目标。我们的CTO Ce Zhang在GTC上深入探讨了这些动态,分享了从运行行业中最苛刻的生产推理工作负载中获得的宝贵经验。
为什么推理是另一种难题
推理不仅仅是“运行模型”。在生产环境中,它是一个同时涉及多个相互竞争维度的优化问题:
延迟决定了能构建什么。对于编码助手、实时支持或对话式智能体等应用,低于500毫秒的响应时间并非锦上添花——它们决定了产品给人的感觉是软件还是等待。智能体工作流放大了这一点:五次模型调用,每次200毫秒,在用户看到结果之前就累积了整整一秒的延迟。阈值至关重要,达不到阈值会产生产品后果。吞吐量决定了你的单位经济学。AI原生公司面临与传统SaaS截然不同的成本结构。传统软件公司追求80-90%的毛利率,而AI公司通常运营在50-60%,仅推理一项就约占规模化阶段公司收入的23%。高效的推理意味着每GPU小时可服务更多请求。这一计算直接影响到利润率。模型格局不断变化。为今天模型优化的推理栈可能明天就需要重大改造。新的架构、量化方法和硬件层出不穷;要保持在最前沿,需要对整个栈进行持续投资,而不仅仅是一次性优化。并发性毫不留情。服务数千名同时用户意味着要同时应对截然不同的上下文长度、延迟要求和成本概况——且不能降级。这既是调度和编排的挑战,也是计算的挑战。
这也是为什么风险比大多数团队最初预期的要高。
Together如何应对推理
Together的推理方法并非单一优化。它是一个由研究、系统工程和硬件专业知识组成的复合栈,旨在随着前沿的发展而持续改进:
投入生产的研发。Together Research 团队贡献了推理效率方面一些最广泛采用的进展:FlashAttention(现已升级至 FlashAttention-4)、ThunderKittens 和 Aurora,我们的开源自适应推测解码系统,可将 LLM 推理速度提升高达 1.25 倍。这些研究通常在发表后数周内投入客户生产环境。
自适应推测解码。标准推测解码使用较小的草稿模型提出令牌,由较大模型并行验证,在代码补全或结构化输出等可预测工作负载上可实现 1.5-3 倍的加速。我们的 ATLAS 和 Aurora 系统更进一步:Aurora 是一个基于强化学习的开源框架,能够实时从实时推理轨迹中学习,并根据流量模式变化进行调整。即使与训练有素的静态推测器相比,它也能实现显著的加速,且不会中断服务。
全栈硬件优化。在最新的 NVIDIA Blackwell 硬件(GB200 NVL72、HGX B200)上运行意味着需要构建跨 72 GPU 网格的自定义并行策略,实现 NVFP4 量化,并构建从权重到生产的流水线,使模型发布在数天内上线。当 Cursor 需要为数百万活跃开发者提供生产级延迟时,Together AI 构建了全栈基础设施来满足需求,在不可预测的高并发流量下处理严格的延迟 SLA。
智能调度与批处理。高吞吐量推理需要做出智能实时决策:哪些请求应一起批处理,如何根据上下文长度和延迟要求进行路由,以及何时在吞吐量与响应性之间权衡。Together 的推理引擎动态处理这一切,在每 GPU 小时中提取最大效率,同时不牺牲 AI 原生应用和产品所依赖的体验。
正确实现的经济效益
斯坦福 2025 AI 指数 记录了一个显著趋势:GPT-3.5 级别性能的推理成本在 2022 年底至 2024 年底期间下降了超过 280 倍。但总推理支出却在上升;随着成本下降,团队将 AI 部署到更多用例、用户和智能体步骤中。更低的每令牌成本并未减少基础设施挑战,反而扩大了其覆盖范围。随着行业将更低的令牌成本视为 AI 基础设施 TCO 的真实指标,Together AI 优化全硬件和软件栈的方法持续为客户带来更好的盈利能力。
对于 AI 原生公司而言,这使得推理优化成为一种复利优势。以 2 倍更高的效率 运行推理,您可以在相同硬件上服务更多客户,同时开启以前不可行的用例。每一次效率提升不仅直接转化为利润,还决定了您长期能够构建什么。
这就是 Together AI 引以为豪之处:一个不仅提供快速推理的平台,更是赋能 AI 原生团队成长的基础设施层,使他们的成本增长不会快于收入增长。
在 AI 原生云上运行生产级推理
Together AI 是 AI 原生云,提供涵盖无服务器与专用推理、加速计算和模型塑造的全栈 AI 平台——让您在不牺牲用户期望的速度和生产级可靠性的前提下,从每个 GPU 小时中获得更多价值。
推理并非边缘问题。对于当今构建 AI 原生应用的团队而言,它将决定利润率、产品路线图以及竞争能力。好消息是:在 AI 原生云上应对这一挑战的工具从未如此强大。
准备好用 Together AI 构建下一个项目了吗?立即开始。
想深入了解?我们的最佳实践指南详细介绍了推测解码、优化内核、量化和硬件加速。
常见问题
什么是大规模 AI 推理?
AI 推理是运行训练好的模型以生成响应的过程——每次用户发送消息、触发代理或进行 API 调用时都会发生。在大规模场景下,这意味着要服务成千上万个并发请求,每个请求都有不同的上下文长度、延迟要求和成本特征。基础设施的挑战不仅仅是计算——而是高效、持续地协调所有这些,同时不降低任何单个用户的速度或可靠性。
为什么 AI 推理比训练更昂贵?
训练是一项密集但有限的投资——它只发生一次(或定期在模型更新时)。相比之下,推理是持续运行的:每次用户交互、每个代理步骤、每次 API 调用都会产生成本。行业估计推理占生产 AI 系统总生命周期成本的 80-90%。随着使用量的增长,成本也随之增加。对于 AI 原生公司来说,推理实际上是销售成本——它与收入直接成正比。
什么是推测解码?
推测解码是一种推理加速技术,其中一个小型、快速的“草稿”模型一次提出多个 token,然后由较大的目标模型并行验证。匹配的 token 被接受;其余的则被丢弃并重新生成。当草稿模型与目标模型对齐良好时,这种方法可以在不改变输出的情况下实现 1.5-3 倍的加速。它对于可预测的工作负载(如代码补全或结构化数据生成)特别有效。Together AI 的 ATLAS 系统通过自适应推测解码进一步扩展了这一点,该系统从实时流量中学习和调整。
什么是自适应推测解码?
标准推测解码依赖于静态草稿模型——一个离线训练并在部署时固定的模型。问题是现实世界的流量模式不断变化,静态草稿模型的准确性会随着领域的变化而下降。自适应推测解码通过持续从实时推理轨迹中学习,在不中断服务的情况下更新草稿模型来解决这个问题。Together AI 的 Aurora 框架是一个基于强化学习的开源实现,即使从零开始,也能比训练良好的静态推测器实现显著的加速。
在 AI 背景下,“推理研究”意味着什么?
推理研究是一个专注于让AI模型在生产环境中运行更快、更便宜、更高效的领域——同时不牺牲输出质量。它涵盖算法层面的工作(如推测解码和注意力优化)、系统层面的工作(如内核工程和请求调度)以及硬件层面的工作(如量化和GPU利用率)。这与模型研究不同,后者侧重于改进模型的知识或能力。随着推理成本成为AI部署中的主要支出,推理研究已成为应用AI中杠杆率最高的领域之一。
推理优化如何影响AI产品的经济性?
推理优化直接改善单位经济性:更快的推理意味着每个GPU小时可服务的请求更多,从而降低每个请求的成本。在规模化情况下,即使是适度的效率提升也会显著叠加——吞吐量提升2倍实际上可使相同工作负载的基础设施成本减半。这对产品团队很重要,因为它决定了哪些用例在经济上可行,利润率随规模增长而改善的速度,以及产品在市场成熟时能否维持有竞争力的定价。
