返回 文章 apply CMS 文章

Together AI 推出专用容器推理:自定义 AI 模型推理速度提升 2.6 倍

Together AI 推出专用容器推理,为自定义非 LLM 模型提供生产级编排,实现 1.4x–2.6x 推理加速。

Together AI专用容器推理自定义模型推理加速
成长分 / 100 67 综合收获、行动、留存与影响

Together AI 推出专用容器推理:自定义 AI 模型推理速度提升 2.6 倍
为什么值得读了解如何为自定义生成式媒体模型(如视频生成、虚拟形象合成)获得生产级推理编排,无需自建基础设施。

发现 Together AI 如何通过平台架构和研究团队优化,实现显著推理加速,降低延迟和成本。

关键洞察
  1. 专用容器推理支持 Docker 容器部署,自动处理自动扩缩容、排队、流量隔离和监控。
  2. 在 Together GPU 云上训练的模型可直接部署,无需工件传输,实现训练到生产无缝衔接。
  3. 客户如 Creatify 和 Hedra 已实现 1.4 倍至 2.6 倍推理加速,得益于平台架构和手动优化。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:7712

摘要

专用容器推理让团队能够部署自定义生成式媒体模型——如视频生成、虚拟形象合成和图像处理——并配备生产级编排,无需自行构建。带上您的 Docker 容器;Together 负责处理自动扩缩容、排队、流量隔离和监控。对于已在 Together GPU 云上进行训练的团队,从训练到生产无需任何工件传输。像 Creatify 和 Hedra 这样的客户已实现 1.4 倍至 2.6 倍的推理加速,这得益于平台架构以及 Together 研究团队的亲手优化。

自 Together 成立以来,我们一直支持大规模 LLM 推理。我们深刻理解这一领域,并构建了针对无状态请求、基于令牌的延迟和高度优化的服务路径的产品。

专用容器推理是为不同类型的工作负载而构建的。

在过去一年中,我们与部署自定义非 LLM 模型到生产环境的团队密切合作。这些模型远不止文本输入、文本输出的 API:视频生成管道、虚拟形象合成、大规模图像处理以及具有实际业务约束的自定义音频/媒体模型。

这些团队持续需要的不仅仅是 GPU 或容器。他们需要一种在生产环境中运行自定义推理代码的方法,而无需构建自己的作业编排层。自动扩缩容、排队、流量隔离、重试和监控都很重要,但他们都不想内部重新实现这一整套堆栈。

专用容器推理是我们对这一差距的回应——为 AI 原生云上的自定义模型带来生产级编排。

您提供容器和推理逻辑。我们负责处理部署、自动扩缩容、排队和作业级别的监控,专为 GPU 密集型工作负载而构建。

有何不同?

大多数推理平台围绕单一抽象进行优化,要么是无状态端点,要么是大型批处理作业。当您同时拥有实时和批量流量、客户层级以及突发需求高峰时,这种方法就行不通了。

专用容器推理围绕您的容器进行作业编排,支持:

  • 多个独立队列,而非单个 FIFO 流
  • 基于策略的流量控制,而非按请求优先级
  • 批量、实时和不可信流量之间的隔离
  • 高峰期间可预测的行为,无需过度配置

然而,不同之处不仅在于推理时。Together 是一个端到端的训练到推理平台。在 Together GPU 云上训练的模型可以直接部署为专用容器,无需任何工件传输或额外工作。

对于构建自定义模型的团队来说,这种紧密循环减少了运营开销,并使从训练到生产的过渡更加容易,而不会引入新的故障模式。

架构概览

专用容器推理构建于基于容器的部署框架之上,其中作业和队列是一等概念。我们不是将推理强制为单一的请求-响应形式,而是将您的容器视为执行单元,并管理其周围的一切。

高层概述:

您将模型打包为 Docker 容器

容器包含运行时、依赖项和推理代码。您决定推理的运行方式以及使用的库。

我们在 GPU 基础设施上部署和管理该容器

Together 提供 GPU、启动副本、处理网络、健康检查和监控。您无需直接管理集群或节点。对于需要多个 GPU 的大型模型,我们通过 torchrun 提供内置的分布式推理支持。

模型权重的卷挂载

每次更新权重时重新构建 50GB 的容器既慢又昂贵。通过卷挂载,您只需上传一次权重,然后在部署时挂载即可。

推理以作业形式运行

请求被排队,并由从您的部署中拉取的工作进程执行。这支持长时间运行的作业、批处理工作负载和混合流量模式。

基于队列深度或所选指标的自动扩缩

根据利用率、队列长度、加权队列优先级以及视频长度或目标等待时间等作业特征,向上或向下扩展容量。

流量策略是明确的

您可以定义多个队列,并按客户层级、用例或 SLA 控制优先级。批处理工作负载不会干扰实时请求,付费用户在流量高峰期间受到保护。

可观测性内置其中

指标、日志和作业状态开箱即用,以便您监控状态。

提升生产工作负载的性能

对于生成式媒体工作负载,推理速度的微小改进会迅速累积为巨大的成本和延迟收益。

使用专用容器推理,团队受益于我们的研究流程,从自动内核优化到针对特定工作负载性能改进的实践分析和调优。

“基础设施成本可能会扼杀一家 AI 公司,尤其是在它们扩展时。Together 的专用容器推理为我们解决了两个关键问题:处理不可预测的病毒式流量而无需过度配置,以及将我们本已具有竞争力的模型性能提升到新水平。

他们的研究团队实现了显著的无损加速,直接改善了我们的单位经济效益——而无需牺牲质量。他们不仅提供 GPU,还与我们合作,使我们的推理在大规模下更高效。这种技术合作水平,加上生产级基础设施,让我们能够专注于构建产品,而不是管理集群。”

— Ledell Wu,Creatify 联合创始人兼首席研究科学家

条形图显示 Together 的专用容器推理在视频平台上比之前的提供商快 2.6 倍。

图 2:视频生成部署中的实时因子改进。较低的 RTF 意味着更快的生成——客户在迁移到 Together 的专用容器推理后看到了 1.4 倍到 2.6 倍的加速。

在生产部署中,我们观察到:

实时因子大幅降低

对于视频生成模型,从每秒输出数十秒降至低两位数有意义的加速

通过更好的批处理、调度和多 GPU 执行,在虚拟形象和视频合成模型上实现端到端改进

将以前不经济的模型转变为可行的生产服务

这些性能提升来自平台能力与手动优化工作的结合。其结果是更低的延迟、更低的每秒输出成本,以及在负载下更可预测的扩展行为。

“Together AI 的研究人员与我们合作,优化了我们模型的推理性能。这是一项手动工作,使我们的模型显著更快。”

他们的基础设施能够轻松应对病毒式传播的流量。在流量激增期间,专用容器推理能够无缝扩展,同时保持性能。

而且,由于我们在 Together 的加速计算上进行训练,部署到生产环境毫无障碍。一个平台,零工件传输,无部署烦恼。——Terrence Wang,Hedra 创始机器学习工程师

开始使用

如果您正在部署自定义模型并需要生产级编排,专用容器推理正是为此用例而设计。您完全控制您的容器和推理逻辑。我们负责管理部署、扩展、排队和监控。