摘要
专用容器推理让团队能够部署自定义生成式媒体模型——如视频生成、虚拟形象合成和图像处理——并配备生产级编排,无需自行构建。带上您的 Docker 容器;Together 负责处理自动扩缩容、排队、流量隔离和监控。对于已在 Together GPU 云上进行训练的团队,从训练到生产无需任何工件传输。像 Creatify 和 Hedra 这样的客户已实现 1.4 倍至 2.6 倍的推理加速,这得益于平台架构以及 Together 研究团队的亲手优化。
自 Together 成立以来,我们一直支持大规模 LLM 推理。我们深刻理解这一领域,并构建了针对无状态请求、基于令牌的延迟和高度优化的服务路径的产品。
专用容器推理是为不同类型的工作负载而构建的。
在过去一年中,我们与部署自定义非 LLM 模型到生产环境的团队密切合作。这些模型远不止文本输入、文本输出的 API:视频生成管道、虚拟形象合成、大规模图像处理以及具有实际业务约束的自定义音频/媒体模型。
这些团队持续需要的不仅仅是 GPU 或容器。他们需要一种在生产环境中运行自定义推理代码的方法,而无需构建自己的作业编排层。自动扩缩容、排队、流量隔离、重试和监控都很重要,但他们都不想内部重新实现这一整套堆栈。
专用容器推理是我们对这一差距的回应——为 AI 原生云上的自定义模型带来生产级编排。
您提供容器和推理逻辑。我们负责处理部署、自动扩缩容、排队和作业级别的监控,专为 GPU 密集型工作负载而构建。
有何不同?
大多数推理平台围绕单一抽象进行优化,要么是无状态端点,要么是大型批处理作业。当您同时拥有实时和批量流量、客户层级以及突发需求高峰时,这种方法就行不通了。
专用容器推理围绕您的容器进行作业编排,支持:
- 多个独立队列,而非单个 FIFO 流
- 基于策略的流量控制,而非按请求优先级
- 批量、实时和不可信流量之间的隔离
- 高峰期间可预测的行为,无需过度配置
然而,不同之处不仅在于推理时。Together 是一个端到端的训练到推理平台。在 Together GPU 云上训练的模型可以直接部署为专用容器,无需任何工件传输或额外工作。
对于构建自定义模型的团队来说,这种紧密循环减少了运营开销,并使从训练到生产的过渡更加容易,而不会引入新的故障模式。
架构概览
专用容器推理构建于基于容器的部署框架之上,其中作业和队列是一等概念。我们不是将推理强制为单一的请求-响应形式,而是将您的容器视为执行单元,并管理其周围的一切。

高层概述:
您将模型打包为 Docker 容器
容器包含运行时、依赖项和推理代码。您决定推理的运行方式以及使用的库。
我们在 GPU 基础设施上部署和管理该容器
Together 提供 GPU、启动副本、处理网络、健康检查和监控。您无需直接管理集群或节点。对于需要多个 GPU 的大型模型,我们通过 torchrun 提供内置的分布式推理支持。
模型权重的卷挂载
每次更新权重时重新构建 50GB 的容器既慢又昂贵。通过卷挂载,您只需上传一次权重,然后在部署时挂载即可。
推理以作业形式运行
请求被排队,并由从您的部署中拉取的工作进程执行。这支持长时间运行的作业、批处理工作负载和混合流量模式。
基于队列深度或所选指标的自动扩缩
根据利用率、队列长度、加权队列优先级以及视频长度或目标等待时间等作业特征,向上或向下扩展容量。
流量策略是明确的
您可以定义多个队列,并按客户层级、用例或 SLA 控制优先级。批处理工作负载不会干扰实时请求,付费用户在流量高峰期间受到保护。
可观测性内置其中
指标、日志和作业状态开箱即用,以便您监控状态。
提升生产工作负载的性能
对于生成式媒体工作负载,推理速度的微小改进会迅速累积为巨大的成本和延迟收益。
使用专用容器推理,团队受益于我们的研究流程,从自动内核优化到针对特定工作负载性能改进的实践分析和调优。
“基础设施成本可能会扼杀一家 AI 公司,尤其是在它们扩展时。Together 的专用容器推理为我们解决了两个关键问题:处理不可预测的病毒式流量而无需过度配置,以及将我们本已具有竞争力的模型性能提升到新水平。
他们的研究团队实现了显著的无损加速,直接改善了我们的单位经济效益——而无需牺牲质量。他们不仅提供 GPU,还与我们合作,使我们的推理在大规模下更高效。这种技术合作水平,加上生产级基础设施,让我们能够专注于构建产品,而不是管理集群。”
— Ledell Wu,Creatify 联合创始人兼首席研究科学家

图 2:视频生成部署中的实时因子改进。较低的 RTF 意味着更快的生成——客户在迁移到 Together 的专用容器推理后看到了 1.4 倍到 2.6 倍的加速。
在生产部署中,我们观察到:
实时因子大幅降低
对于视频生成模型,从每秒输出数十秒降至低两位数有意义的加速
通过更好的批处理、调度和多 GPU 执行,在虚拟形象和视频合成模型上实现端到端改进
将以前不经济的模型转变为可行的生产服务
这些性能提升来自平台能力与手动优化工作的结合。其结果是更低的延迟、更低的每秒输出成本,以及在负载下更可预测的扩展行为。
“Together AI 的研究人员与我们合作,优化了我们模型的推理性能。这是一项手动工作,使我们的模型显著更快。”
他们的基础设施能够轻松应对病毒式传播的流量。在流量激增期间,专用容器推理能够无缝扩展,同时保持性能。
而且,由于我们在 Together 的加速计算上进行训练,部署到生产环境毫无障碍。一个平台,零工件传输,无部署烦恼。——Terrence Wang,Hedra 创始机器学习工程师
开始使用
如果您正在部署自定义模型并需要生产级编排,专用容器推理正是为此用例而设计。您完全控制您的容器和推理逻辑。我们负责管理部署、扩展、排队和监控。
