返回 文章 apply CMS 文章

Together AI 推出生产级开放权重推理平台,实现性能、成本与质量的全面控制

Together AI 推出全新推理平台,让企业无需自建基础设施即可完全控制开放权重模型的性能、成本和质量。

AI推理开放权重模型模型部署金丝雀发布
成长分 / 100 77 综合收获、行动、留存与影响

Together AI 推出生产级开放权重推理平台,实现性能、成本与质量的全面控制
为什么值得读了解如何在不牺牲控制权的前提下,简化开放权重模型的生产部署流程。

掌握金丝雀发布、蓝绿部署、A/B测试等高级部署策略在AI推理中的实际应用。

关键洞察
  1. 开放权重模型在质量上已与封闭模型相当,但成本更低且可完全自定义。
  2. Together 平台整合了模型缓存、自动扩缩、多部署管理等能力,使冷启动速度提升约4倍。
  3. 用户可通过金丝雀、蓝绿或滚动更新安全地推出新模型版本,并自动回滚。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:10736

摘要

我们正在对我们的推理平台进行重大更新,让您无需构建自己的技术栈即可完全控制性能、成本和质量。模型可在几分钟内上线,并且每次部署从一开始就达到生产级标准:在一个稳定的端点后运行多个部署,通过金丝雀发布、蓝绿部署和滚动更新安全地交付变更,并在达到您的阈值时自动回滚,通过A/B测试和影子测试在真实流量上进行测试,并在一个或多个区域进行自动扩展。

我们还宣布了自定义训练的封闭测试版,包括全权重和LoRA强化学习以及监督微调,您可以将检查点直接部署到生产环境。请求访问自定义训练测试版。

开放权重模型现在在质量上与封闭模型相当,运行成本仅为后者的一小部分,并且可以针对您的任务进行完全自定义。这种组合使其成为构建严肃AI产品和代理的团队的基础。但采用开放权重模型的战略动机仍然是能够行使控制权。与封闭替代方案不同,开放权重模型让团队能够控制性能、质量和功能。许多商业AI应用已采用多数开放权重端点策略,以便完全控制其用户体验。许多企业利用这种控制权将宝贵的专有IP融入模型,而无需冒暴露给第三方的风险。

虽然开放权重模型的用户希望最大限度地控制性能、功能和质量,但很少有团队愿意每周测试他们正确对齐量化级别、并行方案、引擎参数和草稿模型架构等决策矩阵的能力。与此同时,实现最佳质量和性能的前沿技术也在快速发展。在快速发展的AI领域,没有人有时间或意愿停下来阅读关于推理内部的大量琐事或堆积如山的研究论文——即使是运行世界上最成功的模型和代理的团队也不例外。

Together Dedicated Model Inference 应用了我们从每月服务超过400万亿token中积累的经验,提供了一个推理平台,该平台:

  • 让用户完全控制其模型、性能、成本、质量和功能
  • 避免因从头构建每个推理栈和端点管理层而浪费时间、浪费资金和意外停机
  • 持续整合最新经过验证的研究,以实现前沿的性能、质量和效率

此次更新汇集了我们研究、模型优化和平台工程团队的进展,整合为一项服务,旨在让企业更轻松、更可靠、更优化地在生产环境中运行开放权重、许可封闭权重和微调模型。

要实现控制与简单性的结合,需要将推理视为不仅仅是模型在API背后的托管。您运行的精度、部署的硬件、使用的服务配置以及扩展和路由流量的方式,都会对性能、可靠性和成本产生重大影响。

我们构建这个平台,是为了让从实验到生产的过程中无需更换平台或重新构建部署。生产就绪 从一开始就融入基础,即使你仍在测试和迭代。这意味着你可以安全地推出新版本,针对真实流量测试变更,对生产请求进行影子测试,跨部署路由流量,根据需求扩展规模,并在出现意外时回滚。

Decagon 的 Max Lu 这样描述这一转变:

Together 已经让我们的延迟达到了语音场景的要求。他们新的推理平台改变的是我们交付下一个模型版本的方式:我们可以将新的微调模型以少量实时流量进行金丝雀测试,并在关键指标下降时自动回滚。我们将从“快速推理”转变为“可以每周安全迭代的快速推理”。

这最终是我们想要实现的目标:不仅是快速、高效的推理,更是能够在不引入不必要风险的情况下持续改进你所服务的模型。你可以从 Together 已经优化的路径开始,随着工作负载变得更加专业化,再逐步获得更多控制权。这一原则贯穿整个平台——从你引入和配置模型的方式,到如何扩展、测试变更、观察性能以及将新版本投入生产。

引入你想要服务的模型

从 Together 的模型平台部署模型,或引入你自己的开放权重或微调模型。你可以从 Hugging Face、S3 或本地机器上传完整的模型权重或适配器。

该平台旨在支持模型的完整生命周期,从早期的微调版本到最终服务于生产流量的版本。

选择模型的运行方式

模型本身只是部署的一部分。硬件类型、量化、张量并行、推测解码和服务引擎都会影响工作负载的性能和成本。

你不必成为每个选择的专家就能获得出色的结果。Together 的部署配置文件封装了我们的研究和工程团队已经测试和优化的配置,因此你可以从经过验证的设置开始,而不是从头组装。当你需要更多控制时,这些选择仍然可用。你可以从不同的硬件和优化配置文件中进行选择,并随着时间的推移决定是主要优化延迟、吞吐量还是两者之间的平衡。

减少等待模型启动的时间

模型越大,启动时间就越受限于将数百 GB 的权重加载到位。我们重建了模型缓存和分发层,使得这些权重可以在整个集群中共享,并在部署需要之前主动预热。在内部测试中,这使多个前沿模型的冷启动速度提高了约 4 倍。

控制部署的扩展位置和方式

通过将模型固定到特定区域或保持位置灵活,选择模型的运行位置。你还可以定义部署如何响应流量变化。

不同的工作负载对需求有不同的信号,因此自动扩缩不应局限于单一的通用指标。平台从合理的默认值开始,同时允许你根据飞行中的请求、GPU 利用率、首令牌时间、延迟、解码速度或吞吐量进行扩缩,当你的工作负载需要更具体的指标时。

在部署演进过程中保持端点稳定

推理端点不再必须映射到单个静态部署。你可以在同一端点后创建多个部署,每个部署具有不同的模型权重、硬件或服务配置。

这让你可以更改 API 后端运行的内容,而无需强制应用程序更改调用模型的方式。端点保持稳定,而其后端的部署不断演进——这使得在不重新设计应用层的情况下,更容易测试、推出和替换模型或配置。

安全地将变更投入生产

使用金丝雀、蓝绿或滚动更新来逐步引入新的模型版本和配置。

平台处理流量迁移和部署生命周期,同时让你控制变更的推进速度以及何时停止或回滚。你获得所需的生产控制权,而无需自行构建推出机制。

在不使用户面临风险的情况下测试真实流量

使用 A/B 测试将一定比例的流量路由到不同部署,并直接比较它们的行为。使用影子流量将生产请求镜像到新部署,而不影响返回给用户的响应。

这使得可以使用实际重要的流量来评估新的权重、配置和硬件,而不仅仅依赖离线基准测试或合成测试。

测量正在发生的事情

新平台为你提供了一个组织级别的、可抓取的 Prometheus 端点,你可以将其连接到选择的可观测性工具,以构建仪表板、设置警报、监控推出健康状态、比较 A/B 测试变体,以及测量影子流量与生产流量的对比。

我们还刷新了产品内分析体验,使部署健康、流量、性能和扩缩行为在 Together 中更易于直接理解。

加入我们的强化学习测试版

除了推理平台,我们还推出了自定义训练的封闭测试版,包括全权重和 LoRA 强化学习以及高级监督微调。你可以通过 Python SDK 和细粒度原语配置训练,并在专用容量上同时运行多个 LoRA 实验。自定义训练将实验直接连接到生产。当检查点准备好进行评估时,你可以将其原生部署到推理部署中,无需在训练和服务之间进行单独交接,也无需重建设置即可从训练后实验转移到同一平台上的生产评估。封闭测试期间访问受限。

请求访问 以开始。

下一步

此更新只是开始。它是平台的基础,在该平台上,模型可以训练、优化、部署、测量和持续改进,而无需为生命周期的每个部分拼凑不同的系统。

开放权重模型让企业对质量、性能和成本拥有极大的控制力。我们的职责是让这种控制变得易于使用,而无需将推理变成一项DIY基础设施项目。这意味着提供有效的默认设置、我们已经优化过的配置,以及在需要时提供更深层次的控制。

在接下来的几周里,我们将深入探讨平台背后的系统,包括部署配置文件、模型启动、自动缩放、可观测性、发布、A/B测试和影子流量。目前,新的专用模型推理平台已可用,帮助您从早期迭代过渡到生产环境,并在到达后持续改进您所提供的内容。