AI基础设施已悄然成为生产基础设施。团队不再只是用少量GPU进行实验。单节点原型可以迅速演变为跨越数百个加速器的分布式训练工作负载。服务于真实用户的推理系统可能会经历不可预测的流量峰值。随着集群成为共享环境,从机器学习研究人员到企业平台工程师,每个人的运维标准都发生了变化。
但随着这种基础设施的扩展,手动管理成为一种负担。静态配置效率低下且成本高昂。权限管理变得脆弱。可观测性缺口掩盖了性能瓶颈,当GPU硬件发生故障——这不可避免——单个不稳定的节点可能破坏数小时的训练时间。
今天,我们为Together GPU Clusters(原Instant Clusters)引入了重大企业级增强功能。我们将自动扩缩容、基于角色的访问控制(RBAC)、全栈可观测性、自助节点修复和主动健康检查直接集成到核心集群体验中——为团队提供虚拟化栈的弹性与裸机的性能表现。
自动扩缩容:无需过度配置的弹性容量
无需为峰值负载静态分配GPU容量,而是启用“自动扩缩容”,让集群根据实时资源需求进行扩展或收缩。
由Kubernetes Cluster Autoscaler驱动,它监控来自分布式训练或突发推理流量的GPU受限工作负载(待处理Pod)。当需求激增时,自动上线额外节点;当需求下降时,缩减容量。

结果很直接:你在负载下保持性能,而无需为空闲GPU节点付费。这使得Together GPU Clusters非常适合长时间运行的训练作业和变化的推理工作负载。要了解更多关于此功能的信息,请访问我们的文档。
主动健康检查、更深入的验收测试和自助节点修复:减少故障的MTTR
在大型GPU集群中,硬件不稳定并非假设性风险——而是运维现实。对于分布式训练工作负载,单个节点故障可能使整个作业运行失效。
Together GPU Clusters现在包含自助主动健康检查。在启动大规模训练作业之前,用户可以直接从UI触发从基本DCGM Diag 3到多节点NCCL或InfiniBand写入带宽测试的测试,并获得通过/失败结果及详细输出。

此功能对于分布式训练工作负载尤其关键,因为单个节点故障可能使整个作业运行失效。用户现在可以在启动大型训练作业之前对基础设施触发一系列深度检查,从而保持工作负载连续性并减少浪费的计算周期。

如果某个节点发生故障,用户只需点击三次即可执行自我修复。控制平面将自动封锁、排空并在新主机或现有主机上重新创建节点,使集群在数分钟内恢复健康状态。验收测试现在会在配置期间自动运行,集群在通过测试之前不会被标记为就绪。在此处查看完整的验收测试列表 文档。
基于角色的访问控制:结构化的多团队治理
随着集群从实验阶段转向共享基础设施,访问控制变得至关重要。在 Together GPU Clusters 中,“项目”现在定义了团队的协作和隔离边界,集群和存储卷严格限定在每个项目范围内。
管理员可以实施与企业治理相一致的结构化访问控制。默认情况下,项目包含两个角色:
管理员:对控制平面具有完全读写权限(创建/删除集群),并对 Slurm 集群具有 sudo 访问权限。成员:对数据平面具有写入权限(访问 GPU 工作节点和运行工作负载)。
这种清晰的划分允许平台工程师锁定基础设施配置,同时让研究和应用团队能够在其边界内安全地运行工作负载。
您可以通过导航到“设置”>“GPU 集群项目”在 云控制台 中管理项目成员和用户角色。

要了解有关此功能的更多信息,请访问我们的文档 此处。
全栈可观测性(私有预览)
每个 Together GPU Cluster 项目现在都包含一个专用的 Grafana 实例,带有预构建的仪表板,可直接从集群详细信息页面访问。
遥测覆盖整个堆栈:
GPU 利用率:DCGM 指标提供对加速器健康和性能的直接洞察。网络:InfiniBand 和 NIC 级遥测揭示吞吐量和带宽模式。存储与编排:I/O 性能指标揭示隐藏的瓶颈,而 Kubernetes 遥测提供对编排健康和资源分配的可见性。
集群配置完成后即可使用遥测。对于平台团队,这加速了调试和性能调优。对于财务和运营团队,这提高了容量规划和成本效率。


从实验阶段迈向运营阶段
通过将自动扩缩、RBAC、可观测性、开箱即用的健康检查和修复集成到平台中,Together GPU Clusters 超越了原始的 GPU 配置,进入了生产就绪的完全托管基础设施。
这使团队能够自信地运行大规模分布式训练作业,而无需担心硬件故障会导致计算时间损失。同时,它还为整个组织提供了量身定制的价值:
平台工程师可以安全地支持共享环境中的多个内部利益相关者。运维人员可以在模型性能下降之前精确定位网络或存储瓶颈。财务团队可以使GPU支出更紧密地匹配实际使用模式。
最重要的是,组织可以从实验性AI系统过渡到运营性AI平台——无需拼凑第三方工具或从头构建内部控制平面。
开始使用
这些功能现已集成在Together GPU集群中。
