返回 文章 apply CMS 文章

Together AI 扩展微调服务:新增模型、实时指标与更精细控制

Together AI 微调服务全面升级,从数据检查到训练控制再到成本优化,帮助团队更高效地将开放权重模型转化为生产级模型。

Together AI微调开放权重模型专家 LoRA
成长分 / 100 80 综合收获、行动、留存与影响

Together AI 扩展微调服务:新增模型、实时指标与更精细控制
为什么值得读了解 Together AI 微调服务的最新功能,包括对 GLM、DeepSeek、Kimi、Qwen、Gemma 等最新开放权重模型的支持。

掌握专家 LoRA、早停、样本权重、打包控制等精细控制手段,提升微调效果与效率。

关键洞察
  1. 新增对 GLM-5.3、Kimi K2.7、Qwen 3.8-27B、Gemma 4 等最新开放权重模型的支持,覆盖从端侧到前沿性能的广泛规模。
  2. 专家 LoRA 将适配器放在专家层上,在知识注入任务中回忆率高达 89%,远超仅注意力适配器的 15%,并在 MMLU-Pro 上以 75.3% 对 71.5% 胜出。
  3. 实时实验跟踪通过 API、CLI 和 UI 仪表板公开损失、梯度范数、学习率等指标,支持多任务同图比较。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:15496

将一个开放权重模型转变为适用于你任务的高性能模型,需要一系列精心设计的实验。团队需要了解模型将基于什么数据训练、跟踪每次运行的进展、调整训练配方,并确定哪个检查点表现最佳。

今天,我们正在整个工作流程中扩展 Together Fine-Tuning。本次发布增加了对最新开放权重模型的支持、实时实验跟踪、对训练和数据处理的更精细控制,以及部分模型的价格下调。

你还可以在训练前检查和验证数据集,在运行进行中比较多次运行,并在验证损失趋于平稳时停止。

新模型

新的开放权重模型正以前所未有的速度涌现,几乎每一次发布都在提升质量、效率或两者兼而有之的标准。团队希望快速将这些进步投入生产,而不必在每个新架构的技术挑战上花费数周时间。

对于需要前沿性能的任务,你可以求助于最大、最强的模型,例如 GLM-5.3 和 Kimi K2.7。例如,GLM-5.3 在 Terminal-Bench 2.1 上得分 88.2,与领先的专有模型仅差一分。其他团队优先考虑性能与成本,选择 Qwen 3.8-27B 或 Gemma 4 等模型。对于本地和端侧应用,Qwen 3.5 系列提供了从 0.8B 到 9B 参数不等的选项。

Together Fine-Tuning 在广泛的规模范围内支持所有这些模型,并内置了跨系统和算法的领先优化。提交训练任务,我们会在后台处理特定架构的复杂性。最新新增的模型包括:

  • GLM 5.3
  • GLM-5.2
  • GLM-5.1
  • DeepSeek-V4-Flash-0731
  • DeepSeek-V4-Flash
  • Kimi K2.7-Code
  • Kimi K2.6
  • Qwen 3.8-27B
  • Qwen 3.6-35B-A3B
  • Qwen 3.6-27B
  • Qwen 3.5-27B
  • Qwen 3.5-9B
  • Qwen 3.5-4B
  • Qwen 3.5-2B
  • Qwen 3.5-0.8B
  • Gemma 4-31B
  • Gemma 4-26B-A4B

在我们的文档中查看支持模型的完整列表及其上下文长度。

实验跟踪

一次运行的轨迹越早可见,就能越早做出下一个决定——调整数据、更改超参数,或让它完成。微调任务现在会在每个训练和评估步骤记录指标,并直接通过 Together API、CLI 和 UI 仪表板公开这些指标。指标、任务状态和产物都集中在一处,因此你可以在整个模型开发过程中留在同一个平台上。

每次运行都会捕获核心训练信号:损失、梯度范数、学习率。当你添加验证集时,评估损失和指标将与训练指标一起被跟踪。

在仪表板中,每个任务都有一个 Metrics 标签页,其中的曲线在运行仍在进行时就会更新——你可以选择多个任务并将它们绘制在同一组坐标轴上,这样一次扫描呈现为一幅图,而不是十几个浏览器标签页。你也可以通过我们的 Python SDK 做同样的事:一条命令,终端中显示曲线,无需切换上下文。

微调任务的 Metrics 标签页,显示两次运行的实时损失、梯度范数和学习率曲线。

比较视图,将两个微调任务的训练损失绘制在同一组坐标轴上。

终端中同时运行微调列表指标、绘制损失、梯度范数和学习率。

API 返回底层序列——每个记录的步骤,按范围过滤或降采样。这样,你可以将指标拉取到 notebook、你已有的内部仪表盘或任何其他目的地。

在我们的文档中查看更多详情。

对训练的更多控制

专家 LoRA

在混合专家模型中,超过 90% 的参数以及模型实际知道的大部分内容都存在于专家层中。标准 LoRA 微调从不触及它们:适配器附加到注意力层,而专家层保持冻结。你现在可以将 LoRA 适配器放在专家本身上,这样你的任务就可以训练知识所在的层。

这种差异在任务需要模型学习真正新东西的地方显现出来。我们教模型 200 个虚构事实(因此基础模型对它们一无所知):包含专家层的适配器回忆起了高达 89% 的新知识,而仅注意力适配器在同一模型上最高只有 15%。它们还保留了更多模型现有知识,并在 MMLU-Pro 上 outright 获胜,75.3% 对 71.5%。

条形图:在 gemma-4-26B-A4B 和 Qwen3.6-35B-A3B 上,触及专家的 LoRA 在知识注入、记忆和局部性方面优于仅注意力适配器。

折线图:训练步骤中死亡专家占路由专家的比例:仅注意力训练让专家死亡,而专家 LoRA 保持它们参与。

训练动态解释了差距:使用仅注意力适配器时,越来越多的路由专家在微调期间不再被使用,而专家适配器保持整个混合体参与。

启用专家适配器很简单:只需将专家模块添加到 lora_trainable_modules

。其余微调工作流程与任何其他 LoRA 任务相同。

早停

微调任务现在可以在不再改进时自动完成。这意味着你得到的是最佳模型,而不仅仅是最后一个,并且你不会为不再有帮助的训练付费。启用早停,提供验证集,我们将在每次评估时观察你的验证损失。当曲线趋于平稳时,我们停止运行,保留验证损失最佳的检查点作为你的最终模型,并自动退还你未使用的每个训练步骤。

当你想要更精细的控制时,耐心、对小改进的敏感度和预热都是可调的。完整参数参考在文档中

任意批量大小支持

有些任务需要的批量大小无法适应 GPU 内存:长序列、大模型或为大型全局批量调整的配方。你现在可以使用任何你想要的有效批量大小进行训练,无论单次传递能容纳多少。设置 gradient_accumulation_steps

并且梯度会在每次优化器更新前跨微批次累积,从而形成 batch_size x gradient_accumulation_steps 的有效批次大小。详情见文档

价格下调

在 Together,我们相信智能应当充裕丰富,我们利用所有可用的系统和算法优化,为客户提供最大价值。我们持续优化训练技术栈,并希望将任何成本降低传递给用户。因此,我们下调了所支持的大多数模型的训练价格,节省幅度从 30% 起,对于 gpt-oss 系列等模型最高可达 70%。

以下是训练 LoRA 适配器每 100 万 token 的部分价格变化:

模型 旧 SFT 新 SFT 旧 DPO 新 DPO
Qwen/Qwen3.5-9B 0.48 0.34 1.20 0.84
Qwen/Qwen3.8-27B 1.50 1.05 3.75 2.62
google/gemma-4-31B-it 1.50 1.05 3.75 2.62
openai/gpt-oss-120b 5.00 2.50 12.50 6.25
openai/gpt-oss-20b 1.50 0.40 3.75 1.00

完整价格表可在我们的定价页面查看。

案例研究:Adaption 如何在 Together 上为高达 1T 的开放模型自动化训练

Adaption 是一家前沿 AI 研究公司,致力于构建能够持续学习的智能,通过实时数据和环境不断演进,而非依赖静态训练和昂贵的重新训练周期。其研究涵盖三大支柱:

  • 自适应数据(Adaptive Data),大规模塑造数据
  • 自适应智能(Adaptive Intelligence),跨行业和语言演进模型
  • 自适应界面(Adaptive Interfaces),重新构想人机交互

AutoScientist 属于自适应智能的一部分,它自动化了模型训练背后的完整研究循环。自适应数据塑造输入,而 AutoScientist 塑造模型本身:你设定目标结果,循环便会搜索训练配方、优化数据、训练并评估,在这四者之间循环往复,而不是默认使用通用超参数。

它会在每次运行中改进自己的选择,直到质量收敛到你的目标。它支持 LoRA 和全量微调,覆盖高达 1T 参数的领先开放模型,训练由 Together 的微调平台提供支持,评估则在 Together 的专用端点上运行。其结果是形成一个闭环,持续改进模型,而无需原本所需的人工投入或重新训练成本。

“我们与 Together 合作,以高达 1 万亿参数的模型运行 Adaption 的 AutoScientist 完整自我改进训练循环。这使我们能够以可靠交付的工具,为世界各地的公司大规模提供自我改进的智能。”——Sara Hooker,Adaption 联合创始人

灵活且透明的数据处理

检查分词后的数据

此前,数据处理在微调任务内部作为黑盒运行:你无法看到数据是如何被分词和打包的。当结果与你的预期不符时——聊天模板的应用方式与你设想的不同、标签在错误的位置被掩码、行被静默截断——你会遇到质量下降,却难以追溯其原因。

现在你可以在启动作业之前检查分词后的数据。预览任何已上传文件中的行,使用你即将微调的基础模型的确切分词器和聊天模板进行分词,并准确查看训练将消费的内容:token ID、token 字符串、每个 token 的标签、对损失有贡献的跨度,以及该行是否在模型的最大序列长度处被截断。预览只需几秒钟即可运行。

分词数据集预览,列出 token、训练 token 数、截断状态、训练跨度以及第一行的 token 预览。

微调作业详情页面,突出显示已准备的分词数据集的下载链接。

你还可以检查训练循环实际消费了什么。现在每个微调作业都会公开其完全准备好的数据集的一个子集——完全按照训练器接收时的样子进行分词、打包和整理。它可以通过 Python SDK 以及控制台中作业页面上的下载链接获取。

在文档中了解有关数据集预览的更多信息。

样本权重

并非每个训练示例都值得同等对待。现代数据集通常混合多个来源和领域——人工标注数据与合成数据并存,一个领域与另一个领域并存——但默认情况下,每个示例对训练的影响相同,无论质量或重要性如何。

Together Fine-Tuning 现在支持按示例加权,让你精确控制每个数据点的影响。在 JSONL 文件中的任何示例中添加 weight 字段,训练就会相应地缩放该示例对损失的贡献。权重适用于所有支持的 JSONL 数据格式和所有训练方法。

在我们的文档中阅读有关样本权重的更多信息。

预检文件验证

数据集验证过去在训练作业内部运行。如果你文件的第 59,000 行有一个格式错误的工具调用,你会在作业排队、调度并启动之后才发现——等待几分钟才知道一个拼写错误。

现在,一旦你的微调 JSONL 文件上传完成,就会启动完整的服务器端检查,结果会落在文件对象本身上,因此你甚至可以在创建作业之前就看到任何问题。检查覆盖完整的 schema:消息结构和角色、工具定义和工具调用/响应配对、推理字段、多模态内容和图像解码、偏好对结构,以及样本权重类型和范围——错误消息中会包含有问题的示例索引。

成功的验证还会报告我们检测到的关于你的数据的信息——数据集格式、行数,以及它是否包含样本权重、消息权重、工具、并行工具调用、推理轨迹或图像——这样你就可以确认平台按照你的意图读取了你的数据集。

阅读有关预检文件验证的更多信息。

打包控制

序列打包(Sequence packing)是一种将多个序列拼接为单个序列的技术,以避免在填充 token 上浪费计算。它大幅提升吞吐量并缩短训练时间,因此在 Together Fine-Tuning 中默认启用。尽管具有效率优势,它并不总是正确的选择:在数据集较小时,打包可能导致每个 epoch 的优化步数过少。

示意图:短样本被拼接为一个打包序列,旁边是防止跨样本注意力的二维注意力掩码。

此处

creative commons 4.0)。

现在你可以完全控制序列打包:用一个标志将其完全禁用,或在预分词数据格式中使用 position_ids

来设置你想要的打包程度。

如需了解更多信息,请阅读我们的文档。

即将推出:从微调到推理的更快速路径

每个中间 LoRA 适配器都将在微调仍在进行时即可部署。无需等待整个训练任务完成,你就能在训练开始后不久开始评估结果,每次迭代可节省数小时甚至数天。一旦第一个适配器被保存,你就可以通过 Dedicated Model Inference 部署它,或在 Multi-LoRA 设置中将其挂载到已运行的端点上,从而避免为每个实验单独创建端点所带来的成本和启动时间。

初步支持计划面向 GLM-5.3,随后是 Kimi K3。随着新工作流接近发布,我们将分享可用性详情、受支持模型的完整列表以及完整的 API 操作指南。

结论

Together Fine-Tuning 现在让你对整个实验周期拥有更多可见性和控制力,从模型所看到的数据到你部署的检查点。你可以在运行前验证数据集,在训练过程中跟踪并比较指标,并通过更精细的控制调整配方。

对最新开放权重模型的支持以及部分模型的价格下调,使得随着新模型的出现,这一循环更容易重复。