返回 文章 apply CMS 文章

Together AI 扩展微调服务:原生支持工具调用、推理与视觉模型

Together AI 微调服务新增工具调用、推理和视觉模型支持,并大幅提升大模型训练效率与可规划性。

Together AI微调工具调用推理微调
成长分 / 100 79 综合收获、行动、留存与影响

Together AI 扩展微调服务:原生支持工具调用、推理与视觉模型
为什么值得读了解如何通过微调解决代理应用中工具调用不可靠、推理退化及视觉领域适配等关键问题。

掌握 Together AI 在训练加速(SonicMoE 内核、自定义 CUDA)和成本透明化方面的最新技术进展。

关键洞察
  1. 工具调用微调支持 OpenAI 兼容模式,训练前验证数据结构,推理时增强解析与验证,提升生产可靠性。
  2. 推理微调允许直接对思考令牌(reasoning_content)进行训练,保持结构化痕迹,适用于复杂逻辑学习。
  3. 视觉语言模型微调支持 base64 编码图像内联输入,可冻结视觉编码器或联合训练,适配医学成像等特定领域。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:8589

新增功能

工具调用微调:通过对 OpenAI 兼容模式进行端到端微调和推理,确保代理可靠地执行结构化操作。推理微调:专门支持对推理轨迹中的“思考”令牌进行模型训练,使模型能够学习复杂逻辑。视觉语言模型微调:原生支持视觉训练,使视觉语言模型与复杂的、特定领域的视觉数据对齐。**大型模型支持:**在我们高度优化且易于使用的服务上训练参数高达 1T 的最新模型。

随着 AI 团队从单轮提示转向高级多轮工作流,可靠性在可预测的地方出现断裂:与模式不匹配的工具调用、在长交互中退化的推理,以及错过特定领域视觉信号的模型。修复这些问题通常需要后训练,但工作流往往碎片化、迭代缓慢且难以规划。

今天,AI 原生云 Together AI 扩展了 Together Fine-Tuning,原生支持工具调用、推理和视觉语言模型(VLM)微调。为了支持前沿规模的后训练,我们还升级了训练栈,以更高效地处理 100B+ 参数模型,吞吐量提升高达 6 倍。此外,我们现在支持对大小高达 100GB 的数据集进行微调。最后,我们现在在训练前提供作业成本估算,并在训练期间提供预计完成时间,以便团队更好地规划实验。

"Together AI 为微调和推理所做的工作,就像 Vercel 为基于 LLM 的应用所做的工作——它移除了基础设施层,让我们能够专注于产品。我们通过简单的 API 调用微调和部署客户特定模型。这使我们现有团队能够从每周迭代转向每日迭代,成本降低 2-3 倍,准确率从 77% 提升到 87%。"——Lamara De Brouwer,XY.AI Labs 联合创始人兼 CTO

工具调用微调

工具调用对于许多现代代理用例至关重要。然而,开箱即用的模型通常在工具调用方面存在困难:幻觉参数、选择错误的函数,或无法遵循多步序列。在工具调用工作流中,即使很小的不一致也可能级联成下游故障。

我们的微调服务现在为可靠的生产级工具调用提供端到端解决方案,涵盖从微调到推理的全过程。工具调用可以使用 OpenAI 兼容模式包含在训练数据中。函数在顶层 tools 数组中定义,我们的服务验证每个 tool_calls 条目是否与声明的工具匹配,确保在训练开始前数据结构正确。

在推理时,我们显著提高了工具调用的可靠性,以确保工具调用微调的优势转化为生产性能。增强的解析和验证提高了广泛实际用例的正确性,并得到来自社区贡献和内部研究的推理工具调用数据集的支持。

工具调用微调适用于来自 Qwen、Moonshot AI 和 Z.AI 的模型。请参阅工具调用文档以开始使用。要查看代码中工具调用功能的示例,请查看我们的cookbook

推理微调

推理模型在生成最终答案之前会产生中间思考痕迹,从而实现逐步推理。然而,不同模型的推理格式并不统一,这给推理微调过程带来了复杂性。

Together Fine-tuning 现在支持直接在助手消息中使用 reasoning 或 reasoning_content 字段对思考痕迹进行微调。这使您可以在保持痕迹结构化和可复现的同时,训练模型掌握特定领域的推理模式。与工具调用一样,我们改进了推理推理,确保微调后的能力能够转化为可靠的下游性能。

推理微调适用于 Qwen 和 Z.AI 的模型。请参阅我们的文档页面了解支持的模型和详细信息。有关推理微调的端到端代码演示,请查看我们的 cookbook

视觉语言模型微调

许多 AI 工作流需要能够解释图像输入的模型。对于医学成像和电子商务等特定领域任务,视觉语言模型(VLM)可能需要学习新的视觉模式才能有效。

Together Fine-tuning 服务现在支持视觉语言模型的微调。视觉训练数据通过包含 base64 编码图像的消息内容数组内联提供。微调作业支持混合数据集,允许在同一运行中同时包含图像文本示例和纯文本示例。

默认情况下,我们冻结视觉编码器,仅更新语言层。设置 train_vision=true 可启用联合训练,允许同时更新视觉编码器和语言层。

VLM 微调适用于 Qwen、Google 和 Meta 的模型。请参阅视觉语言文档了解支持的列表和使用详情。您也可以在此处查看我们的视觉语言微调 cookbook

大型模型微调

随着开放模型规模的扩大和上下文窗口的扩展,底层训练基础设施必须跟上步伐。万亿参数模型无法容纳在单个节点上,因此需要在多台机器之间进行仔细的通信和内存管理。即使在数小时的训练过程中出现一次硬件故障,也可能导致进度丢失,而实现所有优化和容错保障措施可能是一项重大投资。

Together Fine-Tuning 现在支持对最新的开放权重模型进行微调。提交训练作业,我们将在后台处理所有必要的优化。可用于微调的新模型包括:

  • Qwen 3.5-397B-A17B
  • Qwen 3.5-122B-A10B
  • Qwen 3.5-35B-A3B
  • Qwen 3.5-35B-A3B-Base
  • Kimi K2.5
  • Kimi K2 (Instruct, Thinking)
  • GLM-4.7
  • GLM-4.6

请在我们的文档中查看支持的模型及其上下文长度的完整列表。

训练加速

在此次更新中,我们继续聚焦训练栈中影响最大的优化机会。具体而言,我们针对混合专家架构进行了优化,因为过去一年发布的最强模型绝大多数都采用了这种架构。为了加速其训练,我们集成了 SonicMoE 的一个变体——一种 I/O 和 tile 感知的优化内核,能够将内存操作与计算重叠。在我们的训练工作负载中使用这些内核,显著减少了训练期间的激活内存占用,并最大限度地减少了计算浪费。

我们还引入了用于损失计算的自定义 CUDA 内核,并消除了训练循环中多个导致不必要停顿的 GPU 到 CPU 同步点,从而显著提升了整体流水线效率。

结果,每个模型的吞吐量至少提升了 2 倍,像 Kimi-K2 这样的大型模型提升了 6 倍以上。更快的训练意味着每天可以进行更多实验,并缩短了产品上线时间。

价格与时间估算

Together Fine-tuning 现在可以在从 UI 或 CLI 执行任务之前估算训练成本。这种价格透明度可以避免预算意外。

成本估算: 在启动前查看预估的任务价格,以便在产生成本之前了解训练费用。

时间估算: 跟踪实时进度条,其中包含动态更新的预计完成时间。

显示微调任务详情(含时间戳、JOB_PENDING、MODEL_DOWNLOAD 等事件及消息)的屏幕截图。

开始使用

→ 食谱链接:

→ 阅读微调文档