返回 文章 apply CMS 文章

Together Evaluations 新增对 OpenAI、Anthropic 和 Google 模型的支持,实现跨提供商基准测试

Together Evaluations 扩展了模型支持范围,新增了三大专有模型提供商,并提供了微调开源评判器以超越 GPT-5.2 的指南。

Together AI模型评估基准测试开源模型
成长分 / 100 77 综合收获、行动、留存与影响

Together Evaluations 新增对 OpenAI、Anthropic 和 Google 模型的支持,实现跨提供商基准测试
为什么值得读了解如何在一个统一平台上比较开源、微调和专有模型,从而做出更明智的模型选择决策。

学习如何通过微调开源模型来构建性能超越 GPT-5.2 的评判器,同时大幅降低成本和提高速度。

关键洞察
  1. Together Evaluations 现在支持 OpenAI、Anthropic 和 Google 的专有模型作为评判模型和目标模型。
  2. 用户可以直接评估使用 Together AI 微调服务训练的模型。
  3. 通过微调开源模型(如 GPT-OSS 120B、Qwen3 235B),可以在 RewardBench 2 上达到 62.63% 的准确率,超越 GPT-5.2 的 61.62%。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:5658

摘要

Together Evaluations 现在支持 OpenAI、Anthropic 和 Google 模型,用于全面基准测试。并排比较任何模型——开源、微调或专有——以在质量、成本和性能方面做出数据驱动的决策。

Together Evaluations:评估模型质量

现代 LLM 开发的特点是在不断扩展的开源、专有和微调模型生态系统中,质量、成本和性能之间存在复杂的权衡。Together Evaluations 提供了一个统一框架,使团队能够比较模型——开源、微调或专有——并基于经验质量数据做出模型选择决策。

Together Evaluations 为 LLM 质量评估提供了一个结构化、可重复的框架,使团队能够:

并排比较模型:使用相同的方法和指标评估开源、微调和专有模型。做出数据驱动的架构决策:确定提示优化或微调是否为特定任务带来最佳回报。跟踪质量随时间改进:通过可重复的自动化评估监控模型质量进展。

新功能

今天,我们很高兴地宣布支持闭源前沿模型——包括来自 OpenAI、Anthropic 和 Google 的模型——作为评判模型和目标模型,用于严格的跨模型基准测试。

我们增加了对这些请求功能的支持:

1. 支持专有模型提供商

Evaluations API 现在支持来自领先专有提供商的模型,包括:用户还可以指定任何与 OpenAI Chat Completions 兼容的 URL 来评估自托管的外部模型。

OpenAIopenai/gpt-5

openai/gpt-5.2

Anthropicanthropic/claude-sonnet-4-5

anthropic/claude-haiku-4-5

anthropic/claude-opus-4-5

Googlegoogle/gemini-2.5-pro

google/gemini-2.5-flash

2. 评估 Together 微调模型的能力

****用户现在可以直接在 Evaluations API 中评估使用 Together AI 微调服务 微调的模型,使用两种部署选项之一:

3. 关于如何优化和评估开源模型的新指南

深入探讨Cookbook 展示了如何使用我们的平台微调开源模型评判器,使其性能超越 GPT-5.2。在本笔记本中,我们演示了如何使用 DPO 在 RewardBench 2 偏好数据上微调开源 LLM 评判器(GPT-OSS 120B、Qwen3 235B),以超越 GPT-5.2 作为评估器的性能,达到 62.63% 的准确率,而 GPT-5.2 为 61.62%。它提供了使用 Together AI 的评估和微调 API 的端到端工作流,展示了开源模型如何以10 倍更低的成本和 15 倍更高的速度击败闭源评判器。- 我们在本文中演示

notebook如何使用我们的评估服务与流行的 GEPA 框架来自动优化提示,无需手动提示工程。使用 CNN/DailyMail 数据集,GEPA 通过 LLM 引导的反思和头对头评估迭代地优化基线摘要提示。此过程将提示的胜率从 50% 提高到 62.12%,展示了自动提示优化如何带来显著的质量提升。

分步指南

上传您的数据,格式为 JSONL 或 CSV

选择评估类型,包括 classifyscorecompare

描述您要评估的内容,通过以 Jinja2 格式为评判者提供 system_template

  • 您可以使用以下 Jinja 模板从数据集中指定参考答案:“请使用参考答案:{{reference_answer_column_name}}”

配置待评估的模型:

  • 对于外部模型:设置 ‘model_source’=’external’ 并提供您的 API 密钥

  • 对于微调模型:从您的 LoRA 无服务器部署或专用推理端点复制模型 ID。

  • 定义您的 input_template,以引用数据集中包含提示的列。示例:“回答以下问题:{{prompt_column}}”

  • 对于外部模型:设置 ‘ 获取结果!我们提供聚合的评估指标以及包含评判者完整反馈的结果文件。

您可以使用 UIAPIPython 客户端 提交评估请求。完整文档可在 此处 获取。

为了突出这些新功能,我们准备了一个动手笔记本和深入探讨,演示如何为您的特定任务选择最佳模型和优化策略。该指南涵盖了多种方法,包括:

提示优化

微调

针对专有模型的评估

您可以在此处找到相关材料:

深入探讨演示微调开放评判模型

展示如何微调开放评判模型的笔记本

提示优化笔记本