摘要
Together Evaluations 现在支持 OpenAI、Anthropic 和 Google 模型,用于全面基准测试。并排比较任何模型——开源、微调或专有——以在质量、成本和性能方面做出数据驱动的决策。
Together Evaluations:评估模型质量
现代 LLM 开发的特点是在不断扩展的开源、专有和微调模型生态系统中,质量、成本和性能之间存在复杂的权衡。Together Evaluations 提供了一个统一框架,使团队能够比较模型——开源、微调或专有——并基于经验质量数据做出模型选择决策。
Together Evaluations 为 LLM 质量评估提供了一个结构化、可重复的框架,使团队能够:
并排比较模型:使用相同的方法和指标评估开源、微调和专有模型。做出数据驱动的架构决策:确定提示优化或微调是否为特定任务带来最佳回报。跟踪质量随时间改进:通过可重复的自动化评估监控模型质量进展。
新功能
今天,我们很高兴地宣布支持闭源前沿模型——包括来自 OpenAI、Anthropic 和 Google 的模型——作为评判模型和目标模型,用于严格的跨模型基准测试。
我们增加了对这些请求功能的支持:
1. 支持专有模型提供商
Evaluations API 现在支持来自领先专有提供商的模型,包括:用户还可以指定任何与 OpenAI Chat Completions 兼容的 URL 来评估自托管的外部模型。
OpenAIopenai/gpt-5
openai/gpt-5.2
Anthropicanthropic/claude-sonnet-4-5
anthropic/claude-haiku-4-5
anthropic/claude-opus-4-5
Googlegoogle/gemini-2.5-pro
google/gemini-2.5-flash
2. 评估 Together 微调模型的能力
****用户现在可以直接在 Evaluations API 中评估使用 Together AI 微调服务 微调的模型,使用两种部署选项之一:
3. 关于如何优化和评估开源模型的新指南
深入探讨 和 Cookbook 展示了如何使用我们的平台微调开源模型评判器,使其性能超越 GPT-5.2。在本笔记本中,我们演示了如何使用 DPO 在 RewardBench 2 偏好数据上微调开源 LLM 评判器(GPT-OSS 120B、Qwen3 235B),以超越 GPT-5.2 作为评估器的性能,达到 62.63% 的准确率,而 GPT-5.2 为 61.62%。它提供了使用 Together AI 的评估和微调 API 的端到端工作流,展示了开源模型如何以10 倍更低的成本和 15 倍更高的速度击败闭源评判器。- 我们在本文中演示
notebook如何使用我们的评估服务与流行的 GEPA 框架来自动优化提示,无需手动提示工程。使用 CNN/DailyMail 数据集,GEPA 通过 LLM 引导的反思和头对头评估迭代地优化基线摘要提示。此过程将提示的胜率从 50% 提高到 62.12%,展示了自动提示优化如何带来显著的质量提升。
分步指南
上传您的数据,格式为 JSONL 或 CSV
选择评估类型,包括 classify、score 或 compare
描述您要评估的内容,通过以 Jinja2 格式为评判者提供 system_template
- 您可以使用以下 Jinja 模板从数据集中指定参考答案:“请使用参考答案:{{reference_answer_column_name}}”
配置待评估的模型:
对于外部模型:设置 ‘model_source’=’external’ 并提供您的 API 密钥
对于微调模型:从您的 LoRA 无服务器部署或专用推理端点复制模型 ID。
定义您的
input_template,以引用数据集中包含提示的列。示例:“回答以下问题:{{prompt_column}}”对于外部模型:设置 ‘ 获取结果!我们提供聚合的评估指标以及包含评判者完整反馈的结果文件。
您可以使用 UI、API 或 Python 客户端 提交评估请求。完整文档可在 此处 获取。
为了突出这些新功能,我们准备了一个动手笔记本和深入探讨,演示如何为您的特定任务选择最佳模型和优化策略。该指南涵盖了多种方法,包括:
提示优化
微调
针对专有模型的评估
您可以在此处找到相关材料:
