2026年9月10日
周中一,研究科学家;杜若飞,交互感知与图形负责人,Google XR
ToolGrad 是一个数据生成框架,它颠覆了传统范式,先生成工具使用答案,再生成用户查询。我们证明这种设计能让 LLM 获得更好的工具使用表现。
AI 智能体在自动化现实世界任务方面展现出巨大潜力,例如执行 Google 搜索、读取本地计算机文件,或执行生成的 Python 脚本。要实现这类智能体工作流,LLM 需要学会如何正确且高效地使用工具。为了教会大语言模型使用工具,我们需要工具使用链及其对应用户查询的数据集。在我们此前发表于 InstructPipe 的工作中,我们手动标注了评估数据,但将人工标注扩展到先进的 LLM 微调工作流是不切实际的。为了简化数据工作流,此前的工作,例如 ToolBench 和 ToolACE,探索了使用智能体通过试错自动搜索工具使用路径。这种具有代表性的标注方法包含两个步骤:(1) 从采样的 API 池中生成一个假设的用户指令,(2) 使用深度优先搜索(DFS)智能体找到其工具使用解决方案。这种方法本质上是低效的,因为其核心概念是从复杂的智能体探索中提炼有价值的轨迹,用于训练 LLM。
在发表于 ACL 2026 的“ToolGrad: Efficient Tool-use Dataset Generation with Textual ‘Gradients’”(ToolGrad:利用文本“梯度”高效生成工具使用数据集)中,我们提出了一种替代的解决方案范式。ToolGrad 首先生成真实的工具使用链,然后标注其对应的用户提示。直观地说,明确的工具使用解决方案比提示提供了更无歧义的信息,使得从工具使用到用户查询的标注变得容易得多,且只需一步 LLM 操作。我们的结果表明,这种答案优先的方法能够以更低的成本生成更复杂(长时程)的工具使用数据。在我们生成的数据上训练的 LLM 也优于在基线方法上训练的 LLM,甚至在具有未见工具的分布外(OOD)数据集上能与最先进的专有 LLM 相媲美。
此前的工作通过以低通过率搜索用户查询的解决方案来生成工具使用数据集,而 ToolGrad 在生成提示之前先生成成功的工具使用链,从而实现高通过率。
标准机器学习(ML)系统通过计算训练样本小批量上的数值损失梯度来改进,这些梯度随后被优化算法用于更新模型权重。最近,TextGrad 将这一范式适配到提示工程中,使用 LLM 评论者以纯文本形式提供丰富、描述性的反馈——这种反馈被称为“文本梯度”。这些文本梯度随后引导给定提示的改进,形成能更好解决目标任务的新草稿。
ToolGrad 将文本梯度的概念从提示优化迁移到了合成数据集生成。ToolGrad 不是优化一个静态的文本提示,而是利用这些梯度从大型工具库中迭代构建复杂且有效的 API 工作流。
将 ToolGrad 的优化组件与传统机器学习和 TextGrad 进行比较。
ToolGrad 包含四个核心模块,依次进行提议、执行、选择和更新。
重复这一迭代过程会生成一个数据样本,由用户查询、经过验证的 API 工作流以及最终的 AI 响应组成。
ToolGrad 在生成提示之前先生成成功的工具使用链,从而获得高通过率。
我们首先评估数据生成的成本和质量。我们使用 ToolBench 作为我们的 API 数据库,它包含 16k+ 真实世界 API,用于生成我们的工具使用数据集。我们将 ToolBench 上原始的查询优先数据生成方法(使用深度优先搜索,DFS)与我们的答案优先方法 ToolGrad 进行比较。结果表明,ToolGrad 能够以更低的生成成本生成更复杂的工具使用数据,并具有更高的通过率。
查询优先方法(基线)与答案优先方法(我们的方法)之间的生成效率比较。
我们使用 ToolBench 的 API 数据库生成了名为 ToolGrad-500 的小规模工具使用数据集。然后,我们使用 ToolGrad-500 对 Gemma-3 模型(1B、4B 和 12B)进行了微调,并将这些微调后的模型称为 ToolGrad-1B、ToolGrad-4B 和 ToolGrad-12B。我们在 Berkeley Function Calling Leaderboard (BFCL) 上评估了这些模型的工具使用性能,这是一个使用与 ToolBench 不同工具集的工具使用基准。我们将微调后的模型与以下对象进行比较:(1) 未经微调的基础模型,(2) SoTA 专有模型(Gemini、GPT 和 Claude),以及 (3) SoTA 工具使用专用模型(ToolACE、Hammer-2.1-7B)。
以下总结了我们的发现。
在 Gemma-3、ToolGrad 模型、Gemini 2.5 系列、GPT-5、Claude-4.5、ToolACE 和 Hammer-2.1-7B 模型上的 BFCL 评估结果。
ToolGrad 表明,通过答案优先范式可以更高效、更可靠地生成高质量的工具使用数据集。通过设计一个通过文本梯度迭代链接 API 的智能体框架,ToolGrad 解决了生成真实数据中长期存在的成本和可扩展性瓶颈。我们的设计在数据生成中实现了几乎 100% 的通过率,使相对紧凑的模型能够表现出色,并表明学生 LLM 甚至可以超越其教师。
展望未来,通过扩展该框架以处理日益动态和庞大的 API 生态系统,这项研究可以扩展到更广泛的现实世界应用。未来的工作还将探索扩展这种自进化能力,以支持随时间推移的持续、即时学习以实现个性化。随着智能体工作流日益嵌入企业和日常任务,像 ToolGrad 这样的框架为训练既高度有能力又具有经济可扩展性以部署的数字智能体奠定了重要基础。
本研究主要由周中一(Zhongyi Zhou)在担任谷歌访问研究员期间完成。我们衷心感谢重要贡献者上原康平(Kohei Uehara)、张浩宇(Haoyu Zhang)、周敬涛(Jingtao Zhou)、顾林(Lin Gu)、徐峥(Zheng Xu)、原田达也(Tatsuya Harada)的支持,以及Adarsh Kowdle和Shahram Izadi的战略指导与悉心审阅。
