返回 文章 apply CMS 文章

Mistral 发布 Agentic Search:多步检索循环让 AI 搜索更准、更快、更省 token

Mistral Agentic Search 用多步检索循环替代一次性 RAG,让模型能搜索、打开、导航、阅读和验证复杂文档中的信息。

Agentic SearchMistralRAG检索增强生成
成长分 / 100 76 综合收获、行动、留存与影响

Mistral 发布 Agentic Search:多步检索循环让 AI 搜索更准、更快、更省 token
为什么值得读了解传统一次性 RAG 在长文档、跨来源、表格密集场景下的三大局限:检索缺乏推理、文本块级别限制、无法迭代。

获取 FinanceBench 和 OfficeQA Pro 两个基准上的具体量化结果,包括准确率提升、token 节省和延迟下降数据。

关键洞察
  1. Agentic Search 在 FinanceBench 上实现 3 倍正确性提升,从 26.7% 提升至 86%;在 OfficeQA Pro 上获得 +45.6 点增益(从 6.3% 到 51.9%)。
  2. 仅搜索的 Agentic 循环是最大质量杠杆:MM 3.5 准确率提升 +47.3pp,GLM-5.2 提升 +52.6pp,两个模型均实现约 3 倍提升。
  3. 导航工具(open、navigate、read、grep)在提升准确率的同时减少 token 使用量(MM 3.5 减少 23.9%,GLM-5.2 减少 33.7%),并降低 p90 延迟(从 255 秒降至 154 秒)。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:13688

思考

摘要

Mistral Agentic Search 在 FinanceBench 和 OfficeQA Pro 基准测试中,提供了更准确的搜索结果,同时减少了轮次、token 使用量和延迟。Agentic Search 是使 AI 系统能够在最复杂的文档中导航、阅读和验证信息的检索层。可通过 Mistral Search Toolkit 和 Libraries 使用。

Mistral Agentic Search 通过让模型搜索和导航组织中最复杂的数据和文档,帮助企业从其 AI 系统中获得更好的结果。Agentic Search 引入了一个多步骤检索循环,用于跨数据源查找、检查和验证信息,无论数据存储在何处。Agentic Search 可通过 Mistral Search Toolkit 使用,并内置于

两者

Libraries

Studio中,并为您提供:

Vibe支持敏感的领域特定数据。Mistral 的可移植和开放工具帮助您从数据中释放价值,而无需跨越云或本地的隔离边界。改进的搜索结果。您的模型可以搜索和导航您的数据,超越检索到的片段——在冗长、密集的文档内部或跨多个来源。访问现有索引。Agentic Search 基于您现有的搜索索引,使用五个工具:search

open

navigate

read

grep

更高的准确性。基于 FinanceBench,Agentic Search 在财务文件上实现了3倍正确性,从 26.7% 提升至 86%。在 OfficeQA Pro 基准测试的表格密集型、多文档问题上,我们测量到+45.6 点的增益(从 6.3% 到 51.9%)。更低的延迟和 token 使用量。定向导航使 Agentic Search 能够将 p90延迟降低高达 39.6%。更少的重复搜索将 token 消耗减少了多达三分之一。

数据创造竞争优势

竞争优势建立在多年的实际运营之上——您的数据、您的流程和您的领域专业知识。专有知识对您的成功至关重要,同时也高度机密,这意味着它存在于隔离边界、分段部署和自托管平台之后。它积累在财务文件、法律合同、内部资源和政府记录中——这些冗长、密集的文档是传统搜索方法无法有效导航的。

能够持续学习和改进的代理可以帮助您复合您的竞争优势,但这些代理通常出于安全原因与机密数据和专有知识分离。要从 AI 中获得真正的影响,意味着将前沿推理与能够安全访问您最敏感材料的检索工具配对。

传统 RAG 的不足

传统的、一次性的 RAG 检索一组固定的文本片段,并要求模型在一次通过中回答。当答案出现在顶部结果之一时,这种方法有效,但当模型必须导航长报告、跟随引用、比较多个文档或验证底层证据时,就会失效。

这种局限在密集、复杂的数据和文档上更为明显。回答问题所需的信息可能分散在多个文档中,或埋藏在某个特定的表格、脚注或条款里。基于一次性 RAG 的搜索无法充分发挥前沿 AI 的全部能力,也无法提供可靠的答案,原因有三:

检索缺乏推理:模型必须基于初始检索阶段选出的文本块来作答,即使这些文本块不完整或不相关。它无法在回答前判断自己需要另一份文档、另一个章节或更多上下文,这限制了模型推理能力的影响。文本块级别的限制:关键数据往往存在于复杂的多模态文档中。当被问到“该公司第三季度的有效税率是多少?”时,索引可能找到正确的文档,却无法打开它、定位到表格、阅读周围的上下文或验证答案。无法迭代:许多问题需要不止一次检索才能得到正确答案。模型可能需要细化搜索、查看有希望的文档、追踪引用、比较多个来源、记录已看过的内容,并在首次结果不足时尝试新的路径。一次性 RAG 无法采取这些后续步骤。

仅使用 1953 年所有单个日历月份的已报告数值,美国国防及相关活动支出的这些数值总和是多少(以名义百万美元计)?

轨迹 1 tool_call(仅搜索)

search("national defense expenditures monthly 1953")

→ 10 条命中:分散的月度公报(表 3),每份都以财年为框架,仅覆盖 1953 年的一部分。

我找到了 1953 年 1 月至 6 月的数据。但我需要 1953 年 7 月至 12 月的月度数值才能计算答案。

仅使用 1953 年所有单个日历月份的已报告数值,美国国防及相关活动支出的这些数值总和是多少(以名义百万美元计)?

轨迹 3 tool_calls(2 次搜索 → 读取)

search("national defense expenditures monthly 1953")

→ 每月公报(部分年份)

search("…1953 November December 1954 to date")

→ 找到 treasury_bulletin_1954_02.pdf

第 15 页(表 3,1953 年全部 12 个月)

read(treasury_bulletin_1954_02.pdf, p.15)

→ 提取完整的表 3

1953 年月度数值

表 3,单位:百万美元

1 月 2 月 3 月 4 月 5 月 6 月 7 月 8 月 9 月 10 月 11 月 12 月
3,632 3,501 3,789 3,891 3,746 4,056 3,890 3,519 3,787 3,647 3,540 3,465

总和 = 44,463。

Agentic Search 的工作原理

Mistral Search Toolkit 提供开放模块,用于在云端或本地摄取、嵌入和索引关键且复杂的数据。Agentic Search 在此索引基础上构建,为模型提供五个类似常见文件系统操作的工具:

search

使用现有索引在整个语料库中查找相关文档。open

打开特定文档。navigate

移动到其中的某一页、某一节或某一区域。read

检索该位置的内容。grep

在已打开的文档中查找某个模式。

模型不再仅根据最初的前 k 个结果作答,而是可以检查其发现的内容、优化搜索、打开相关文档、导航到特定章节,并在作答前阅读源材料。索引识别可能的来源;Agentic Search 则决定在这些来源内部及之间检查什么。

一次性 RAG

Agentic Search

这些工具不需要微调或针对特定模型的训练。随着模型在推理和工具使用方面变得更强,检索效果无需更改基础设施即可提升。这是一个关键特性:检索质量随模型能力而扩展,而不是被你的分块策略所限制。

在以下场景使用 Agentic Search

长文档。 申报文件、合同、手册、技术规范和报告,答案可能出现在某一特定页面或特定的表格、条款、图表或脚注中。跨多个来源的问题。 需要模型在得出结论前从多个文档中查找、比较或核对证据的研究。必须核实的答案。 财务数据、法律条款、监管引用和运营数据,其回答可以在稳定且具体的文档位置中被引用。表格和结构化文档。 财务报表、政府记录和扫描版 PDF,其含义取决于行、列、页面位置或周围上下文——而不仅仅是叙述性文本。

索引检索是以下场景的正确起点

直接查找。 简短、干净的文档,答案很可能出现在最初检索到的分块之一中。大批量搜索。 需要返回相关段落而无需对其进行推理或导航的关键词或语义查找。简单、可预测的问题。 答案的可能来源和位置事先已知,且额外的检索步骤不太可能改善结果的使用场景。

对于这些搜索,一次性 RAG 通常已经足够。当问题要求模型超越初始结果并调查源材料时,添加 Agentic Search。在两种情况下,配置良好的索引仍然是正确的基础。

更相关的结果,更快

我们在两个行业标准评估上对 Agentic Search 进行了基准测试,使用开箱即用的 Mistral Search Toolkit 技术栈:默认分块、默认排序、无调优。这些结果是下限,而非上限,** **意味着你可以通过针对具体用例的调优进一步提升结果质量。

在这些基准测试中,我们使用 Mistral Search Toolkit 测试了两个模型:Mistral Medium 3.5(MM 3.5)和 Z.ai GLM-5.2(GLM-5.2),展示了较小模型(MM 3.5)和较大模型(GLM-5.2)的性能。

基准测试结果一致:智能体循环带来了实质性的质量提升,导航工具提高了准确性,同时减少了浪费的 token、轮次和延迟。我们在第一方和第三方模型上观察到相同的性能模式,这表明 Agentic Search 与模型无关,并且搜索质量应随新模型而提升。

FinanceBench:368 份 SEC 申报文件,150 个问题

FinanceBench(Islam 等,2023)测试了针对 368 份 SEC 申报文件(10-K / 10-Q / 8-K)的金融问答,平均每份约 147 页,总计约 53,900 页:冗长、表格密集的金融文档。答案由经过人工标注校准的 LLM 评判器评分。

我们发现:

仅搜索的 Agentic 循环是最大的质量杠杆。 从一次性 RAG 转向仅搜索循环,MM 3.5 的准确率提升了 +47.3pp,GLM-5.2 提升了 +52.6pp——两个模型均实现了约 3 倍的提升。由于模型可以迭代搜索,它们能够从较差的首次结果中恢复、优化查询,并将索引作为主动工具使用。导航功能增加了准确率。 添加 open、navigate、read 和 grep 操作再次提升了准确率(MM 3.5 为 +8.7pp,GLM-5.2 为 +6.7pp)。这意味着在复杂文档中,有针对性的深入搜索优于反复的广泛搜索。更好的检索工具提升了 token 和性能效率。 带有导航功能的完整循环在正确回答更多问题的同时,使用的 token 比仅搜索循环更少(MM 3.5:token 使用量减少 23.9%,GLM-5.2:减少 33.7%)。检索工具并非额外开销——它们用精确导航取代了浪费的搜索重试。延迟在关键环节下降。 在 FinanceBench 上,添加导航检索工具改善了延迟:p90 从 255 秒降至 154 秒,平均延迟从 108 秒降至 71 秒。总体而言,我们看到仅搜索循环会进行反复的广泛搜索,而导航帮助模型更快地定位证据。

OfficeQA Pro:696 份财政部公报,133 个问题

OfficeQA Pro 是一个基于历史美国财政部公报的可验证数值基准:扫描版、表格密集的政府财政 PDF,涵盖 696 份文档、约 89,000 页的语料库。我们报告了 133 个问题的“pro”子集的首次通过结果。

我们发现:

Agentic Search 和 Agentic 循环 + 导航在更困难、可验证的基准上取得了成功。 OfficeQA Pro 包含数值答案、扫描版 PDF 和深层表格查找。即使在这里,完整的 agentic 循环也显著提升了准确率,从一次性 RAG 提升至 GLM-5.2 的 51.9%+45.6pp),MM 3.5 提升了 +27.1pp导航在减少浪费的同时提升了质量。 使用完整循环(Agentic 循环 + 导航)将准确率提升了 高达 35.6%+7.5pp,MM 3.5;+8.3pp,19.0%,GLM-5.2),同时减少了 token 消耗。轮次下降了 高达 7.0%(MM 3.5,2.3% GLM-5.2)。基准越难,检索循环就越重要。 OfficeQA Pro 围绕扫描版、表格密集文档中的数值答案构建。一次性 RAG 几乎无法起步,而 agentic 循环允许模型迭代搜索、检查证据,并带来显著的准确率提升。工具栈对文档智能和搜索性能产生了实质性影响。 根据测试,GLM-5.2 在 Claude Code 框架下于 OfficeQA Pro 上得分 41.4%,而在 Mistral 框架下为 51.9%——同一底层模型上相差 +10.5pp。Kimi 研究

快速开始

文档中了解更多关于 Agentic Search 的信息。您可以通过以下任一方式在云端和本地部署中开始使用:

. 将 Agentic Search 集成到您自己的代理、工作流和客户部署中。Mistral Search Toolkit。在 Studio 和 Vibe 中开箱即用地使用 Agentic Search,无需自行构建检索系统。

测试 Search Toolkit 的最快方式是使用 Search Starter App。它使用默认配置为您自己的语料库创建本地索引,因此您无需成为搜索专家即可尝试 Agentic Search。当您准备好配置自己的用例时,您可以:

  • 为您的数据和文件类型选择解析器、分块策略、嵌入模型和提取器。设置数据摄取。管理 Vespa 模式、索引行为和相关性配置。调整索引和排序。向搜索管道添加查询重写、重排序或混合检索。扩展检索