思考
摘要
Mistral Agentic Search 在 FinanceBench 和 OfficeQA Pro 基准测试中,提供了更准确的搜索结果,同时减少了轮次、token 使用量和延迟。Agentic Search 是使 AI 系统能够在最复杂的文档中导航、阅读和验证信息的检索层。可通过 Mistral Search Toolkit 和 Libraries 使用。

Mistral Agentic Search 通过让模型搜索和导航组织中最复杂的数据和文档,帮助企业从其 AI 系统中获得更好的结果。Agentic Search 引入了一个多步骤检索循环,用于跨数据源查找、检查和验证信息,无论数据存储在何处。Agentic Search 可通过 Mistral Search Toolkit 使用,并内置于
Libraries和
Studio中,并为您提供:
Vibe支持敏感的领域特定数据。Mistral 的可移植和开放工具帮助您从数据中释放价值,而无需跨越云或本地的隔离边界。改进的搜索结果。您的模型可以搜索和导航您的数据,超越检索到的片段——在冗长、密集的文档内部或跨多个来源。访问现有索引。Agentic Search 基于您现有的搜索索引,使用五个工具:search
、open
、navigate
、read
和grep
。更高的准确性。基于 FinanceBench,Agentic Search 在财务文件上实现了3倍正确性,从 26.7% 提升至 86%。在 OfficeQA Pro 基准测试的表格密集型、多文档问题上,我们测量到+45.6 点的增益(从 6.3% 到 51.9%)。更低的延迟和 token 使用量。定向导航使 Agentic Search 能够将 p90延迟降低高达 39.6%。更少的重复搜索将 token 消耗减少了多达三分之一。
数据创造竞争优势
竞争优势建立在多年的实际运营之上——您的数据、您的流程和您的领域专业知识。专有知识对您的成功至关重要,同时也高度机密,这意味着它存在于隔离边界、分段部署和自托管平台之后。它积累在财务文件、法律合同、内部资源和政府记录中——这些冗长、密集的文档是传统搜索方法无法有效导航的。
能够持续学习和改进的代理可以帮助您复合您的竞争优势,但这些代理通常出于安全原因与机密数据和专有知识分离。要从 AI 中获得真正的影响,意味着将前沿推理与能够安全访问您最敏感材料的检索工具配对。
传统 RAG 的不足
传统的、一次性的 RAG 检索一组固定的文本片段,并要求模型在一次通过中回答。当答案出现在顶部结果之一时,这种方法有效,但当模型必须导航长报告、跟随引用、比较多个文档或验证底层证据时,就会失效。
这种局限在密集、复杂的数据和文档上更为明显。回答问题所需的信息可能分散在多个文档中,或埋藏在某个特定的表格、脚注或条款里。基于一次性 RAG 的搜索无法充分发挥前沿 AI 的全部能力,也无法提供可靠的答案,原因有三:
检索缺乏推理:模型必须基于初始检索阶段选出的文本块来作答,即使这些文本块不完整或不相关。它无法在回答前判断自己需要另一份文档、另一个章节或更多上下文,这限制了模型推理能力的影响。文本块级别的限制:关键数据往往存在于复杂的多模态文档中。当被问到“该公司第三季度的有效税率是多少?”时,索引可能找到正确的文档,却无法打开它、定位到表格、阅读周围的上下文或验证答案。无法迭代:许多问题需要不止一次检索才能得到正确答案。模型可能需要细化搜索、查看有希望的文档、追踪引用、比较多个来源、记录已看过的内容,并在首次结果不足时尝试新的路径。一次性 RAG 无法采取这些后续步骤。
仅使用 1953 年所有单个日历月份的已报告数值,美国国防及相关活动支出的这些数值总和是多少(以名义百万美元计)?
轨迹 1 tool_call(仅搜索)
search("national defense expenditures monthly 1953")
→ 10 条命中:分散的月度公报(表 3),每份都以财年为框架,仅覆盖 1953 年的一部分。
我找到了 1953 年 1 月至 6 月的数据。但我需要 1953 年 7 月至 12 月的月度数值才能计算答案。
仅使用 1953 年所有单个日历月份的已报告数值,美国国防及相关活动支出的这些数值总和是多少(以名义百万美元计)?
轨迹 3 tool_calls(2 次搜索 → 读取)
search("national defense expenditures monthly 1953")
→ 每月公报(部分年份)
search("…1953 November December 1954 to date")
→ 找到 treasury_bulletin_1954_02.pdf
第 15 页(表 3,1953 年全部 12 个月)
read(treasury_bulletin_1954_02.pdf, p.15)
→ 提取完整的表 3
1953 年月度数值
表 3,单位:百万美元
| 1 月 | 2 月 | 3 月 | 4 月 | 5 月 | 6 月 | 7 月 | 8 月 | 9 月 | 10 月 | 11 月 | 12 月 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 3,632 | 3,501 | 3,789 | 3,891 | 3,746 | 4,056 | 3,890 | 3,519 | 3,787 | 3,647 | 3,540 | 3,465 |
总和 = 44,463。
Agentic Search 的工作原理
Mistral Search Toolkit 提供开放模块,用于在云端或本地摄取、嵌入和索引关键且复杂的数据。Agentic Search 在此索引基础上构建,为模型提供五个类似常见文件系统操作的工具:
search
使用现有索引在整个语料库中查找相关文档。open
打开特定文档。navigate
移动到其中的某一页、某一节或某一区域。read
检索该位置的内容。grep
在已打开的文档中查找某个模式。
模型不再仅根据最初的前 k 个结果作答,而是可以检查其发现的内容、优化搜索、打开相关文档、导航到特定章节,并在作答前阅读源材料。索引识别可能的来源;Agentic Search 则决定在这些来源内部及之间检查什么。
一次性 RAG
Agentic Search
这些工具不需要微调或针对特定模型的训练。随着模型在推理和工具使用方面变得更强,检索效果无需更改基础设施即可提升。这是一个关键特性:检索质量随模型能力而扩展,而不是被你的分块策略所限制。
在以下场景使用 Agentic Search
长文档。 申报文件、合同、手册、技术规范和报告,答案可能出现在某一特定页面或特定的表格、条款、图表或脚注中。跨多个来源的问题。 需要模型在得出结论前从多个文档中查找、比较或核对证据的研究。必须核实的答案。 财务数据、法律条款、监管引用和运营数据,其回答可以在稳定且具体的文档位置中被引用。表格和结构化文档。 财务报表、政府记录和扫描版 PDF,其含义取决于行、列、页面位置或周围上下文——而不仅仅是叙述性文本。
索引检索是以下场景的正确起点
直接查找。 简短、干净的文档,答案很可能出现在最初检索到的分块之一中。大批量搜索。 需要返回相关段落而无需对其进行推理或导航的关键词或语义查找。简单、可预测的问题。 答案的可能来源和位置事先已知,且额外的检索步骤不太可能改善结果的使用场景。
对于这些搜索,一次性 RAG 通常已经足够。当问题要求模型超越初始结果并调查源材料时,添加 Agentic Search。在两种情况下,配置良好的索引仍然是正确的基础。
更相关的结果,更快
我们在两个行业标准评估上对 Agentic Search 进行了基准测试,使用开箱即用的 Mistral Search Toolkit 技术栈:默认分块、默认排序、无调优。这些结果是下限,而非上限,** **意味着你可以通过针对具体用例的调优进一步提升结果质量。
在这些基准测试中,我们使用 Mistral Search Toolkit 测试了两个模型:Mistral Medium 3.5(MM 3.5)和 Z.ai GLM-5.2(GLM-5.2),展示了较小模型(MM 3.5)和较大模型(GLM-5.2)的性能。
基准测试结果一致:智能体循环带来了实质性的质量提升,导航工具提高了准确性,同时减少了浪费的 token、轮次和延迟。我们在第一方和第三方模型上观察到相同的性能模式,这表明 Agentic Search 与模型无关,并且搜索质量应随新模型而提升。
FinanceBench:368 份 SEC 申报文件,150 个问题
FinanceBench(Islam 等,2023)测试了针对 368 份 SEC 申报文件(10-K / 10-Q / 8-K)的金融问答,平均每份约 147 页,总计约 53,900 页:冗长、表格密集的金融文档。答案由经过人工标注校准的 LLM 评判器评分。
我们发现:
仅搜索的 Agentic 循环是最大的质量杠杆。 从一次性 RAG 转向仅搜索循环,MM 3.5 的准确率提升了 +47.3pp,GLM-5.2 提升了 +52.6pp——两个模型均实现了约 3 倍的提升。由于模型可以迭代搜索,它们能够从较差的首次结果中恢复、优化查询,并将索引作为主动工具使用。导航功能增加了准确率。 添加 open、navigate、read 和 grep 操作再次提升了准确率(MM 3.5 为 +8.7pp,GLM-5.2 为 +6.7pp)。这意味着在复杂文档中,有针对性的深入搜索优于反复的广泛搜索。更好的检索工具提升了 token 和性能效率。 带有导航功能的完整循环在正确回答更多问题的同时,使用的 token 比仅搜索循环更少(MM 3.5:token 使用量减少 23.9%,GLM-5.2:减少 33.7%)。检索工具并非额外开销——它们用精确导航取代了浪费的搜索重试。延迟在关键环节下降。 在 FinanceBench 上,添加导航检索工具改善了延迟:p90 从 255 秒降至 154 秒,平均延迟从 108 秒降至 71 秒。总体而言,我们看到仅搜索循环会进行反复的广泛搜索,而导航帮助模型更快地定位证据。
OfficeQA Pro:696 份财政部公报,133 个问题
OfficeQA Pro 是一个基于历史美国财政部公报的可验证数值基准:扫描版、表格密集的政府财政 PDF,涵盖 696 份文档、约 89,000 页的语料库。我们报告了 133 个问题的“pro”子集的首次通过结果。
我们发现:
Agentic Search 和 Agentic 循环 + 导航在更困难、可验证的基准上取得了成功。 OfficeQA Pro 包含数值答案、扫描版 PDF 和深层表格查找。即使在这里,完整的 agentic 循环也显著提升了准确率,从一次性 RAG 提升至 GLM-5.2 的 51.9%(+45.6pp),MM 3.5 提升了 +27.1pp。导航在减少浪费的同时提升了质量。 使用完整循环(Agentic 循环 + 导航)将准确率提升了 高达 35.6%(+7.5pp,MM 3.5;+8.3pp,19.0%,GLM-5.2),同时减少了 token 消耗。轮次下降了 高达 7.0%(MM 3.5,2.3% GLM-5.2)。基准越难,检索循环就越重要。 OfficeQA Pro 围绕扫描版、表格密集文档中的数值答案构建。一次性 RAG 几乎无法起步,而 agentic 循环允许模型迭代搜索、检查证据,并带来显著的准确率提升。工具栈对文档智能和搜索性能产生了实质性影响。 根据测试,GLM-5.2 在 Claude Code 框架下于 OfficeQA Pro 上得分 41.4%,而在 Mistral 框架下为 51.9%——同一底层模型上相差 +10.5pp。Kimi 研究
快速开始
在文档中了解更多关于 Agentic Search 的信息。您可以通过以下任一方式在云端和本地部署中开始使用:
. 将 Agentic Search 集成到您自己的代理、工作流和客户部署中。Mistral Search Toolkit。在 Studio 和 Vibe 中开箱即用地使用 Agentic Search,无需自行构建检索系统。库
测试 Search Toolkit 的最快方式是使用 Search Starter App。它使用默认配置为您自己的语料库创建本地索引,因此您无需成为搜索专家即可尝试 Agentic Search。当您准备好配置自己的用例时,您可以:
- 为您的数据和文件类型选择解析器、分块策略、嵌入模型和提取器。设置数据摄取。管理 Vespa 模式、索引行为和相关性配置。调整索引和排序。向搜索管道添加查询重写、重排序或混合检索。扩展检索
