Mistral AI 推出 Agentic Search,用于提升企业 AI 系统检索准确性与效率
Agentic Search. More accurate and efficient results from your AI systems.
Mistral AI 推出 Agentic Search,这是一个检索层,可让 AI 系统在复杂文档和数据源中搜索、导航、阅读并验证信息。它通过 Mistral Search Toolkit 和 Libraries 提供,使用 search、open、navigate、read、grep 五个工具,并内置于 Studio 和 Vibe。
原文给出工具接口、适用场景和基准数据,可用于比较 Agentic Search 与传统 RAG 的取舍。
思考
摘要
Mistral Agentic Search 在 FinanceBench 和 OfficeQA Pro 基准测试中提供更准确的搜索结果,同时减少轮次、token 使用量和延迟。Agentic Search 是一个检索层,使 AI 系统能够在即使最复杂的文档内部导航、阅读和验证信息。可通过 Mistral Search Toolkit 和 Libraries 使用。

Mistral Agentic Search 通过让模型搜索和浏览组织中最复杂的数据和文档,帮助企业从其 AI 系统中获得更好的结果。Agentic Search 引入了一个多步骤检索循环,用于在各种数据源中查找、检查和验证信息,无论这些信息存储在何处。Agentic Search 可通过 Mistral Search Toolkit 使用,内置于 Libraries,可在 Studio 和 Vibe 中使用,并为你提供:
支持敏感的特定领域数据。Mistral 的可移植开放工具可帮助你在不跨越云端或本地环境中的隔离边界的情况下,释放数据价值。
改进的搜索结果。你的模型可以在检索到的片段之外搜索和浏览你的数据——深入长篇、密集的文档内部,或跨多个来源进行搜索。
访问现有索引。Agentic Search 基于你现有的搜索索引构建,使用五种工具:
search、open、navigate、read和grep。更高的准确性。基于 FinanceBench,Agentic Search 在财务文件上的正确率提升至 3 倍,从 26.7% 提高到 86%。在 OfficeQA Pro 基准测试中以表格为主、涉及多文档的问题上,我们测得提升 45.6 个百分点(从 6.3% 到 51.9%)。
更低的延迟和 token 使用量。有针对性的导航使 Agentic Search 能够将 p90 延迟最高降低 39.6%。更少的重复搜索使 token 消耗最多减少三分之一。
数据创造竞争优势
竞争优势建立在多年真实运营的基础之上——你的数据、你的流程和你的领域专业知识。专有知识既是你成功的关键,也高度机密,这意味着它存在于隔离边界、分段部署和自托管平台之后。它积累在财务文件、法律合同、内部资源和政府记录中——这些冗长而密集的文档是传统搜索方法无法有效导航的。
能够持续学习和改进的智能体可以帮助你叠加竞争优势,但出于安全原因,这些智能体往往与机密数据和专有知识相隔离。要从 AI 获得真正的影响力,就需要将前沿推理能力与能够安全访问你最敏感材料的检索工具相结合。
传统 RAG 存在不足
传统的一次性 RAG 会检索一组固定的文本片段,并要求模型一次性给出答案。当答案出现在排名靠前的结果之一中时,这种方式有效;但当模型必须浏览一份长报告、追踪引用、比较多份文档或验证底层证据时,它就会失灵。
在密集而复杂的数据和文档上,这一限制更加明显。回答问题所需的信息可能分散在多份文档中,或埋藏在某个特定表格、脚注或条款里。基于一次性 RAG 的搜索无法充分利用前沿 AI 的全部能力,也无法提供可靠答案,原因有三点:
无需推理的检索:模型必须根据初始检索时选中的片段来回答,即使这些片段不完整或不相关。它无法在回答前判断自己需要另一份文档、另一个章节或更多上下文,这限制了模型推理的作用。
片段级限制:关键数据通常保存在复杂的多模态文档中。当被问到“该公司在 Q3 的有效税率是多少?”时,索引可能会找到正确的文档,但无法打开它、导航到表格、阅读周围上下文或验证答案。
无法迭代:许多问题需要不止一次检索才能得到正确答案。模型可能需要细化搜索、检查有希望的文档、跟踪引用、比较多个来源、记录已经看过的内容,并在第一批结果不足时尝试新路径。一次性 RAG 没有办法执行这些后续步骤。
借助 Agentic Search
仅使用 1953 年各个日历月报告的数值,美国国防及相关活动支出这些数值的总和是多少(以百万名义美元计)?
轨迹 3 次工具调用(2× search → read)
search("national defense expenditures monthly 1953") → 按月公报(部分年份)
search("…1953 November December 1954 to date") → 呈现 treasury_bulletin_1954_02.pdfp.15(表 3,1953 年全部 12 个月)
read(treasury_bulletin_1954_02.pdf, p.15) → 提取完整的表 3
1953 年月度数值
表 3,单位为 $millions
| 1 月 | 2 月 | 3 月 | 4 月 | 5 月 | 6 月 | 7 月 | 8 月 | 9 月 | 10 月 | 11 月 | 12 月 |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 3,632 | 3,501 | 3,789 | 3,891 | 3,746 | 4,056 | 3,890 | 3,519 | 3,787 | 3,647 | 3,540 | 3,465 |
总和 = 44,463。
Agentic Search 的工作原理
Mistral Search Toolkit 提供开放模块,用于在云端或本地摄取、嵌入和索引关键且复杂的数据。Agentic Search 基于该索引,为模型提供五种类似常见文件系统操作的工具:
search使用现有索引在整个语料库中查找相关文档。open打开特定文档。navigate移动到其中的某一页、章节或区域。read检索该位置的内容。grep在打开的文档中查找模式。
模型不再只根据初始 top-k 结果来回答,而是可以检查找到的内容、细化搜索、打开相关文档、导航到特定章节,并在回答前阅读源材料。索引识别可能的来源;Agentic Search 则决定在这些来源内部以及跨来源检查什么。
一次性 RAG

Agentic Search

这些工具不需要微调或针对特定模型的训练。随着模型在推理和工具使用方面变得更强,检索效果也会变得更好,而无需改变基础设施。这是一个关键特性:检索质量会随模型能力而提升,而不是受限于你的分块策略。
Agentic Search 适用于
长文档。 申报文件、合同、手册、技术规格和报告,其中答案可能出现在某一特定页面,或某个特定表格、条款、图表或脚注中。
跨多个来源的问题。 需要模型在得出答案之前,从多份文档中查找、比较或协调证据的研究。
必须验证的答案。 财务数字、法律条款、监管引用和运营数据,这些回答可以引用到稳定且具体的文档位置。
表格和结构化文档。 财务报表、政府记录,以及扫描版 PDF;其含义取决于行、列、页面位置或周围上下文,而不仅仅是叙述性文本。
索引式检索是以下场景的正确起点
直接查找。 简短、整洁的文档,其中答案很可能出现在最先检索到的几个片段之一中。
高容量搜索。 需要返回相关段落、但不需要对其进行推理或在其中导航的关键词或语义查找。
简单、可预测的问题。 答案的可能来源和位置事先已知,且额外检索步骤不太可能改善结果的用例。
一次性 RAG 通常足以应对这些搜索。当问题需要模型超越初始结果并调查源材料时,可加入 Agentic Search。在这两种情况下,配置良好的索引仍然是正确的基础。
更相关的结果,更快获得
我们使用开箱即用的 Mistral Search Toolkit 技术栈,在两项行业标准评测上对 Agentic Search 进行了基准测试:默认分块、默认排序、不做调优。这些结果是下限,而不是上限, 这意味着你可以通过针对具体用例的调优进一步提升结果质量。
在这些基准测试中,我们使用 Mistral Search Toolkit 测试了两个模型:Mistral Medium 3.5(MM 3.5)和 Z.ai GLM-5.2(GLM-5.2),展示了较小模型(MM 3.5)和较大模型(GLM-5.2)的性能。
基准测试结果一致:Agentic 循环带来了实质性的质量提升,导航工具在减少浪费的 token、轮次和延迟的同时提高了准确率。我们在第一方和第三方模型上观察到了相同的性能模式,这表明 Agentic Search 与模型无关,并且搜索质量应会随着新模型而提升。
FinanceBench:368 份 SEC 申报文件,150 个问题
FinanceBench(Islam 等,2023)测试的是针对 368 份 SEC 申报文件(10-K / 10-Q / 8-K)的金融问答;每份平均约 147 页,总计约 53,900 页:这些是篇幅很长、包含大量表格的金融文档。答案由经过人工标签校准的 LLM 评审进行评分。
我们的发现:
仅搜索的 Agentic 循环是最大的质量杠杆。 从一次性 RAG 转向仅搜索循环,使 MM 3.5 的准确率提升 +47.3pp,GLM-5.2 提升 +52.6pp——两个模型均约提升 3 倍。由于模型可以迭代搜索,它们能够从较弱的首次结果中恢复,优化查询,并将索引用作主动工具。
导航会提高准确率。 加入 open、navigate、read 和 grep 后,准确率再次提升(MM 3.5 为 +8.7pp,GLM-5.2 为 +6.7pp)。这意味着在复杂文档中,有针对性的深入搜索优于反复进行宽泛搜索。
更好的检索工具提升了 token 和性能效率。 带有导航的完整循环能正确回答更多问题,同时比仅搜索循环使用更少 token(MM 3.5:-23.9% token 使用量,GLM-5.2:-33.7%)。检索工具并非额外开销——它们用精准导航取代了浪费性的搜索重试。
关键之处的延迟降低了。 在 FinanceBench 上,加入导航检索工具可改善延迟:p90 从 255s → 154s,平均延迟从 108s → 71s。总体而言,我们看到仅搜索的循环会进行反复的宽泛搜索,而导航有助于模型更快地识别证据。
OfficeQA Pro:696 份财政部公报,133 个问题
OfficeQA Pro 是一个基于历史美国财政部公报的可验证数值基准:在一个包含 696 份文档、约 89,000 页的语料库中,涵盖扫描版、表格密集的政府金融 PDF。我们报告了 133 个问题的 "pro" 子集的首次测试结果。
我们发现:
Agentic Search 和 Agentic loop + Navigation 在更困难、可验证的基准上表现成功。 OfficeQA Pro 包含数值答案、扫描版 PDF 和深度表格查找。即便在这里,完整的 agentic loop 也能将准确率从一次性 RAG 显著提升,GLM-5.2 达到 51.9%(+45.6pp),MM 3.5 增加 +27.1pp。
导航在减少浪费的同时提升质量。 使用完整循环(Agentic loop + Navigation)可将准确率提升高达 35.6% (+7.5pp,MM 3.5;+8.3pp,19.0% GLM-5.2),同时减少 token 消耗。轮次下降高达 7.0%(MM 3.5,2.3% GLM-5.2)。
基准越难,检索循环就越重要。 OfficeQA Pro 围绕扫描版、表格密集型文档中的数值答案构建。一次性 RAG 几乎难以起步,而 agentic loop 允许模型迭代搜索、检查证据,并带来显著的准确率提升。
工具栈对文档智能和搜索性能产生显著影响。 根据 Kimi research,GLM-5.2 在 Claude Code harness 上的 OfficeQA Pro 得分为 41.4%,而在 Mistral harness 上为 51.9%——同一底层模型提升 +10.5pp。
开始使用
在文档中了解更多关于 Agentic Search 的信息。你可以通过以下任一方式,在云端和本地部署中开始使用:
Mistral Search Toolkit。将 Agentic Search 集成到你自己的智能体、工作流和客户部署中。
Libraries。在 Studio 和 Vibe 中开箱即用地使用 Agentic Search,无需自己构建检索系统。
测试 Search Toolkit 的最快方式是使用 Search Starter App。它会使用默认配置为你自己的语料库创建本地索引,因此你无需成为搜索专家也能试用 Agentic Search。当你准备好配置自己的用例时,你可以:
来源:Mistral AI · mistral.ai