返回 文章 apply CMS 文章

Mistral OCR 4 发布:支持边界框与块分类的 SOTA 文档智能模型

Mistral OCR 4 将 OCR 从纯文本提取升级为结构化文档理解,新增边界框、块分类和置信度分数,支持 170 种语言并可自托管。

MistralOCR文档智能RAG
成长分 / 100 80 综合收获、行动、留存与影响

Mistral OCR 4 发布:支持边界框与块分类的 SOTA 文档智能模型
为什么值得读了解 OCR 4 相比前代新增的边界框、块分类和内联置信度分数如何支持 RAG、智能体工作流和结构化数据流水线。

获取其在人类偏好评估、OlmOCRBench 和 OmniDocBench 上的表现数据及已知评分局限性,帮助判断是否适合自身场景。

关键洞察
  1. OCR 4 在提取文本之外返回边界框、类型化块分类(标题、表格、公式、签名等)和内联置信度分数,支持基于来源的引用、脱敏和人工介入验证。
  2. 支持 10 个语系中的 170 种语言,在专业语言和低资源语言上取得可衡量提升,而多个竞争系统在这些语言上表现下降。
  3. 模型足够紧凑,可部署在单个容器中实现完全自托管,满足数据驻留、主权和合规要求,同时支持高性价比、高吞吐量批处理。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:13807

标题

副标题

正文

图片

图片

表格

思考

摘要

Mistral OCR 4 引入了突破性的文档解析能力,具备边界框、块分类和内联置信度分数,支持 170 种语言,并可在单个容器中运行以实现自托管部署。在人工评估和基准测试中,它的表现优于领先的 OCR 系统,同时为企业搜索、RAG 和智能体工作流提供高性价比、高吞吐量的处理能力。它可通过 API 或 Document AI 使用,为自定义流水线或无代码应用提供结构化输出,并提供自托管选项以保障数据隐私。

今天,我们发布 Mistral OCR 4,它在提取文本之外还提供边界框、块分类和内联置信度分数。该模型支持 10 个语系中的 170 种语言,可在单个容器中运行以实现完全自托管部署,并可作为企业搜索、RAG 和特定领域检索流水线的摄取组件。OCR 4 是一个小型、专注的模型,本文将介绍其新增功能、它在公开和内部基准测试中的表现、这些基准测试的已知局限性,以及何时使用模型 API 与 Document AI 的指导。

亮点

突破性表现。独立标注员对 OCR 4 的偏好超过所有已测试的领先 OCR 和文档 AI 系统,平均胜率为 72%,同时在 OlmOCRBench 上取得最高总分(85.20)。方法论和已知评分局限性见下文基准测试部分。不只是文本,还有分割。除提取文本外,OCR 4 还返回边界框、类型化块分类(标题、表格、公式、签名等)和内联置信度分数。边界框是我们最受期待的能力,可定位文本以进行上下文高亮和可靠的数据流水线。同时,块类型和置信度分数可支持基于来源的引用、脱敏和人工介入验证。与 Mistral Search Toolkit 集成(公开预览)。OCR 4 是 Mistral 开源、可组合搜索框架的摄取组件,该框架在 AI Now Summit 上发布。其结构化输出为该工具包的摄取、检索和评估工作流提供可直接引用的输入,用于 RAG 和企业搜索。Search Toolkit多语言覆盖。支持 10 个语系中的 170 种语言,在专业语言和低资源语言上取得可衡量的提升,而多个竞争系统在这些语言上表现下降。在您自己的基础设施上运行。OCR 4 足够紧凑,可部署在单个容器中,将文档数据保留在您的环境中,以满足驻留、主权和合规要求,同时支持高性价比、高吞吐量的批处理。企业客户可使用自管理部署。

概述

Mistral OCR 4 可从多种文档中提取并结构化内容。前几代产品专注于将页面转换为干净的文本和表格,而 OCR 4 返回文档的结构化表示。每个块都通过边界框定位、按类型分类,并按页和按词生成内联置信度分数。因此,下游系统不仅能访问文档说了什么,还能访问每个元素位于何处、扮演什么角色,以及模型对每个区域的置信度如何

该结构支持多种下游工作负载:

面向 RAG 的语义分块:干净、分类的块成为更好的检索单元。面向智能体的结构原语:智能体从阅读文档转向对文档采取行动(表单填写、发票处理、合规检查)。面向连接器的结构化内容:为摄取和索引管道提供一致、类型化的输出。

OCR 4 接受常见的企业格式,包括 PDF、DOC、PPT 和 OpenDocument,并支持 10 个语系中的 170 种语言,包括许多系统处理不佳的专用语言和低资源语言。作为一个可部署在单个容器中的紧凑模型,它适用于成本敏感型和高容量部署。它可以完全自托管运行,允许有数据主权要求的组织将文档数据保留在自己的基础设施内。

开发者通过 API 集成该模型,团队可以在 Mistral Studio 中使用 Document AI 获得应用级、无代码的路径来使用同一引擎。通过 API 使用 Mistral OCR 4 的价格为每 1,000 页 4 美元,批量 API 折扣为 50%,将成本降至每 1,000 页 2 美元。Document AI 的价格为每 1,000 页 5 美元。

基准测试

“我们在一个图表密集的金融问答数据集上,将 Mistral OCR 4 与领先的智能体文档解析器进行了基准测试,达到了同等准确率,成本约低 8 倍,延迟约低 17 倍。对于大规模生产用例,这种差距会迅速累积。”——Aidan Donohue,Rogo AI 工程师

为了评估 OCR 4,我们将其与领先的 AI 原生 OCR 模型、前沿通用模型、企业文档服务以及我们自己的 Mistral OCR 3 进行了比较。

人类偏好评估

自动化基准测试带有上述评分伪影,因此我们辅以针对反映真实使用情况的文档进行的一对一人类评估。我们汇集了来自第三方供应商的 600 多份文档,涵盖 12 种以上语言,以代表真实的行业用例,并让独立标注者逐文档对每个竞争对手的输出与 OCR 4 的输出进行盲排。

在所有测试系统中,标注者在大多数文档中更偏好 OCR 4。由于这些是针对真实文档的人类判断,而非与固定参考的字符串比较,它们避开了影响自动化评分的许多标注和格式噪声。

整体性能

“Mistral OCR 每页速度大约是我们现有供应商的 4 倍,对于速度对管理客户知识产权时间线至关重要的高容量案卷工作流来说,这是一个令人印象深刻的结果。”——Ivan Mihailov,Anaqua AI 工程师

除了在我们的人类偏好中排名第一之外,OCR 4 在我们测试的模型中,在公开的 OlmOCRBench (85.20) 上获得了最高的总体得分,并在我们内部的 Crawl Multilingual 评估 (.98) 中领先,超过了 AI 原生和企业解决方案。

OmniDocBench 上,OCR 4 获得了 93.07 的分数。我们报告这一数字时附带一个说明:OlmOCRBenchOmniDocBench 在如何对某些输出进行评分方面都存在已知局限性,而单一的汇总数字可能既低估又高估真实世界的性能。

当我们审查分数背后的不匹配情况时,大多数并非模型错误,而是基准测试比较输出方式所导致的假象。反复出现的类别包括:

真实标注错误。 一些参考标注本身就不正确:文本缺失或多余、对已脱敏区域的转录,或拼写错误(例如,参考文献中引用的作者姓名拼写错误,但模型从页面上正确读取了该姓名)。输出与源文档匹配,却仍被标记为错误。等效数学符号。 渲染结果相同的不同 LaTeX 会被视为不匹配。渲染出的公式是正确的;字符串比较则不然。公式分段。 一个表达式是作为单个公式输出,还是拆分为多个行内片段,会影响匹配结果,即使渲染内容完全相同,因为匹配器无法对齐这些片段。多栏阅读顺序。 跨栏边界拆分的单词(例如“certifi-cates”)以及栏排序假设,会导致正确的提取结果被评分为阅读顺序错误。块类型归属。 基准测试不期望输出中包含页眉/页脚。为解决此问题,我们在评分前从输出中剥离页眉页脚。但测试随后会检查一个字符串,而该字符串恰好也是页面标题,本应实际存在,却被错误地标记出来。

这些假象集中在数学、科学和多栏文档中,而且它们更常惩罚正确输出,而非奖励错误输出。因此,我们将总体分数视为方向性的,而非确定性的。

这些基准测试是方向性的。所有竞争对手的分数均反映内部复现结果。我们建议在您自己的文档上进行评估。

性能详情

Crawl 多语言细分。 在我们的内部多语言评估中,OCR 4 在所有八个语言组中均领先——英语、西欧、东欧、中东、中文、东亚、东南亚以及特殊语言(印地语、日语、格鲁吉亚语、孟加拉语、亚美尼亚语、希伯来语、希腊语、古吉拉特语、泰米尔语、马拉雅拉姆语、卡纳达语、泰卢固语)。在特殊语言和低资源语言上差距最大,许多竞争系统在这些语言上性能急剧下降,而 OCR 4 仍保持高准确率。

推荐用例

OCR 4 同时支持高吞吐量流水线和交互式文档工作流,包括:

文档解析与提取: 复杂、多语言文档。检索增强生成(RAG): 结构化、已分类、可引用的内容,用于语义分块和基于来源的答案。借助 OCR 4,输出可直接馈入检索流水线。搜索工具包智能体工作流: 为智能体提供结构原语,以完成表单填写、发票处理、合规检查等任务,尤其是在法律、金融服务和医疗保健领域。使用置信度分数的结构化数据流水线,以实现人工验证者的高效利用: 表单/发票提取、脱敏以及合规驱动的流程。企业搜索与知识库: 将 OCR 作为数据源组件,用于自定义摄取和实体提取。

早期用户正在应用 OCR 4 将发票转换为结构化字段、数字化公司档案、从技术和科学报告中提取干净文本,并为企业搜索提供支持。

关于超出适用范围使用的说明。 OCR 4 是一个文档理解模型,而非决策者。它适用于医疗诊断、法律建议或判决、高风险金融决策、安全关键系统、实时/延迟敏感处理,或非文档输入(原始音频、视频等)。

OCR 4 API:了解你的选项

Mistral 的 OCR 4 通过单一 API 端点提供。每个请求都运行相同的底层 OCR 模型,并始终返回提取的内容、边界框、块类型、置信度分数和 Markdown 结构化文本。不同之处在于你在其上叠加了多少层。

在以下情况下,以纯提取模式使用 OCR 4:

将快速、准确的文档提取直接嵌入你的应用程序、智能体或数据管道。

直接处理原始响应、边界框、块类型和置信度分数,以驱动自定义的下游逻辑。

通过 Batch API 运行大批量或批量摄取,完全控制吞吐量和成本。

为严格的数据隐私、主权或合规要求进行自托管。

在以下情况下,激活 Document AI 能力(同一端点,附加参数):

以你定义的 schema 返回结构化 JSON——将 JSON schema 与你的文档一起传递,OCR 输出会被送入

mistral-small-2603

以生成符合你规格的内容。通过传递图像标注 schema,为检测到的图像标注结构化 JSON,从而对每张图像触发一次额外的视觉语言模型调用。

将自定义提示词与 JSON schema 一起使用,以指导如何解释或总结整个文档的提取内容。

使业务用户、解决方案团队或试点项目无需编写下游解析逻辑即可生成结构化结果。

实用的决策规则:如果你需要原始提取内容,就按原样使用 OCR 4。如果你需要将输出重塑为结构化格式、用领域特定字段进行标注,或用自定义指令进行处理,就在同一次调用中添加 Document AI 参数。无论如何你始终会得到 OCR 结果;Document AI 只是在其之上添加结构化层。

现已可用

“Mistral Document AI 与 OCR 4 在 Microsoft Foundry 中的可用性标志着我们合作的一个重要里程碑。我们携手使客户能够将先进的结构化文档理解直接引入其 AI 工作流,将 Mistral 的创新与 Microsoft 的企业平台相结合,为现实世界的业务需求提供可扩展、可信赖的解决方案。”——Kimmi Grewal,Microsoft AI 生态合作副总裁

Mistral OCRv4 和 Document AI(由 OCRv4 驱动)均可通过 API 使用,途径包括

、Amazon SageMaker、

Mistral Studio,以及即将推出的 Snowflake Parse Document。对于有严格数据隐私要求的组织,OCR 4 还提供自托管选项,使敏感信息保留在你自己的基础设施内。如需探索自部署,

Microsoft Foundry

请告知我们开始使用

我们提供几种方式帮助你快速开始并了解更多。

试用 OCR 4。新的

将引导你完成首次提取、处理边界框和块分类。__Getting Started with OCR 4 Cookbook__OCR 4 网络研讨会。我们将于 7 月 7 日中欧时间下午 6:00 通过演示和问答介绍 OCR 4 的新功能。

__注册参加 OCR4 生产环境网络研讨会__以获取更多信息。联系销售