跳到正文
Mistral AI·· 2 天前精选AI 评分84

Mistral AI 发布 Mistral Large 4 公共预览版

Introducing Mistral Large 4

AI 导读

Mistral AI 发布 Mistral Large 4 公共预览版,这是一个 1 trillion-parameter 原生多模态模型,拥有 52 billion active parameters,可在 Mistral Studio 试用 preview API,并计划在本月底发布权重。

推荐理由

原文披露了参数规模、开放权重计划和多项基准结果,可用于比较欧洲开放权重模型的能力定位。

正文 · AI 翻译

Le Chonk 

今天,我们正在推出 Mistral Large 4 的公开预览版。非正式地说叫 ML4,非常正式地说:le Chonk。ML4 推动开放权重性能的前沿。你今天就可以在 Mistral Studio 上试用预览版 API。权重将于本月底发布。

前沿性能

ML4 是一个拥有 1 万亿参数的原生多模态模型,其中活跃参数为 520 亿。它是我们迄今为止规模最大、能力最强的模型,并且随着我们对其进行优化,它仍在快速提升。

该模型在编码、智能体工作流和多模态理解方面展现出卓越性能。它已经达到了可与全球最强开源模型竞争的性能,同时显著优于任何在美国或欧洲开发的开放权重模型。在关键企业工作负载上,包括网络安全、金融和法律,我们发现它在开放模型中处于最先进水平。在视觉定位等某些领域,它更进一步,甚至超越了前沿闭源模型。

我们将在本月底前发布权重。在此之前,我们正与网络安全领域的领导者、经过审查的合作伙伴以及国家主管机构一起,在真实环境中对该模型进行红队测试;他们将访问同一个模型,但具备更低的审核限制和扩展的网络能力。

在欧洲锻造。为 AI 主权而构建。

ML4 从零开始训练,使用了 Mistral 位于欧洲自有数据中心的 3,800 块 NVIDIA Grace Blackwell GPU。公开预览版也由同一基础设施提供服务。这是我们在基础设施、研究和产品开发方面长期投资的一个重要里程碑:通过开放权重交付关键垂直领域的最先进性能,旨在让客户掌控自己的 AI。

这在网络安全领域尤为重要,因为提供商层面的拒绝可能会阻碍合法的漏洞研究和事件响应,而在事件处理中途失去某项能力的访问权限,本身就可能成为严重的安全风险。ML4 将顶级网络性能与开放权重和自部署相结合,使组织既拥有能力,也拥有自主性,可以在自己的政策下开展高级安全工作。

该模型将在全球多个地区提供,包括由 Mistral 端到端运营的欧洲部署,该部署独立于其他数字服务提供商,并受欧洲法律管辖。有趣的是:ML4 的训练数据中有相当大一部分是多语言数据,覆盖 160 多种语言,包括欧盟的每一种官方语言。 

我们一直与全球金融、工程、制造、物流、制药、科学、航运、公共部门以及其他任务关键型行业的领先企业密切合作,以训练 ML4。事实上,该模型使用的正是我们通过 Mistral Forge 向客户提供的同一套训练、定制和 RL 环境。

今天就试用

后续还会有更多内容。随着我们推进权重发布,我们将分享有关模型架构、更多基准测试以及训练后方法的进一步细节。

该模型也将成为新一代专业化和优化版 Mistral 模型的基础。与此同时,我们邀请你试用预览版 API,并在社交媒体上向我们分享反馈。

能力深度解析

网络安全

ML4 是全球最强的网络安全 AI 模型之一。在 Artificial Analysis Cyber Index 上——这是一项独立评估,衡量 AI 模型在真实软件中发现并修复安全缺陷的能力——它位列全球前五模型之列,并以大幅优势领先中国以外开发的开放权重模型。在该指数的一项测试中,模型需要复现开源软件中的一个真实漏洞并随后进行修补,ML4 得分 82%,为所有模型中的最高分。它还解决了 Cybench 中 93% 的挑战;Cybench 是一组来自安全竞赛的 40 道练习题,这是开放权重模型已报告的最高分之一。

这一最高分体现了实际优势。包括 Claude Opus 5.5 和 GPT-6 Astra 在内的几个领先闭源模型,在同一测试中的得分接近于零,因为它们拒绝执行该任务。然而,防御软件往往始于证明某个缺陷确实存在,而这正是闭源模型中的安全过滤器可能会阻止的工作。随着威胁行为者越来越多地对这些模型进行越狱以支持进攻性网络活动,这一点变得更加重要:防御者需要能够匹配这些能力、同时不受同样拒绝机制约束的系统。ML4 可以完成这类工作,而且其能力超出了明确训练的范围:在内部测试中,它被证明可用于分析恶意软件、确定漏洞优先级,以及编写检测规则。对于需要用于安全运营的主权、可审计 AI 的组织,它将能够在私有云或本地环境中运行。

ML4 对阵同领域模型:高效推理多样化的复杂挑战
恶意软件逆向工程:解决分布外调查任务

智能体式编码

ML4 在软件工程、代码库理解和复杂终端工作流方面表现出色,在 DeepSWE v1.1 上得分 61.7%,在 SWE-Atlas-QnA 上得分 59.4%,在 Terminal-Bench 4 上得分 28.3%。它的综合 Coding Agent Index 得分为 49.8%,领先于 DeepSeek V4 Pro 0813 和 Qwen3.8 Max。

我们还与 Surge AI 一起进行了一项关于编码质量的盲法人类评估:专业标注员在隐藏模型身份的情况下,以 1–5 分的量表对模型输出进行评分。ML4 Preview 在五个模型中排名第二(3.74),领先于 Kimi K3(3.59)、GLM-5.3(3.60)和 GLM-5.2(3.40),仅次于 Claude Opus 5(4.22)。

智能体式工作流

ML4 运行通用智能体,能够在复杂工作流中收集信息、使用工具,并产出完成品。在 AutomationBench 上——它包含 657 个跨 Gmail、Google Sheets、Slack 和 Salesforce 等应用的业务工作流——ML4 得分 59.9%,领先于 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro。

它在知识工作实际产出的专业交付物方面同样强大:电子表格、幻灯片和 PDF。在评估长周期知识工作的 AA-Briefcase 上,它达到 1,393 Elo,领先于 DeepSeek V4 Pro。

多模态

ML4 让我们的模型理解图像的能力实现了阶跃式提升。它能够对复杂文档、图表和自然图像进行强大的推理,并将视觉能力带入感知至关重要的行业,例如工程、制造和地球观测。

该模型还可以进一步将视觉定位与智能体能力结合起来:从检查十亿像素级卫星图像——帮助灾害响应团队在分秒必争时采取行动——到分析工程图纸——放大、检查并验证,直到答案精确无误。在上面的演示中,ML4 能在密集自然场景中进行定位,验证技术图纸中的机械部件,从 PDF 中检索证据,并扫描海量地理空间图像以寻找最难发现的物体。

尤其是在视觉定位方面,我们发现 ML4 是我们测试过的能力最强的模型之一,例如在 Dense 200 上超过了 GPT-6-Astra(42% vs 41%)。

科学与数学

ML4 通过将 AI 驱动的方法与我们研究人员在数学、物理和化学方面的专业知识相结合,具备了强大的科学能力。

它非常擅长面向科学任务的智能体式编码,例如数据分析、建模以及对物理现实的模拟,这让研究人员能够专注于问题本身,而不是底层繁杂工作。在基准测试中,ML4 在开源权重模型中于 SciCode-Verified 上达到了最先进水平。在实践中,它可以一次性生成完整的 Hartree–Fock 模拟——这是一项复杂的多步骤化学任务,由一系列高级例程构成。

ML4 的数学能力也更强,无论是在形式化推理还是应用数学方面。在我们的人类评估中,它的推理比 GLM-5.3 更精确、更有结构,并且能够持续完成长期、特定领域的应用数学任务,包括与前沿理论物理相关的工作。

综合来看,这些能力使 ML4 成为覆盖完整技术工作流程的强大研究助手——从最初的问题到最终结果。

SciCode-Verified 测试模型在物理、数学、材料科学和生物学等领域用代码实现复杂科学工作流的能力。 

ML4 相对于 GLM5.3 在 STEM 任务(数学和物理)上的内部评测

知识工作

ML4 是我们在专业人士每天处理的真实任务方面能力最强的模型。它可以创建、编辑和修复复杂的电子表格和文档,并在法律与金融基准测试中表现出色。

值得注意的是,我们通过第三方评估机构(vals.ai)在具有代表性的法律和金融任务上评估了 ML4,发现该模型在这两类任务中都超过了 GPT-6-Astra。在 HarveyAI 的 Legal Agent 基准测试中,ML4 的表现优于所有开源模型。

FinWorkBench 测试模型在真实金融与会计用例中创建/编辑电子表格的能力。

金融分析需要精确性,以及综合来自多个来源的信息的能力,而这一过程如今在许多金融机构中仍然耗时。在这个演示中,ML4 与其他顶级 OSS 模型应对同一个多步骤企业金融挑战,搜索上市公司申报文件和财务报告,例如可通过 EDGAR 及同等欧洲数据库获取的资料。一张动态语义地图追踪每个模型通往解决方案的过程,突出显示沿途检索到的每一份文档。每条轨迹的位置反映了已收集的证据、计算结果以及仍未解决的问题。观众可以跟随这些调查如何展开,并比较每个模型在得出最终答案前所采取的不同路径。

模型安全

ML4 在我们关于抗间接提示注入鲁棒性的基准测试中已达到饱和表现,使其处于 OSS 模型的前沿(相较于 GLM-5.2、GLM-5.3、Kimi-K2.6、Kimi-K3、DS-V4-Pro-0813)。在 Lakera 公开的 B3 AI Security Benchmark 上,ML4 可抵御 93.3% 的攻击——我们没有看到竞争对手中有更高的分数。

与我们此前的任何模型相比,ML4 也能更负责任地与用户互动。我们重点展示在 KORA Benchmark 上的结果,其中 ML4 再次取得了我们在 OSS 模型中测得的最高分(1.691,满分 2 分,记作“Exemplary”)。 

尤其相关的是,该模型倾向于拒绝有关网络安全的恶意请求。尽管在网络安全基准测试中表现强劲,但该模型在来自 JailbreakBench、StrongREJECT 和 AgentHarm 的网络安全提示上的平均拒答率高于所有 OSS 模型。

人工评估

我们进行了一项内部评估,由编码、计算机辅助设计(CAD)、金融、数学和物理领域的专家标注员将 Mistral Large 4 与 GLM-5.3 进行比较。ML4 在 CAD 和 STEM 方面更受青睐,而在金融和编码方面的表现与 GLM-5.3 持平或接近。

大规模强化学习

基础模型正在快速改进,我们的后训练也必须跟上步伐。为昨天的模型调优的配方,会让今天的前沿模型能力未被充分发挥,因为曾经能把模型推到极限的真实样本如今已不再能做到。我们使用强化学习(RL),因为它会随着模型而适应:我们基于模型自身尝试的结果进行训练,并且可以随着模型变强,提高任务的难度和广度。

我们的 RL 库旨在让新环境易于添加并可大规模训练。一个共享、可组合的接口允许单次训练运行结合从单轮聊天、复杂科学问题求解到安全对齐、事实性和长周期工具使用等各种任务。这些环境共享脚手架和资源,例如代码沙箱、网页搜索和外部 API。同样的可组合性也延伸到验证环节,可根据每项任务的需要组合奖励模型、单元测试、LLM 评审器和静态检查。

在运行时,一个可自动扩缩容的 actor 集群会并行生成数万条 rollout,同时模型训练异步进行。生成和训练流水线针对长轨迹进行了优化,支持跨多次压缩的数百万 token rollout 预算,同时保持较低的陈旧度。两个阶段中的新方法和优化最大限度减少了离策略漂移,并实现了长周期上的稳定 RL。

在我们当前的规模(3k GPUs)下,单次训练运行每天大约产生 33 billion tokens per day,其中经过过滤和掩码后约有 16 billion are trainable completion tokens。我们可以直接在训练 rollout 中看到运行进展:随着策略学会解决日益复杂的任务,训练奖励在几个有代表性的环境中上升。以下是几个示例。

这些改进并非只针对我们训练所用的环境;它们会迁移到下游评估中,而且如下图所示,最终模型的这些改进归功于两个后训练阶段(监督微调和 RL)。

接下来会发生什么

这仅仅是开始。ML4 是我们由 €3 billion D 轮融资资助的路线图上的第一个里程碑——这是欧洲科技公司有史以来最大规模的股权融资。那笔资金已经在投入使用:我们正在大幅扩展自有欧洲数据中心的计算能力,未来几个月还会有更多算力上线。

更多算力意味着更多训练。支撑此次预览版的强化学习运行仍在进行中,而且该模型没有显示出任何饱和迹象——前方仍有相当大的提升空间。随着我们在扩展后的基础设施上扩大训练规模,我们预计未来数周和数月内将出现大幅而快速的改进。

我们将在本月底前发布权重,并公布更多有关架构、额外基准测试以及训练后方法的细节。而 ML4 只是基础:它将作为新一代专门化、优化后的 Mistral 模型的基础,这些模型面向我们的客户最关心的行业和工作负载而构建。

从现在起,进展的速度将会很快。敬请关注。

来源:Mistral AI · mistral.ai