跑分

Mistral Large 4 跑分:官方成绩与独立评测

在 Mistral AI 公布的成绩里,Mistral Large 4 的 DeepSWE v1.1 得分 61.7%,Cybench 93%,Harvey 法律智能体基准 15.8%;而在独立评测的综合排名里,它处于中游:Artificial Analysis 智能指数 38 分(225 个模型中排第 64),Vals Index 48.05%(44 个模型中排第 32)。它最明显的优势在网络安全、法律智能体和视觉定位;在综合智能指数上,GPT-6 Astra 和 Claude Opus 5.5 仍然更高。

更新于 2026 年 10 月 7 日 · 作者 suifeng

Mistral Large 4 关键数据

开发方
Mistral AI(法国巴黎)
发布时间
2026 年 10 月 6 日(公开预览)
参数量
总参数 1.05 万亿,每个 token 激活 49B(混合专家 MoE)
上下文窗口
API 提供 524,288 token
最大输出
262,144 token
输入 / 输出
输入文本和图片,输出文本
API 价格(限时价)
每百万 token 输入 $0.68 / 输出 $2.09(原价 $1.36 / $4.18)
API 模型名
mistral-large-4
推理模式
reasoning_effort: "high" 或 "none"
开放权重
计划 2026 年 10 月底发布

来源:Mistral AI 发布公告和定价页、OpenRouter 模型页、Hugging Face 模型页,核对于 2026 年 10 月 6 日。

一句话总结

Mistral Large 4 最强的是安全任务、法律和金融智能体,以及在图片里定位物体;在综合智能指数上属于中等水平。无论看 Mistral 自己的图表还是独立排行榜,都是这个规律。

  • 安全:CyberGym-E2E 82%,Cybench 93%,领先 Mistral 拿来对比的所有开放权重模型。
  • 法律:Harvey 法律智能体基准 15.8%,在 Vals AI 的 75 个模型中排第 6,高于 GPT-6 Astra(5.4%)。
  • 编程智能体:DeepSWE v1.1 61.7%,高于 DeepSeek V4 Pro 0813(57)和 Qwen3.8 Max(51),低于 Kimi K3(68)。
  • 视觉:Dense200 定位 42.0,略高于 GPT-6 Astra(41.5)。
  • 综合:Artificial Analysis 给它 38 分,低于 Claude Opus 5.5(58)和 GPT-6 Astra(53),但高于 DeepSeek V4 Pro(36.0)。

编程和智能体跑分(Mistral 自报)

在编程智能体任务上,Large 4 胜过 DeepSeek V4 Pro 和 Qwen3.8 Max,但在部分测试里落后于 GLM-5.3 和 Kimi K3。Mistral 用 Artificial Analysis 的测试框架跑这些题,每个对手用各自偏好的智能体工具(例如 Qwen3.8 Max 用 Claude Code,DeepSeek 用 Codex),所以分差很小时,可以视为不相上下。

Mistral 公布的综合编程智能体指数(Coding Agent Index)是 49.8%。在 Surge AI 的编程回答盲评里,评审给它打了 3.74 分(满分 5 分),高于 Kimi K3(3.59)和 GLM-5.3(3.60),低于 Claude Opus 5(4.22)。

基准测试Mistral Large 4DeepSeek V4 Pro 0813Qwen3.8 MaxGLM-5.3Kimi K3
DeepSWE v1.161.7%57516168
Terminal-Bench 4.028.3%10174021
SWE-Atlas-QnA59.4%66625962
AutomationBench(657 个工作流)59.9%56.757.2(2.4T A95B)62.258.3
Surge AI 人工盲评,编程(1-5 分)3.74--3.603.59
来源:Mistral AI 的 Mistral Large 4 发布公告(厂商自报,预览版模型),核对于 2026 年 10 月 6 日。

网络安全和安全性跑分

网络安全是 Large 4 最突出的方向。CyberGym-E2E 要求模型先复现、再修补真实漏洞,它拿到 82%;而据 Mistral 说,Claude Opus 5.5 和 GPT-6 Astra 因为拒绝执行这类任务,得分接近零。在 Artificial Analysis 网络安全指数上,它完成了 50 个任务,GPT-6 Astra 是 33 个,Claude Opus 5.5 是 29 个。

对明显有害的请求,它也会拒绝:在 JailbreakBench、StrongREJECT 和 AgentHarm 上平均 95.3 分,在 Lakera 的 B3 智能体安全测试里抗攻击率 93.3%。在权重公开之前,Mistral 会向网络安全领军机构、经过审核的合作伙伴和政府部门提供一个降低审核强度的版本,用于红队测试。

基准测试Mistral Large 4图中最强对手其他对手
CyberGym-E2E(复现 + 修补)82%MiMo-V2.6-Pro 79Grok 4.7 74,Kimi K3 58,GLM-5.3 29
Cybench(40 个 CTF 任务)93%Kimi K3 90DeepSeek V4 Pro 0813 88,GLM-5.3 85
AA 网络安全指数(成功数)50GLM-5.3-Flash 50Kimi K3 41,GPT-6 Astra 33,Claude Opus 5.5 29
有害网络请求拒绝率(平均)95.3Kimi K3 93.7GLM-5.3 87,DeepSeek V4 Pro 0813 77.7
B3 智能体安全(Lakera)93.3%GLM-5.3 93.3Kimi K3 88.1,DeepSeek V4 Pro 0813 85.2
来源:Mistral AI 的 Mistral Large 4 发布公告图表(厂商自报),核对于 2026 年 10 月 6 日。

金融、法律、科学和视觉

在专业工作上,Large 4 在法律智能体上明显领先,在金融和科学上有竞争力。它在 Harvey 法律智能体基准上的 15.8 分,大约是 GPT-6 Astra(5.4)的三倍。在 Finance Agent v2 上得 54.7 分,略高于 GPT-6 Astra(53.5),略低于 GLM-5.3(55.8)。

在图片方面,它读图表和定位物体都不错。Dense200 衡量模型画边界框有多精准,Large 4 得 42.0 分,GPT-6 Astra 是 41.5,Kimi K3 是 28.9。ChartQA Pro 上它得 63.1 分,略低于 GPT-6 Astra(65.1)。

基准测试Mistral Large 4GPT-6 AstraKimi K3DeepSeek V4 Pro / V4.1 Flash
Harvey 法律智能体基准15.85.412.97.5(Pro)
Finance Agent v254.753.553.150.4(Pro)
Finch(FinWorkBench)67.457.077.367.4(Pro)
SciCode-Verified pass@191.894.290.391(Pro)
Dense200 视觉定位42.041.528.93.3(V4.1 Flash)
ChartQA Pro63.165.161.759.9(V4.1 Flash)
GDP.pdf18.6-2212.8(V4.1 Flash)
来源:Mistral AI 的 Mistral Large 4 发布公告(厂商自报),核对于 2026 年 10 月 6 日。

对这部分有疑问?

直接问 Mistral Large 4。免费账号每天送 15 积分。

马上提问

独立评测:Artificial Analysis

Artificial Analysis 智能指数 v4.3.2 给 Large 4 打了 38 分,在 225 个模型中排第 64,在开放权重模型中排第 8。它排在 DeepSeek V4 Pro(36.0)和 GLM-5.2(33.7)前面,落后于 GLM-5.3(45)和 MiMo-V2.6-Pro(46)。

它速度快,但话多。输出速度每秒 116.1 个 token,中位数是 87;可跑完整个指数用了 200M 输出 token,中位数只有 81M,所以长回答会推高成本,也会拉长等待时间。由于权重还没公开,Artificial Analysis 目前把它列为闭源模型。

指标Mistral Large 4参照
智能指数 v4.3.238(225 个中排第 64)Claude Opus 5.5 58,GPT-6 Astra 53,Gemini 4 Argon 53,GPT-6.1 Sol 52
开放权重模型排名第 8DeepSeek V4 Pro 36.0,GLM-5.2 33.7
输出速度116.1 token/秒(第 51)中位数 87 token/秒
首 token 延迟1.46 秒-
跑完整个指数的输出 token200M中位数 81M
指数单题成本(原价)$1.13-
来源:Artificial Analysis 模型页,以及 trendingtopics.eu 对 AA 数据的汇总,核对于 2026 年 10 月 6 日。

独立评测:Vals AI

Vals AI 的 Vals Index v2.1 给 Mistral Large 4 打了 48.05%,在 44 个模型中排第 32,和 Qwen 3.8 Max(48.27%)、DeepSeek V4 Pro 0813(47.63%)几乎持平。这个指数排第一的是 Gemini 4 Argon(68.90%),其次是 Claude Opus 5.5(66.97%)。

它在 Vals 上排名最好的是法律和金融工作,最弱的是形式化证明和谜题式的科学推理。

Vals 基准得分排名
Vals Index v2.148.05%44 个中第 32
Harvey 法律智能体基准15.83%75 个中第 6
BioMysteryBench67.04%24 个中第 17
Vibe Code Bench 1-10014.26%21 个中第 16
Terminal-Bench 4.022.73%44 个中第 20
Finance Agent v254.68%75 个中第 22
Tax Agent Bench63.29%66 个中第 25
Vibe Code Bench v1.178.40%109 个中第 25
IOI45.28%41 个中第 28
Code Migration30.56%74 个中第 38
ProofBench v1.110.00%47 个中第 42
MysteryMechanism12.16%24 个中第 24
来源:Vals AI 的 Mistral Large 4 模型页和 Vals Index,核对于 2026 年 10 月 6 日。

这些分数怎么看

厂商成绩和独立成绩回答的是不同的问题,选模型之前,最好知道两者之间差在哪。

  • Terminal-Bench 4.0 因测试框架不同而有差异:Mistral 用 Artificial Analysis 框架跑出 28.3%,Vals AI 测出 22.73%。
  • Mistral 称自己的 SciCode-Verified 成绩在开放权重模型中领先,但它自己的图表里,MiMo-V2.6-Pro(91.9)、GLM-5.3(92.5)和 Qwen3.8 2.4T A95B(93.8)都高于它的 91.8。
  • 内部专家对 GLM-5.3 的胜率:领域图里 STEM 是 68%,细分图里是 69%;CAD 62%,金融 50%,代码 48%。
  • Mistral 公布的所有数字都来自 2026 年 10 月 6 日发布的预览版;正式权重发布后,分数可能会变。
  • 对部分用户来说,推理强度影响成本多于影响质量:Simon Willison 在 Hacker News 上说,他的测试里 reasoning_effort "high" 和 "none" 差别不大。

用你自己的问题试一试

跑分是平均值,真正要紧的是你自己的问题。你可以在本站首页的聊天框里,把自己的编程、法律或金融问题发给 Mistral Large 4;免费账号每天 15 积分。这个性能水平对应的 token 成本,在 API 价格页里有详细拆解;和 DeepSeek V4、Mistral Large 3 的正面对比,也各有一篇专门文章。

资料来源

FAQ

跑分常见问题

继续阅读

更多 Mistral Large 4 资料

问 Mistral Large 4 一个真问题

贴一段报错代码、一条合同条款,或者一份乱糟糟的表格备注都行。免费账号每天送 15 积分。

开始聊天