跑分

Mistral Large 4 跑分:官方成績與獨立評測

根據 Mistral AI 發表時公布的成績,Mistral Large 4 在 DeepSWE v1.1 拿到 61.7%、Cybench 93%、Harvey 法律代理基準測試 15.8%;但在獨立評測的綜合指數上排名居中:Artificial Analysis Intelligence Index 38 分(225 個模型中第 64 名)、Vals Index 48.05%(44 個模型中第 32 名)。它最明顯的領先在資安、法律代理和影像定位;綜合智力指數上,GPT-6 Astra 和 Claude Opus 5.5 的分數仍然比較高。

更新於 2026-10-07 · 作者:suifeng

Mistral Large 4 重點規格

開發商
Mistral AI(法國巴黎)
發表日期
2026 年 10 月 6 日(公開預覽版)
參數量
總計 1.05 兆,每個 token 啟用 490 億(混合專家模型 MoE)
上下文長度
API 提供 524,288 個 token
最大輸出
262,144 個 token
輸入/輸出
可輸入文字和圖片,輸出文字
API 價格(優惠中)
每 100 萬 token 輸入 $0.68/輸出 $2.09(原價 $1.36/$4.18)
API 模型名稱
mistral-large-4
推理模式
reasoning_effort: "high" 或 "none"
開放權重
預計 2026 年 10 月底釋出

資料來源:Mistral AI 官方公告與定價頁、OpenRouter 模型頁、Hugging Face 模型頁,2026 年 10 月 6 日查核。

重點整理

Mistral Large 4 最強的是資安工作、法律與財務代理,以及在圖片中精準指出物件;在綜合智力指數上表現中等。不論看 Mistral 自己的圖表還是獨立排行榜,這個輪廓都一致。

  • 資安:CyberGym-E2E 82%、Cybench 93%,領先 Mistral 拿來比較的所有開放權重模型。
  • 法律:Harvey 法律代理基準測試 15.8%,在 Vals AI 的 75 個模型中排第 6,高於 GPT-6 Astra(5.4%)。
  • 程式代理:DeepSWE v1.1 61.7%,高於 DeepSeek V4 Pro 0813(57)和 Qwen3.8 Max(51),低於 Kimi K3(68)。
  • 視覺:Dense200 定位 42.0,略高於 GPT-6 Astra(41.5)。
  • 綜合:Artificial Analysis 給它 38 分,落後 Claude Opus 5.5(58)和 GPT-6 Astra(53),但領先 DeepSeek V4 Pro(36.0)。

程式與代理跑分(Mistral 自報)

在程式代理上,Large 4 贏過 DeepSeek V4 Pro 和 Qwen3.8 Max,但在部分測試輸給 GLM-5.3 和 Kimi K3。Mistral 用 Artificial Analysis 的測試框架跑這些成績,各對手則用自己偏好的代理工具(例如 Qwen3.8 Max 用 Claude Code、DeepSeek 用 Codex),所以小幅差距可視為不相上下。

Mistral 公布綜合 Coding Agent Index 為 49.8%。在 Surge AI 的程式回答盲測中,評分者給它 3.74 分(滿分 5 分),高於 Kimi K3(3.59)和 GLM-5.3(3.60),低於 Claude Opus 5(4.22)。

基準測試Mistral Large 4DeepSeek V4 Pro 0813Qwen3.8 MaxGLM-5.3Kimi K3
DeepSWE v1.161.7%57516168
Terminal-Bench 4.028.3%10174021
SWE-Atlas-QnA59.4%66625962
AutomationBench(657 個工作流程)59.9%56.757.2(2.4T A95B)62.258.3
Surge AI 程式人工評分(1-5)3.74--3.603.59
資料來源:Mistral AI 的 Mistral Large 4 發表公告(廠商自報,預覽版模型),2026 年 10 月 6 日查核。

資安與安全性跑分

資安是 Large 4 最突出的領域。CyberGym-E2E 要求模型先重現、再修補真實漏洞,它拿到 82%;Mistral 表示 Claude Opus 5.5 和 GPT-6 Astra 因為拒絕執行任務,分數接近零。在 Artificial Analysis Cyber Index 上它完成 50 個任務,GPT-6 Astra 是 33 個,Claude Opus 5.5 是 29 個。

它也會拒絕明顯有害的請求:在 JailbreakBench、StrongREJECT 和 AgentHarm 的平均拒絕分數是 95.3,在 Lakera 的 B3 代理安全測試中抵擋攻擊的比率是 93.3%。在權重釋出前,Mistral 會提供審核寬鬆的版本給資安領導者、經過審核的合作夥伴和政府機關做紅隊測試。

基準測試Mistral Large 4最強對手其他對手
CyberGym-E2E(重現+修補)82%MiMo-V2.6-Pro 79Grok 4.7 74、Kimi K3 58、GLM-5.3 29
Cybench(40 個 CTF 任務)93%Kimi K3 90DeepSeek V4 Pro 0813 88、GLM-5.3 85
AA Cyber Index(成功數)50GLM-5.3-Flash 50Kimi K3 41、GPT-6 Astra 33、Claude Opus 5.5 29
有害資安請求拒絕率(平均)95.3Kimi K3 93.7GLM-5.3 87、DeepSeek V4 Pro 0813 77.7
B3 代理安全(Lakera)93.3%GLM-5.3 93.3Kimi K3 88.1、DeepSeek V4 Pro 0813 85.2
資料來源:Mistral AI 的 Mistral Large 4 發表公告圖表(廠商自報),2026 年 10 月 6 日查核。

財務、法律、科學與視覺

在專業工作上,Large 4 在法律代理明顯領先,財務和科學也有競爭力。它在 Harvey 法律代理基準測試的 15.8 分,大約是 GPT-6 Astra(5.4)的三倍。Finance Agent v2 拿到 54.7,略高於 GPT-6 Astra(53.5),略低於 GLM-5.3(55.8)。

在圖片方面,它很會讀圖表、找物件。Dense200 衡量模型畫邊界框(bounding box)有多精準,Large 4 拿到 42.0,GPT-6 Astra 是 41.5、Kimi K3 是 28.9。ChartQA Pro 拿到 63.1,略低於 GPT-6 Astra(65.1)。

基準測試Mistral Large 4GPT-6 AstraKimi K3DeepSeek V4 Pro / V4.1 Flash
Harvey 法律代理基準測試15.85.412.97.5(Pro)
Finance Agent v254.753.553.150.4(Pro)
Finch(FinWorkBench)67.457.077.367.4(Pro)
SciCode-Verified pass@191.894.290.391(Pro)
Dense200 影像定位42.041.528.93.3(V4.1 Flash)
ChartQA Pro63.165.161.759.9(V4.1 Flash)
GDP.pdf18.6-2212.8(V4.1 Flash)
資料來源:Mistral AI 的 Mistral Large 4 發表公告(廠商自報),2026 年 10 月 6 日查核。

對這個主題還有疑問?

直接問 Mistral Large 4。免費帳號每天 15 點。

馬上問

獨立評測:Artificial Analysis

Artificial Analysis 在 Intelligence Index v4.3.2 給 Large 4 38 分,在 225 個模型中排第 64,在開放權重模型中排第 8。它領先 DeepSeek V4 Pro(36.0)和 GLM-5.2(33.7),落後 GLM-5.3(45)和 MiMo-V2.6-Pro(46)。

它速度快,但話很多。輸出速度每秒 116.1 個 token,中位數是 87;但跑完整套指數用了 200M 個輸出 token,中位數只有 81M,所以長回答會增加費用和等待時間。由於權重還沒公開,Artificial Analysis 目前把它列為專有模型。

指標Mistral Large 4參考對照
Intelligence Index v4.3.238(225 個中第 64 名)Claude Opus 5.5 58、GPT-6 Astra 53、Gemini 4 Argon 53、GPT-6.1 Sol 52
開放權重排名第 8 名DeepSeek V4 Pro 36.0、GLM-5.2 33.7
輸出速度每秒 116.1 token(第 51 名)中位數每秒 87 token
首個 token 延遲1.46 秒-
跑完整套指數的輸出 token200M中位數 81M
每個指數任務的成本(原價)$1.13-
資料來源:Artificial Analysis 模型頁,以及 trendingtopics.eu 對 AA 資料的整理,2026 年 10 月 6 日查核。

獨立評測:Vals AI

Vals AI 的 Vals Index v2.1 給 Mistral Large 4 48.05%,在 44 個模型中排第 32,和 Qwen 3.8 Max(48.27%)、DeepSeek V4 Pro 0813(47.63%)幾乎打平。這個指數的第一名是 Gemini 4 Argon(68.90%),其次是 Claude Opus 5.5(66.97%)。

它在 Vals 排名最好的是法律和財務工作;最弱的是形式化證明和解謎類的科學推理。

Vals 基準測試分數排名
Vals Index v2.148.05%44 個中第 32 名
Harvey 法律代理基準測試15.83%75 個中第 6 名
BioMysteryBench67.04%24 個中第 17 名
Vibe Code Bench 1-10014.26%21 個中第 16 名
Terminal-Bench 4.022.73%44 個中第 20 名
Finance Agent v254.68%75 個中第 22 名
Tax Agent Bench63.29%66 個中第 25 名
Vibe Code Bench v1.178.40%109 個中第 25 名
IOI45.28%41 個中第 28 名
Code Migration30.56%74 個中第 38 名
ProofBench v1.110.00%47 個中第 42 名
MysteryMechanism12.16%24 個中第 24 名
資料來源:Vals AI 的 Mistral Large 4 模型頁與 Vals Index,2026 年 10 月 6 日查核。

怎麼解讀這些數字

廠商分數和獨立分數回答的是不同的問題,選模型之前,值得先了解兩者之間的落差。

  • Terminal-Bench 4.0 的分數因測試框架而異:Mistral 透過 Artificial Analysis 跑出 28.3%,Vals AI 則是 22.73%。
  • Mistral 說它的 SciCode-Verified 成績是開放權重模型中的最高水準,但它自己的圖表上,MiMo-V2.6-Pro(91.9)、GLM-5.3(92.5)和 Qwen3.8 2.4T A95B(93.8)都高於它的 91.8。
  • 內部專家盲評對上 GLM-5.3 的勝率:STEM 在領域圖表上是 68%,在細項圖表上是 69%;CAD 62%、財務 50%、程式 48%。
  • Mistral 的所有數字都是 2026 年 10 月 6 日發表的預覽版成績;正式權重釋出後分數可能會變動。
  • 對部分使用者來說,推理強度影響的是成本多於品質:Simon Willison 在 Hacker News 上表示,他的測試中 reasoning_effort 設 "high" 和 "none" 差別不大。

用你自己的問題試試看

跑分顯示的是平均值,真正重要的是你自己的問題。你可以在我們首頁的聊天框,把自己的程式、法律或財務問題直接丟給 Mistral Large 4;免費帳號每天 15 點。這種效能等級的 token 費用拆解在「API 價格」頁,正面對決則請看「vs DeepSeek V4」和「vs Large 3」兩篇比較。

資料來源

FAQ

跑分常見問題

延伸閱讀

更多 Mistral Large 4 資訊

拿一個真正的問題問 Mistral Large 4

貼上一段出錯的程式、一條合約條款,或一段亂糟糟的試算表備註。免費帳號每天送 15 點。

開始聊天