重點整理
Mistral Large 4 最強的是資安工作、法律與財務代理,以及在圖片中精準指出物件;在綜合智力指數上表現中等。不論看 Mistral 自己的圖表還是獨立排行榜,這個輪廓都一致。
- 資安:CyberGym-E2E 82%、Cybench 93%,領先 Mistral 拿來比較的所有開放權重模型。
- 法律:Harvey 法律代理基準測試 15.8%,在 Vals AI 的 75 個模型中排第 6,高於 GPT-6 Astra(5.4%)。
- 程式代理:DeepSWE v1.1 61.7%,高於 DeepSeek V4 Pro 0813(57)和 Qwen3.8 Max(51),低於 Kimi K3(68)。
- 視覺:Dense200 定位 42.0,略高於 GPT-6 Astra(41.5)。
- 綜合:Artificial Analysis 給它 38 分,落後 Claude Opus 5.5(58)和 GPT-6 Astra(53),但領先 DeepSeek V4 Pro(36.0)。
