ひと言でまとめると
Mistral Large 4 が最も強いのは、セキュリティ業務、法務・金融エージェント、画像内の物体の指し示しです。幅広い知能を測る総合指標では平均的な位置にあります。この傾向は、Mistral 自身のグラフでも第三者のリーダーボードでも共通しています。
- セキュリティ:CyberGym-E2E で82%、Cybench で93%。Mistral が比較したすべてのオープンウェイトモデルを上回っています。
- 法務:Harvey の Legal Agent Benchmark で15.8%。Vals AI では75モデル中6位で、GPT-6 Astra(5.4%)を上回りました。
- コーディングエージェント:DeepSWE v1.1 で61.7%。DeepSeek V4 Pro 0813(57)や Qwen3.8 Max(51)より高く、Kimi K3(68)よりは低い結果です。
- 画像:Dense200 のグラウンディングで42.0。GPT-6 Astra(41.5)をわずかに上回っています。
- 総合:Artificial Analysis のスコアは38。Claude Opus 5.5(58)や GPT-6 Astra(53)には及ばないものの、DeepSeek V4 Pro(36.0)を上回っています。
