ベンチマーク

Mistral Large 4 のベンチマーク:公式発表と第三者評価

Mistral AI のリリース時の発表によると、Mistral Large 4 は DeepSWE v1.1 で61.7%、Cybench で93%、Harvey の Legal Agent Benchmark で15.8%を記録しました。一方、第三者の総合指標では中位にとどまり、Artificial Analysis Intelligence Index は38(225モデル中64位)、Vals Index は48.05%(44モデル中32位)です。はっきり優位なのはサイバーセキュリティ、法務エージェント、画像内の物体特定で、総合的な知能指標では GPT-6 Astra や Claude Opus 5.5 が上回っています。

2026-10-07 更新・執筆:suifeng

Mistral Large 4 の基本データ

開発元
Mistral AI(フランス・パリ)
リリース
2026年10月6日(パブリックプレビュー)
パラメータ数
総数1.05兆、1トークンあたり49Bがアクティブ(Mixture of Experts)
コンテキスト長
API で524,288トークン
最大出力
262,144トークン
入力/出力
テキストと画像を入力、テキストを出力
API 料金(セール中)
100万トークンあたり入力$0.68/出力$2.09(通常価格 $1.36/$4.18)
API モデル名
mistral-large-4
推論モード
reasoning_effort: "high" または "none"
オープンウェイト
2026年10月末に公開予定

出典:Mistral AI の発表と料金ページ、OpenRouter のモデル掲載情報、Hugging Face のモデルページ(2026年10月6日確認)。

ひと言でまとめると

Mistral Large 4 が最も強いのは、セキュリティ業務、法務・金融エージェント、画像内の物体の指し示しです。幅広い知能を測る総合指標では平均的な位置にあります。この傾向は、Mistral 自身のグラフでも第三者のリーダーボードでも共通しています。

  • セキュリティ:CyberGym-E2E で82%、Cybench で93%。Mistral が比較したすべてのオープンウェイトモデルを上回っています。
  • 法務:Harvey の Legal Agent Benchmark で15.8%。Vals AI では75モデル中6位で、GPT-6 Astra(5.4%)を上回りました。
  • コーディングエージェント:DeepSWE v1.1 で61.7%。DeepSeek V4 Pro 0813(57)や Qwen3.8 Max(51)より高く、Kimi K3(68)よりは低い結果です。
  • 画像:Dense200 のグラウンディングで42.0。GPT-6 Astra(41.5)をわずかに上回っています。
  • 総合:Artificial Analysis のスコアは38。Claude Opus 5.5(58)や GPT-6 Astra(53)には及ばないものの、DeepSeek V4 Pro(36.0)を上回っています。

コーディング・エージェント系ベンチマーク(Mistral 公表値)

コーディングエージェントでは、Large 4 は DeepSeek V4 Pro や Qwen3.8 Max に勝つ一方、一部のテストでは GLM-5.3 や Kimi K3 に及びません。Mistral はこれらを Artificial Analysis のハーネスで実行し、各競合はそれぞれ推奨のエージェントツール(たとえば Qwen3.8 Max は Claude Code、DeepSeek は Codex)を使っているため、小さな差は僅差と考えるのが妥当です。

Mistral は総合の Coding Agent Index を49.8%と発表しています。Surge AI によるコーディング回答のブラインド人手評価では5点満点中3.74点で、Kimi K3(3.59)や GLM-5.3(3.60)を上回り、Claude Opus 5(4.22)には届きませんでした。

ベンチマークMistral Large 4DeepSeek V4 Pro 0813Qwen3.8 MaxGLM-5.3Kimi K3
DeepSWE v1.161.7%57516168
Terminal-Bench 4.028.3%10174021
SWE-Atlas-QnA59.4%66625962
AutomationBench(657ワークフロー)59.9%56.757.2(2.4T A95B)62.258.3
Surge AI 人手評価・コーディング(1〜5)3.74--3.603.59
出典:Mistral AI による Mistral Large 4 の発表(メーカー公表値、プレビュー版モデル、2026年10月6日確認)。

サイバーセキュリティ・安全性のベンチマーク

Large 4 が最も際立つのはサイバーセキュリティです。実在する脆弱性を再現してからパッチを当てる CyberGym-E2E では82%を記録しました。Mistral によれば、Claude Opus 5.5 と GPT-6 Astra はタスク自体を拒否するためスコアがほぼゼロになっています。Artificial Analysis の Cyber Index では50件のタスクを達成し、GPT-6 Astra の33件、Claude Opus 5.5 の29件を上回りました。

明らかに有害なリクエストはきちんと拒否します。JailbreakBench、StrongREJECT、AgentHarm の平均は95.3、Lakera の B3 エージェントセキュリティテストでの攻撃耐性は93.3%です。Mistral は、サイバーセキュリティの主要企業、審査済みのパートナー、政府機関に対し、ウェイト公開前のレッドチーミング用としてモデレーションを緩めたビルドを提供しています。

ベンチマークMistral Large 4最も高い競合その他の競合
CyberGym-E2E(再現+パッチ)82%MiMo-V2.6-Pro 79Grok 4.7 74、Kimi K3 58、GLM-5.3 29
Cybench(CTF 40タスク)93%Kimi K3 90DeepSeek V4 Pro 0813 88、GLM-5.3 85
AA Cyber Index(成功数)50GLM-5.3-Flash 50Kimi K3 41、GPT-6 Astra 33、Claude Opus 5.5 29
有害なサイバー系リクエストの拒否(平均)95.3Kimi K3 93.7GLM-5.3 87、DeepSeek V4 Pro 0813 77.7
B3 Agent Security(Lakera)93.3%GLM-5.3 93.3Kimi K3 88.1、DeepSeek V4 Pro 0813 85.2
出典:Mistral AI による Mistral Large 4 の発表グラフ(メーカー公表値、2026年10月6日確認)。

金融・法務・科学・画像

専門業務では、Large 4 は法務エージェントではっきりリードし、金融と科学でも上位と競っています。Harvey の Legal Agent Benchmark の15.8は、GPT-6 Astra の5.4の約3倍です。Finance Agent v2 では54.7で、GPT-6 Astra(53.5)をわずかに上回り、GLM-5.3(55.8)をわずかに下回りました。

画像では、グラフの読み取りや物体の位置特定が得意です。バウンディングボックスの正確さを測る Dense200 では42.0で、GPT-6 Astra の41.5、Kimi K3 の28.9を上回りました。ChartQA Pro は63.1で、GPT-6 Astra(65.1)をやや下回っています。

ベンチマークMistral Large 4GPT-6 AstraKimi K3DeepSeek V4 Pro / V4.1 Flash
Harvey の Legal Agent Benchmark15.85.412.97.5(Pro)
Finance Agent v254.753.553.150.4(Pro)
Finch(FinWorkBench)67.457.077.367.4(Pro)
SciCode-Verified pass@191.894.290.391(Pro)
Dense200 ビジュアルグラウンディング42.041.528.93.3(V4.1 Flash)
ChartQA Pro63.165.161.759.9(V4.1 Flash)
GDP.pdf18.6-2212.8(V4.1 Flash)
出典:Mistral AI による Mistral Large 4 の発表(メーカー公表値、2026年10月6日確認)。

この内容について質問がありますか?

Mistral Large 4 に直接聞いてみましょう。無料アカウントなら毎日15クレジット使えます。

今すぐ質問する

第三者評価:Artificial Analysis

Artificial Analysis は、Intelligence Index v4.3.2 で Large 4 に38をつけ、225モデル中64位、オープンウェイトモデルの中では8位としています。DeepSeek V4 Pro(36.0)や GLM-5.2(33.7)より上位で、GLM-5.3(45)や MiMo-V2.6-Pro(46)より下位です。

速いものの、回答は長めです。出力速度は毎秒116.1トークンで中央値87を上回る一方、インデックスを完了するのに2億(200M)出力トークンを使っており、中央値の8,100万(81M)を大きく超えています。そのため長い回答は費用と待ち時間に影響します。なお、ウェイトがまだ公開されていないため、Artificial Analysis では現在プロプライエタリモデルとして掲載されています。

指標Mistral Large 4比較の目安
Intelligence Index v4.3.238(225モデル中64位)Claude Opus 5.5 58、GPT-6 Astra 53、Gemini 4 Argon 53、GPT-6.1 Sol 52
オープンウェイト内の順位8位DeepSeek V4 Pro 36.0、GLM-5.2 33.7
出力速度116.1トークン/秒(51位)中央値 87トークン/秒
最初のトークンまでの時間1.46秒-
インデックス全体の出力トークン200M中央値 81M
インデックスのタスク単価(通常価格)$1.13-
出典:Artificial Analysis のモデルページと、AA データをまとめた trendingtopics.eu の記事(2026年10月6日確認)。

第三者評価:Vals AI

Vals AI では、Mistral Large 4 は Vals Index v2.1 で48.05%、44モデル中32位です。Qwen 3.8 Max(48.27%)や DeepSeek V4 Pro 0813(47.63%)とほぼ横並びで、首位は Gemini 4 Argon の68.90%、次いで Claude Opus 5.5 の66.97%です。

Vals で最も順位が高いのは法務と金融の業務で、最も低いのは形式的な証明とパズル型の科学推論です。

Vals のベンチマークスコア順位
Vals Index v2.148.05%44モデル中32位
Harvey の Legal Agent Benchmark15.83%75モデル中6位
BioMysteryBench67.04%24モデル中17位
Vibe Code Bench 1-10014.26%21モデル中16位
Terminal-Bench 4.022.73%44モデル中20位
Finance Agent v254.68%75モデル中22位
Tax Agent Bench63.29%66モデル中25位
Vibe Code Bench v1.178.40%109モデル中25位
IOI45.28%41モデル中28位
Code Migration30.56%74モデル中38位
ProofBench v1.110.00%47モデル中42位
MysteryMechanism12.16%24モデル中24位
出典:Vals AI の Mistral Large 4 モデルページと Vals Index(2026年10月6日確認)。

スコアの読み方

メーカー公表のスコアと第三者のスコアは、答えている問いが異なります。モデルを選ぶ前に、両者の差を知っておくと判断を誤りにくくなります。

  • Terminal-Bench 4.0 はハーネスによって結果が変わります。Mistral が Artificial Analysis で実行した結果は28.3%、Vals AI では22.73%でした。
  • Mistral は SciCode-Verified の結果をオープンウェイトモデルの最高水準としていますが、同社のグラフ自体では MiMo-V2.6-Pro(91.9)、GLM-5.3(92.5)、Qwen3.8 2.4T A95B(93.8)が Large 4 の91.8を上回っています。
  • GLM-5.3 に対する社内専門家評価での勝率は、分野別グラフで STEM が68%、内訳グラフでは69%です。CAD は62%、金融は50%、コードは48%でした。
  • Mistral の数値はすべて2026年10月6日公開のプレビュー版のものです。正式なウェイトが公開された後にスコアが変わる可能性があります。
  • 推論の強さは、使い方によっては品質より費用に効きます。Hacker News で Simon Willison 氏は、自身のテストでは reasoning_effort の "high" と "none" でほとんど差がなかったと報告しています。

自分のプロンプトで試してみる

ベンチマークが示すのは平均値で、大切なのはあなた自身のプロンプトでの結果です。当サイトのトップページのチャットなら、コーディング、法務、金融の質問をそのまま Mistral Large 4 に送れます。無料アカウントは毎日15クレジット使えます。この性能でのトークン費用は「API料金」ページで詳しく解説し、「DeepSeek V4 との比較」「Mistral Large 3 との比較」ガイドでは直接対決の結果をまとめています。

出典

FAQ

ベンチマークのよくある質問

あわせて読みたい

Mistral Large 4 についてもっと見る

Mistral Large 4 に、実際の課題を聞いてみましょう

バグのあるコード、契約書の条文、ごちゃごちゃした表のメモなどを貼り付けるだけ。無料アカウントなら毎日15クレジット使えます。

無料で始める