Small 4 との比較

Mistral Large 4 vs Mistral Small 4

同じ8つのプロンプト、同じ設定で、2026年10月9日にMistral API経由で両モデルを実行しました。Large 4 は8タスク中6つでより良い結果を出し、2つは同点でした。Small 4 は全タスクを29.8秒で完了し、Large 4 は55.1秒かかりました。また、コストは6分の1でした。以下に、すべてのタスク、どちらが優れていたか、その理由を掲載します。

2026-10-09 更新・執筆:suifeng

人気のプロンプト

チャットを開く

全画面チャットが開きます。会話はアカウントに保存されます。

Mistral Large 4 の基本データ

開発元
Mistral AI(フランス・パリ)
リリース
2026年10月6日(パブリックプレビュー)
パラメータ数
総数1.05兆、1トークンあたり49Bがアクティブ(Mixture of Experts)
コンテキスト長
API で524,288トークン
最大出力
262,144トークン
入力/出力
テキストと画像を入力、テキストを出力
API 料金(セール中)
100万トークンあたり入力$0.68/出力$2.09(通常価格 $1.36/$4.18)
API モデル名
mistral-large-4
推論モード
reasoning_effort: "high" または "none"
オープンウェイト
2026年10月末に公開予定

出典:Mistral AI の発表と料金ページ、OpenRouter のモデル掲載情報、Hugging Face のモデルページ(2026年10月6日確認)。

なぜこの比較を行ったのか

当サイトの無料チャットでは、新規アカウントの最初の3回の返答を Mistral Large 4 で行い、その後は Mistral Small 4 に切り替わります。Pro およびクレジットパックは Large 4 のままです。ベンチマーク表ではなく実際のタスクで、大きいモデルがいつその価格に見合う価値があるのかを知りたかったのです。定価では、Large 4 は入力100万トークンあたり $1.36、出力100万トークンあたり $4.18、Small 4 は $0.15 と $0.60 で、入力で約9倍、出力で約7倍の差があります。

方法:実際の業務のように見える8つのプロンプト(なぞなぞではなく)を、チャット補完API経由で mistral-large-4 と mistral-small-2603 にそれぞれ1回ずつ送信しました。reasoning_effort は none に設定し、temperature 0.2、出力上限は1,500トークンです。時間はアジアの1台のマシンからの実測時間なので、絶対値は異なる場合があります。2つのモデル間の比率が重要です。プロンプトごとに1回の実行なので、小さな差はノイズとして扱ってください。

スコアボード

Large 4 は完全性と指示への従順さが重要な場面で勝ち、Small 4 は明確に定義された変換タスクで同等であり、2〜3倍高速です。

タスクMistral Large 4Mistral Small 4より良い回答理由
契約条項のリスク13.3 s(初回トークン 1.4 s)、607トークン3.7 s(初回トークン 0.6 s)、469トークンLarge 45つのリスクをそれぞれ該当する正確な文言と結びつけて提示。Small 4 は3つ見つけ、文全体を引用
2四半期の比較6.8 s(初回トークン 0.8 s)、373トークン3.1 s(初回トークン 0.6 s)、375トークン同点両方とも粗利益($2.56M / $2.30M)と営業利益($0.46M / $0.60M)を正しく算出。Large 4 はより鋭い質問を投げかけ
Pythonコードレビュー10.5 s(初回トークン 0.8 s)、1042トークン4.6 s(初回トークン 0.6 s)、785トークンLarge 4両方ともインジェクション、オフバイワン、接続漏れを発見。Large 4 はコンテキストマネージャーと名前付きカラムで修正
2,800トークンのページから価格を抽出3.2 s(初回トークン 1.0 s)、234トークン3.8 s(初回トークン 0.7 s)、488トークンLarge 4Large 4 は要求された4モデルを列挙。Small 4 はLarge 4の価格帯を列挙。両方ともワークロードの価格は正しく算出
乱雑なテキストをJSONに3.0 s(初回トークン 1.0 s)、195トークン1.9 s(初回トークン 0.6 s)、201トークン同点1セント単位まで同一の数値。Small 4 の方が高速
慣用句を含む翻訳5.4 s(初回トークン 1.9 s)、255トークン3.3 s(初回トークン 0.7 s)、279トークンLarge 4Large 4 は4言語すべてで慣用句を翻訳。Small 4 は日本語版で「heads up」を英語のまま残置
スケジューリングパズル10.9 s(初回トークン 0.9 s)、830トークン8.7 s(初回トークン 0.6 s)、1500トークン、途中で切断Large 4Large 4 はケース分析で唯一の有効な順序 A-D-B-C-E を発見。Small 4 は1,500トークン上限に達し2番目のケースの途中で終了
マーケティングコピーの書き換え2.0 s(初回トークン 1.2 s)、24トークン0.8 s(初回トークン 0.6 s)、38トークンLarge 4Large 4:22語、誇張なし。Small 4 は「Boost」「innovate daily」を使用
2026年10月9日の当サイト独自の実行結果。Mistral API、reasoning_effort none、temperature 0.2、出力最大1,500トークン、プロンプトごとに1回の実行。

Large 4 が明らかに優れていた場面

6つの勝利に共通するパターン:Large 4 はプロンプトが文字通り求めたことを行い、仕事が完了するまで続けます。Small 4 は質問の大まかな形に答えます。

  • 契約条項:各リスクをそれを生み出す正確な文言とともにすべて列挙するよう求めたところ、Large 4 は5つのリスク(3つの終了条項の複合効果を含む)を列挙し、それぞれに正確な断片を引用した上で、30日間の通知と日割り支払いを含む完全な代替条項を作成しました。Small 4 は3つのリスクを列挙し、文全体を引用し、書き換えでは「[X days]」を残しました。
  • コードレビュー:両方ともSQLインジェクション、最初の行を飛ばすループ、閉じられていない接続を発見しました。Large 4 の修正はコンテキストマネージャー、名前付きカラムを持つ sqlite3.Row、「is not None」を使用し、空のステータス文字列でもフィルタリングされるようにしました。Small 4 は位置インデックスを維持し、「if conn in locals()」チェックで接続を閉じました。
  • 長いページからの抽出:プロンプトには当サイトの2,800トークンのAPI価格ページを貼り付け、すべてのMistralモデルと100万トークンあたりの価格を求めました。Large 4 は4つのモデル(Large 4、Large 3、Medium 3.5、Small 4)を返しました。Small 4 はLarge 4の価格帯(バッチ、優先、地域)の10行を返し、他のモデルはありませんでした。その後、両方とも50M入力・5M出力トークンを正しく価格設定しました:定価 $88.90、セール時 $44.45。
  • 慣用句を含む翻訳:「heads up」と「swamped」をLarge 4 はフランス語、ドイツ語、スペイン語、日本語で慣用的に翻訳しました。Small 4 は3つのヨーロッパ言語では問題ありませんでしたが、日本語の文の中で「heads up」を英語のまま残し、それについて注記を加えました。
  • スケジューリングパズル:5つの講演、5つの制約。Large 4 はA-Dブロックの4つの配置を検討し、830トークンで唯一の有効な順序 A-D-B-C-E を発見しました。Small 4 は制約を長々と説明し、2番目のケースを終える前に1,500トークン上限に達しました。
  • 制約付きコピーライティング(60語、誇張語なし):Large 4 は22語の平易な文章を返しました。Small 4 は「Boost team productivity」で始まり「innovate daily」で終わる30語を返しました。

Small 4 が同等に優れていた場面

2つのタスクは同点で、どちらもSmall 4 の方が高速でした。請求書からJSONへの変換は、両モデルから1セント単位まで同一の結果が返ってきました(小計 2,580、税 490.20、合計 3,070.20)。Small 4 は1.9秒、Large 4 は3.0秒でした。2四半期の財務比較では、両方から同じ粗利益と営業利益が得られました。Large 4 の3つのCFO向け質問はより具体的でした(マージン低下がミックスシフトか価格圧力かを尋ねるなど)。Small 4 の質問も十分でした。

速度:Small 4 はすべてのタスクで0.6〜0.7秒後に回答を開始しました。Large 4 は初回トークンまで0.8〜1.9秒かかり、完了までに約2〜3倍長くかかりました。短く明確に定義された仕事では、待ち時間が唯一の犠牲です。

この内容について質問がありますか?

Mistral Large 4 に直接聞いてみましょう。無料アカウントなら毎日15クレジット使えます。

今すぐ質問する

各回答のコスト

トークン数はAPI自身の使用量の数値です。ドルはMistralの定価です(実行時、Large 4 は期間限定50%セール中だったため、その欄は半額になっています)。当サイトでは、このテストのすべての回答がどちらのモデルでも1クレジットで済みました。1クレジットは無料プランのレートでモデルコスト約 $0.0067 までをカバーするためです。価格差は長い返答や長いドキュメントでのみ現れます。

タスクLarge 4 トークン 入力 / 出力Large 4 コストSmall 4 トークン 入力 / 出力Small 4 コスト比率
契約条項のリスク84 / 607$0.002797 / 469$0.00039x
2四半期の比較97 / 373$0.0017119 / 375$0.00027x
Pythonコードレビュー136 / 1042$0.0045149 / 785$0.00059x
2,800トークンのページから価格を抽出2823 / 234$0.00483149 / 488$0.00086x
乱雑なテキストをJSONに122 / 195$0.0010150 / 201$0.00017x
慣用句を含む翻訳69 / 255$0.001281 / 279$0.00026x
スケジューリングパズル71 / 830$0.003683 / 1500$0.00094x
マーケティングコピーの書き換え78 / 24$0.000294 / 38$0.00006x
全8タスク3480 / 3560$0.01963922 / 4135$0.00316x
2026年10月9日のMistral APIによる使用量。価格は同日のMistral価格ページより(Large 4 $1.36 / $4.18、Small 4 $0.15 / $0.60、100万トークンあたり、定価)。

どちらを使うべきか

出力形式が固定されていて入力が短い場合は Small 4 をお使いください:テキストをJSONや表に変換する、明示的に指定したフィールドを抽出する、与えた数値の簡単な計算、主要なヨーロッパ言語間の短い翻訳などです。確認せずに回答をそのまま使う場合は Large 4 をお使いください:法務・契約書のレビュー、出荷するコード、長いドキュメントで「すべて」の項目を求めるもの、制約パズル、慣用句が重要な日本語などの言語、厳格なルールの下での文章作成などです。

当サイトのチャットでは、無料プランは最初の3回の返答を Large 4 で行い、ご自身のタスクで違いを確認していただけます。その後は Small 4 に切り替わります。クレジットパックまたは Pro をご利用の場合は、すべての返答が Large 4 になります。価格ページには両方が掲載されています。

再現方法

両モデルは同じ方法で呼び出します。モデル名だけが変わります。これが使用したリクエストです。APIキーは除いてあります。

# MISTRAL_KEY holds your Mistral Studio API key (set it in your shell)
curl https://api.mistral.ai/v1/chat/completions \
  -H "Authorization: Bearer $MISTRAL_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mistral-large-4",
    "messages": [{"role": "user", "content": "I am a freelance designer. List every risk in this clause for me, quoting the exact words that create each risk, and rewrite the clause so it is fair to both sides: ..."}],
    "reasoning_effort": "none",
    "temperature": 0.2,
    "max_tokens": 1500
  }'
# then the same call with "model": "mistral-small-2603"

FAQ

Small 4 との比較のよくある質問

あわせて読みたい

Mistral Large 4 についてもっと見る

Mistral Large 4 に、実際の課題を聞いてみましょう

バグのあるコード、契約書の条文、ごちゃごちゃした表のメモなどを貼り付けるだけ。無料アカウントなら毎日15クレジット使えます。

無料で始める