ローカル実行

Mistral Large 4 をローカルで動かす方法

Mistral Large 4 は、まだローカルでは動かせません。Mistral AI は2026年10月末に重みを公開する予定ですが、公開後も総パラメータ1.05兆のこのモデルは、重みだけで FP8 なら約1.05TB、4ビットでも約525GBの GPU メモリが必要です。つまりデスクトップ PC ではなく、複数 GPU を搭載したサーバーが前提になります。

2026-10-07 更新・執筆:suifeng

Mistral Large 4 の基本データ

開発元
Mistral AI(フランス・パリ)
リリース
2026年10月6日(パブリックプレビュー)
パラメータ数
総数1.05兆、1トークンあたり49Bがアクティブ(Mixture of Experts)
コンテキスト長
API で524,288トークン
最大出力
262,144トークン
入力/出力
テキストと画像を入力、テキストを出力
API 料金(セール中)
100万トークンあたり入力$0.68/出力$2.09(通常価格 $1.36/$4.18)
API モデル名
mistral-large-4
推論モード
reasoning_effort: "high" または "none"
オープンウェイト
2026年10月末に公開予定

出典:Mistral AI の発表と料金ページ、OpenRouter のモデル掲載情報、Hugging Face のモデルページ(2026年10月6日確認)。

今すぐ Mistral Large 4 をローカルで動かせますか?

いいえ。2026年10月6日時点で、Hugging Face のリポジトリ mistralai/Mistral-Large-4.0-1T05-A52B は「近日公開」となっており、ファイルはありません。Mistral のリリース記事では今月末までの公開が約束されており、Hugging Face のページには公開予定日として10月31日が表示され、複数のメディアは10月27日と報じています。

ライセンス、ファイルの精度(BF16、FP8、4ビット形式のいずれか)、推奨ハードウェアはまだ発表されていません。以下はすべて公表済みのパラメータ数からの計算なので、今のうちにハードウェアの予算を立てておき、公開日に正確なファイルサイズを確かめる、という使い方ができます。

モデルを使いたいだけなら、こうした準備は必要ありません。当サイトのトップページなら、無料アカウントで毎日15クレジットを使って、今すぐ Large 4 とチャットできます。

精度ごとの重みのメモリ量

重みのメモリ量は「パラメータ数 × 1パラメータあたりのバイト数」で単純に求められます。Large 4 の総パラメータは1.05兆(1.05e12)で、Mixture of Experts(MoE)モデルでは1トークンに使うのが49Bだけでも、すべてのエキスパートをメモリに載せておく必要があります。

実際の量子化ファイルは、スケーリング係数も保存するため、純粋なビット数からの計算より少し大きくなります。たとえば1重みあたり平均4.5ビットの形式なら、525GBではなく1.05e12 × 4.5 / 8 = 590.6GBです。1.6Bパラメータのビジョンエンコーダーはわずかで、BF16 で1.6e9 × 2バイト = 3.2GBです。

精度1パラメータあたりのバイト数計算式重みのみ
BF16 / FP1621.05e12 × 2≈ 2,100 GB(2.1 TB)
FP8 / INT811.05e12 × 1≈ 1,050 GB
6ビット0.751.05e12 × 0.75≈ 788 GB
4ビット(NVFP4、Q4クラス)0.51.05e12 × 0.5≈ 525 GB
3ビット0.3751.05e12 × 0.375≈ 394 GB
2ビット0.251.05e12 × 0.25≈ 263 GB
出典:Mistral Docs と Hugging Face のリポジトリ名にある総パラメータ1.05兆をもとに当サイトで計算。重みのみ(2026年10月6日確認)。

Mistral Large 4 が収まる GPU 構成

FP8 を1ノードで動かすなら、最も余裕があるのは B200 8基の構成です。H200 8基でも FP8 の重みは収まりますが、残りは約78GBしかありません。H100 8基で動かせるのは4ビットのみです。下の表では、各構成の合計メモリと重みのサイズを比べ、KV キャッシュや実行時のオーバーヘッドに使える残りを示しています。

BF16 の重みを載せるには、H200 8基のノードが2台必要です。512GB のユニファイドメモリを持つワークステーションでは4ビットの重みも収まらず、3ビット以下の量子化が必要になります。

構成合計メモリBF16(2,100 GB)FP8(1,050 GB)4ビット(525 GB)
1× 24 GB コンシューマー向け GPU24 GB不可不可不可(重みはメモリの約22倍)
4× H200 141 GB564 GB不可不可可、残り約39 GB(非常にギリギリ)
8× H100 80 GB640 GB不可不可可、残り約115 GB
8× H200 141 GB1,128 GB不可可、残り約78 GB(ギリギリ)可、残り約603 GB
8× B200 192 GB1,536 GB不可可、残り約486 GB可、残り約1,011 GB
16× H200(2ノード構成)2,256 GB可、残り約156 GB可、残り約1,206 GB可
512 GB ユニファイドメモリ512 GB不可不可不可(3ビットなら394 GB で残り約118 GB)
出典:当サイトの計算(GPU 数 × GPU あたりのメモリ − 重みのサイズ)。重みのみ(2026年10月6日確認)。

KV キャッシュ:重みとは別に必要なメモリ

重みとは別に、KV キャッシュ用のメモリを見込んでおく必要があります。KV キャッシュは、進行中のすべての会話のすべてのトークンについてキーと値を保持するもので、コンテキスト長と同時に処理するユーザー数に比例して増えます。

計算式は「KV キャッシュのバイト数 = 2(キーと値)× レイヤー数 × KV ヘッド数 × ヘッド次元 × 1値あたりのバイト数 × トークン数 × 同時シーケンス数」です。Large 4 のレイヤー数やアテンション構成はまだ公開されていません。重みの公開時にモデル設定ファイルに記載されるので、そこからこの式で1トークンあたりの正確なコストを求められます。

1トークンあたり100KBのキャッシュを使う場合の計算例です。524,288トークンのコンテキストをすべて使う会話1つなら 524,288 × 100KB ≈ 52.4GB、32,768トークンずつのユーザー8人なら 8 × 32,768 × 100KB ≈ 26.2GB が必要です。H200 8基で FP8 を動かす場合、78GB の余裕のうちアクティベーションに回せる分はわずかになるため、長いコンテキストを扱うなら FP8 の KV キャッシュを使うか、上限を短くする必要があります。

  • 推論エンジンが対応していれば、キャッシュを BF16 ではなく FP8 で保存するとサイズが半分になります。
  • 実際に必要なコンテキスト長に上限を設定しましょう。32,768トークンは API の524,288トークンの16分の1です。
  • 余裕の少ない構成では、サーバーに多数のユーザー分を事前確保させず、同時シーケンス数を制限しましょう。

この内容について質問がありますか?

Mistral Large 4 に直接聞いてみましょう。無料アカウントなら毎日15クレジット使えます。

今すぐ質問する

ソフトウェア対応:vLLM、SGLang、llama.cpp、Ollama

2026年10月6日時点で、vLLM、SGLang、llama.cpp、Hugging Face Transformers のいずれも Mistral Large 4 への対応を発表しておらず、各 GitHub の Issue やプルリクエストを検索してもモデル固有の作業は見つかりませんでした。Ollama と LM Studio は llama.cpp 系の GGUF ファイルを使うため、まずそちらの対応を待つことになります。

前世代の流れが参考になります。Mistral Large 3 は FP8 の重み、NVFP4 版、そして公開初日からの vLLM 対応(vLLM 1.12.0 以降と mistral_common 1.8.6 以降)とともにリリースされました。モデルカードでは、FP8 には B200 または H200 の1ノード、NVFP4 には H100 または A100 の1ノードを推奨しています。

モデル総パラメータ1トークンあたりのアクティブFP8 の重み4ビットの重み
Mistral Large 3675B41B≈ 675 GB≈ 338 GB
Large 41.05兆49B≈ 1,050 GB≈ 525 GB
DeepSeek V4 Pro(0813)1.6兆49B≈ 1,600 GB≈ 800 GB
出典:Hugging Face のモデルカード(Mistral Large 3、Mistral Large 4 のリポジトリ)、OpenRouter の DeepSeek V4 Pro 掲載情報。メモリは当サイトの計算(2026年10月6日確認)。

速度を決めるのはアクティブな49Bパラメータ

総パラメータ数は必要なメモリ量を決め、アクティブパラメータ数は1トークンあたりの計算量を決めます。Mistral Large 4 は1トークンごとに49B(埋め込み層と出力層を含めると52B)のパラメータを使うため、FP8 では1トークンを生成するたびに約 49e9 × 1バイト = 49GB の重みを読み込みます。

そのため、1.05兆パラメータの MoE モデルでも、サイズから想像するより速く生成できます。Artificial Analysis はホスト版 API で毎秒116.1出力トークンを計測しました。ご自身の環境での速度は、GPU のメモリ帯域幅と、エキスパートを各カードにどう分割するかで決まります。

今から準備して、公開日にダウンロード

まずはディスク容量を確保しましょう。FP8 のダウンロードだけで約1.05TB、BF16 なら約2.1TBになります。以下のコマンドで容量を確認し、Mistral がファイルを公開したらリポジトリを取得できます。

  • 今すぐモデルを使うなら、当サイトのトップページのチャットへ。設定は不要です。
  • 今のうちにホスト版 API で開発しておき(「API の使い方」「API料金」ページを参照)、あとでエンドポイントを自分のサーバーに切り替えましょう。
  • ウェイトの公開日、ライセンス、ファイル形式は「ウェイトとライセンス」「最新情報」ページで追跡しています。
# Weight size in GB for a given precision (bytes per parameter)
python3 -c "print(1.05e12 * 1 / 1e9, 'GB at FP8'); print(1.05e12 * 0.5 / 1e9, 'GB at 4-bit')"

# Make sure the target disk has room (about 1.05 TB for FP8)
df -h /models

# Download after the weights are published on Hugging Face
hf download mistralai/Mistral-Large-4.0-1T05-A52B --local-dir /models/mistral-large-4

出典

FAQ

ローカル実行のよくある質問

あわせて読みたい

Mistral Large 4 についてもっと見る

Mistral Large 4 に、実際の課題を聞いてみましょう

バグのあるコード、契約書の条文、ごちゃごちゃした表のメモなどを貼り付けるだけ。無料アカウントなら毎日15クレジット使えます。

無料で始める