本地部署

Mistral Large 4 本地部署指南

目前還不能在本機執行 Mistral Large 4:Mistral AI 預計在 2026 年 10 月底公開權重。即使權重釋出,這個 1.05 兆參數的模型光是權重,在 FP8 精度下就需要約 1.05 TB 的 GPU 記憶體,4-bit 也要約 525 GB,所以需要的是多卡伺服器,而不是一般桌機。

更新於 2026-10-07 · 作者:suifeng

Mistral Large 4 重點規格

開發商
Mistral AI(法國巴黎)
發表日期
2026 年 10 月 6 日(公開預覽版)
參數量
總計 1.05 兆,每個 token 啟用 490 億(混合專家模型 MoE)
上下文長度
API 提供 524,288 個 token
最大輸出
262,144 個 token
輸入/輸出
可輸入文字和圖片,輸出文字
API 價格(優惠中)
每 100 萬 token 輸入 $0.68/輸出 $2.09(原價 $1.36/$4.18)
API 模型名稱
mistral-large-4
推理模式
reasoning_effort: "high" 或 "none"
開放權重
預計 2026 年 10 月底釋出

資料來源:Mistral AI 官方公告與定價頁、OpenRouter 模型頁、Hugging Face 模型頁,2026 年 10 月 6 日查核。

現在能在本機跑 Mistral Large 4 嗎?

還不行。截至 2026 年 10 月 6 日,Hugging Face 上的 mistralai/Mistral-Large-4.0-1T05-A52B 儲存庫標示為即將釋出,裡面還沒有檔案。Mistral 的發表文章承諾在月底前釋出權重;Hugging Face 頁面顯示的預計日期是 10 月 31 日,也有多家媒體報導是 10 月 27 日。

Mistral 還沒公布授權條款、檔案精度(BF16、FP8 或 4-bit 格式),也還沒公布建議的硬體清單。以下內容都是依官方公布的參數量計算出來的,你現在就能先估硬體預算,等釋出當天再確認實際檔案大小。

如果你只是想用這個模型,以上都不用煩惱:現在就能在我們的首頁和 Large 4 聊天,免費帳號每天 15 點。

各精度需要的權重記憶體

權重記憶體的算法很簡單:參數量 × 每個參數的位元組數。Large 4 總共有 1.05 兆個參數(1.05e12);在混合專家模型(MoE)裡,雖然每個 token 只用到 490 億個參數,但所有專家都必須放在記憶體中。

實際的量化檔案會比單純的位元數略大,因為還要儲存縮放係數。例如平均每個權重 4.5 bit 的格式,會是 1.05e12 × 4.5 / 8 = 590.6 GB,而不是 525 GB。16 億參數的視覺編碼器佔用不多:BF16 下是 1.6e9 × 2 位元組 = 3.2 GB。

精度每個參數的位元組公式僅權重
BF16 / FP1621.05e12 × 2≈ 2,100 GB(2.1 TB)
FP8 / INT811.05e12 × 1≈ 1,050 GB
6-bit0.751.05e12 × 0.75≈ 788 GB
4-bit(NVFP4、Q4 等級)0.51.05e12 × 0.5≈ 525 GB
3-bit0.3751.05e12 × 0.375≈ 394 GB
2-bit0.251.05e12 × 0.25≈ 263 GB
資料來源:本站依 Mistral Docs 與 Hugging Face 儲存庫名稱中的 1.05T 參數量計算,僅含權重,2026 年 10 月 6 日查核。

哪些 GPU 組合放得下 Mistral Large 4

要跑 FP8,單一節點最從容的選擇是 8× B200;8× H200 放得下 FP8 權重,但只剩約 78 GB;8× H100 只能跑 4-bit。下表比較每種組合的總記憶體和各精度的權重大小,並列出剩下多少空間給 KV 快取和執行時的額外開銷。

要放下 BF16 權重,需要兩台 8× H200 節點。512 GB 統一記憶體的工作站放不下 4-bit 權重,必須用 3-bit 或更小的量化。

組合總記憶體BF16(2,100 GB)FP8(1,050 GB)4-bit(525 GB)
1× 24 GB 消費級顯示卡24 GB不行不行不行(權重約是它記憶體的 22 倍)
4× H200 141 GB564 GB不行不行可以,剩約 39 GB(非常吃緊)
8× H100 80 GB640 GB不行不行可以,剩約 115 GB
8× H200 141 GB1,128 GB不行可以,剩約 78 GB(吃緊)可以,剩約 603 GB
8× B200 192 GB1,536 GB不行可以,剩約 486 GB可以,剩約 1,011 GB
16× H200(兩台節點)2,256 GB可以,剩約 156 GB可以,剩約 1,206 GB可以
512 GB 統一記憶體512 GB不行不行不行(3-bit 為 394 GB,剩約 118 GB)
資料來源:本站計算(GPU 數量 × 每張卡記憶體 − 權重大小),僅含權重,2026 年 10 月 6 日查核。

KV 快取:權重之外還要預留的記憶體

除了權重,還要替 KV 快取預留記憶體。KV 快取會儲存每個進行中對話裡每個 token 的 key 和 value,用量隨上下文長度和同時服務的使用者數線性增加。

公式是:KV 快取位元組數 = 2(key 和 value)× 層數 × KV head 數 × head 維度 × 每個值的位元組數 × token 數 × 同時進行的序列數。Mistral 還沒公布 Large 4 的層數和注意力結構;權重釋出時會寫在模型設定檔裡,到時就能用這個公式算出每個 token 的確切成本。

以每個 token 佔 100 KB 的快取為例:一個對話塞滿 524,288 token 的完整上下文,需要 524,288 × 100 KB ≈ 52.4 GB;8 位使用者各用 32,768 token,則需要 8 × 32,768 × 100 KB ≈ 26.2 GB。在 FP8 的 8× H200 上,78 GB 的剩餘空間扣掉這些之後,留給運算的就不多了,所以要跑長上下文,得用 FP8 KV 快取或縮短上限。

  • 推論引擎支援的話,把快取改用 FP8 而不是 BF16 儲存,用量直接減半。
  • 只開你真正需要的上下文長度;32,768 token 是 API 524,288 token 視窗的 1/16。
  • 在記憶體吃緊的組合上,限制同時進行的序列數,不要讓伺服器替大量使用者預先配置記憶體。

對這個主題還有疑問?

直接問 Mistral Large 4。免費帳號每天 15 點。

馬上問

軟體支援:vLLM、SGLang、llama.cpp 與 Ollama

截至 2026 年 10 月 6 日,vLLM、SGLang、llama.cpp 和 Hugging Face Transformers 都還沒宣布支援 Mistral Large 4;在它們的 GitHub issue 和 pull request 中也查不到針對這個模型的開發。Ollama 和 LM Studio 建立在 llama.cpp 風格的 GGUF 檔案上,所以要等那邊先支援。

上一代的經驗可以看出可能的走向。Mistral Large 3 釋出時就附上 FP8 權重和 NVFP4 版本,而且第一天就支援 vLLM(vLLM 1.12.0 以上搭配 mistral_common 1.8.6 以上);它的模型卡建議 FP8 用單一節點的 B200 或 H200,NVFP4 用單一節點的 H100 或 A100。

模型總參數每 token 啟用FP8 權重4-bit 權重
Mistral Large 3675B41B≈ 675 GB≈ 338 GB
Large 41.05T49B≈ 1,050 GB≈ 525 GB
DeepSeek V4 Pro(0813)1.6T49B≈ 1,600 GB≈ 800 GB
資料來源:Hugging Face 模型卡(Mistral Large 3、Mistral Large 4 儲存庫)、OpenRouter 的 DeepSeek V4 Pro 模型資訊;記憶體為本站計算,2026 年 10 月 6 日查核。

為什麼速度取決於 490 億啟用參數

總參數量決定你需要多少記憶體;啟用參數量決定每個 token 要做多少運算。Mistral Large 4 每個 token 啟用 490 億個參數(含嵌入層和輸出層是 520 億),所以在 FP8 下,每生成一個 token 大約要讀取 49e9 × 1 位元組 = 49 GB 的權重。

這就是為什麼 1.05 兆參數的 MoE 模型,生成速度比它的體積看起來快:Artificial Analysis 在託管 API 上量到每秒輸出 116.1 個 token。你自己架設時的速度,取決於 GPU 記憶體頻寬,以及專家如何分配到各張卡上。

現在先準備,釋出當天就下載

先騰出硬碟空間:光是 FP8 的下載量就約 1.05 TB,BF16 版本則約 2.1 TB。以下指令可以檢查空間,並在 Mistral 公開檔案後下載儲存庫。

  • 今天就能在我們首頁的聊天框使用這個模型,完全不用設定。
  • 現在先用託管 API 開發(參考「API 教學」和「API 價格」兩頁),之後再把端點換成你自己的伺服器。
  • 權重日期、授權條款和檔案格式,請追蹤「權重與授權」和「最新動態」兩頁。
# Weight size in GB for a given precision (bytes per parameter)
python3 -c "print(1.05e12 * 1 / 1e9, 'GB at FP8'); print(1.05e12 * 0.5 / 1e9, 'GB at 4-bit')"

# Make sure the target disk has room (about 1.05 TB for FP8)
df -h /models

# Download after the weights are published on Hugging Face
hf download mistralai/Mistral-Large-4.0-1T05-A52B --local-dir /models/mistral-large-4

資料來源

FAQ

本地部署常見問題

延伸閱讀

更多 Mistral Large 4 資訊

拿一個真正的問題問 Mistral Large 4

貼上一段出錯的程式、一條合約條款,或一段亂糟糟的試算表備註。免費帳號每天送 15 點。

開始聊天