對比 Small 4

Mistral Large 4 vs Mistral Small 4

同樣 8 個提示詞、同樣的設定,2026 年 10 月 9 日當天透過 Mistral API 同時測試兩個模型。Large 4 在 8 個任務中有 6 個表現較好、2 個打平;Small 4 整組只花了 29.8 秒,Large 4 花了 55.1 秒,而且便宜 6 倍。以下是每個任務的完整結果、誰做得比較好、為什麼。

更新於 2026-10-09 · 作者:suifeng

熱門提示詞

開啟聊天

將開啟全螢幕聊天,對話會儲存在你的帳號裡。

Mistral Large 4 重點規格

開發商
Mistral AI(法國巴黎)
發表日期
2026 年 10 月 6 日(公開預覽版)
參數量
總計 1.05 兆,每個 token 啟用 490 億(混合專家模型 MoE)
上下文長度
API 提供 524,288 個 token
最大輸出
262,144 個 token
輸入/輸出
可輸入文字和圖片,輸出文字
API 價格(優惠中)
每 100 萬 token 輸入 $0.68/輸出 $2.09(原價 $1.36/$4.18)
API 模型名稱
mistral-large-4
推理模式
reasoning_effort: "high" 或 "none"
開放權重
預計 2026 年 10 月底釋出

資料來源:Mistral AI 官方公告與定價頁、OpenRouter 模型頁、Hugging Face 模型頁,2026 年 10 月 6 日查核。

為什麼我們要做這個測試

我們的免費聊天讓每個新帳號的前 3 則回覆使用 Mistral Large 4,之後切換到 Mistral Small 4;Pro 和點數包則一直使用 Large 4。我們想知道,用實際任務而不是跑分表,什麼時候大模型值得它的價格:以官網定價,Large 4 每百萬輸入 token 收 $1.36、每百萬輸出 token 收 $4.18,Small 4 分別是 $0.15 和 $0.60,輸入大約貴 9 倍、輸出大約貴 7 倍。

方法:8 個看起來像真實工作的提示詞(不是腦筋急轉彎),各送一次給 mistral-large-4 和 mistral-small-2603,透過 chat completions API 呼叫,reasoning_effort 設為 none,temperature 0.2,輸出上限 1,500 token。時間是亞洲一台機器的實際牆鐘時間,所以你的絕對數字會不同;兩個模型之間的比例才是重點。每個提示詞只跑一次,所以小差異當雜訊看待。

計分板

Large 4 贏在完整性和指令遵循;Small 4 在定義明確的轉換任務上能打平,而且快 2 到 3 倍。

任務Mistral Large 4Mistral Small 4表現較好原因
合約條款風險13.3 s(首 token 1.4 s),607 tokens3.7 s(首 token 0.6 s),469 tokensLarge 4列出五個風險,每個都對應到確切文字;Small 4 找到三個,而且引用整句話
兩季財報比較6.8 s(首 token 0.8 s),373 tokens3.1 s(首 token 0.6 s),375 tokens打平兩個都算對毛利($2.56M / $2.30M)和營業利益($0.46M / $0.60M);Large 4 提的問題更尖銳
Python 程式碼審查10.5 s(首 token 0.8 s),1042 tokens4.6 s(首 token 0.6 s),785 tokensLarge 4兩個都找到注入漏洞、少算第一列的迴圈、沒關的連線;Large 4 用 context manager 和具名欄位修正
從 2,800-token 長頁擷取價格3.2 s(首 token 1.0 s),234 tokens3.8 s(首 token 0.7 s),488 tokensLarge 4Large 4 列出提示詞要求的四個模型;Small 4 列出 Large 4 的價格級距。兩個都算對工作量的價格
髒亂文字轉 JSON3.0 s(首 token 1.0 s),195 tokens1.9 s(首 token 0.6 s),201 tokens打平數字完全一致到分;Small 4 比較快
帶俗語的翻譯5.4 s(首 token 1.9 s),255 tokens3.3 s(首 token 0.7 s),279 tokensLarge 4Large 4 把俗語翻成四種語言;Small 4 的日文版裡「heads up」留成英文
排程謎題10.9 s(首 token 0.9 s),830 tokens8.7 s(首 token 0.6 s),1500 tokens,截斷Large 4Large 4 用 case analysis 找到唯一正確順序 A-D-B-C-E;Small 4講到第二個 case 就撞到 1,500-token 上限
改寫行銷文案2.0 s(首 token 1.2 s),24 tokens0.8 s(首 token 0.6 s),38 tokensLarge 4Large 4:22 個字,不浮誇;Small 4 用了「Boost」和「innovate daily」
我們自己的測試,2026 年 10 月 9 日,Mistral API,reasoning_effort none,temperature 0.2,輸出上限 1,500 token,每個提示詞跑一次。

Large 4 明顯比較好的地方

六場勝利的模式:Large 4 照著提示詞字面要求去做,做到工作完成為止;Small 4 只回答問題的大致輪廓。

  • 合約條款:要求列出每個風險並引用造成風險的確切文字,Large 4 列出五個風險(包括三個終止條款合起來的效果),每個都引用精確片段,然後寫了一份完整的替換條款,含 30 天通知和按比例付款。Small 4 列出三個風險、引用整句話,改寫裡還留著「[X days]」。
  • 程式碼審查:兩個都抓到 SQL injection、跳過第一列的迴圈、沒關的連線。Large 4 的修正用了 context manager、sqlite3.Row 具名欄位、還有「is not None」,所以空的狀態字串還是能過濾;Small 4 保留位置索引,用「if conn in locals()」檢查來關連線。
  • 從長頁擷取:提示詞貼上我們 2,800-token 的 API 定價頁,要求列出每個 Mistral 模型和每百萬價格。Large 4 回傳四個模型(Large 4、Large 3、Medium 3.5、Small 4)。Small 4 回傳十列 Large 4 的價格級距(batch、priority、regional),沒有其他模型。兩個接著都算對 50M 輸入和 5M 輸出 token 的價格:官網價 $88.90,特價 $44.45。
  • 帶俗語的翻譯:Large 4 把「heads up」和「swamped」用習慣用法翻成法文、德文、西班牙文和日文。Small 4 的三種歐洲語言沒問題,但日文句子裡「heads up」留成英文,還加了註解說明。
  • 排程謎題:五場演講、五個限制條件。Large 4 推導 A-D 區塊的四種排法,找到唯一正確順序 A-D-B-C-E,用了 830 tokens。Small 4 大篇幅解釋限制條件,講到第二個 case 就撞到 1,500-token 上限。
  • 有條件的文案改寫(60 字、禁用浮誇詞):Large 4 回傳 22 個平實的字。Small 4 回傳 30 個字,開頭是「Boost team productivity」,結尾是「innovate daily」。

Small 4 一樣好的地方

有兩個任務打平,而且兩個都是 Small 4 比較快。發票轉 JSON 的轉換,兩個模型的結果完全一致到分(小計 2,580,稅 490.20,總計 3,070.20),Small 4 花 1.9 秒,Large 4 花 3.0 秒。兩季財報比較,兩個模型算出的毛利和營業利益都一樣;Large 4 的三個 CFO 問題更具體(問毛利率下滑是產品組合變動還是定價壓力),Small 4 的問題堪用。

速度:Small 4 每個任務都是 0.6 到 0.7 秒後開始回答;Large 4 首 token 要 0.8 到 1.9 秒,完成整個任務大約多花 2 到 3 倍時間。對簡短、定義明確的工作,你要付出的只有等待時間。

對這個主題還有疑問?

直接問 Mistral Large 4。免費帳號每天 15 點。

馬上問

每個答案花多少錢

Token 數是 API 自己回報的用量;金額按 Mistral 官網定價計算(我們測試時 Large 4 正在限時 5 折優惠,所以它的欄位減半)。在我們網站上,這次測試的每個答案不管用哪個模型都花 1 點,因為免費方案的費率下,1 點大約涵蓋 $0.0067 的模型成本;價差只會出現在長回覆和長文件上。

任務Large 4 輸入/輸出 tokensLarge 4 花費Small 4 輸入/輸出 tokensSmall 4 花費比例
合約條款風險84 / 607$0.002797 / 469$0.00039x
兩季財報比較97 / 373$0.0017119 / 375$0.00027x
Python 程式碼審查136 / 1042$0.0045149 / 785$0.00059x
從 2,800-token 長頁擷取價格2823 / 234$0.00483149 / 488$0.00086x
髒亂文字轉 JSON122 / 195$0.0010150 / 201$0.00017x
帶俗語的翻譯69 / 255$0.001281 / 279$0.00026x
排程謎題71 / 830$0.003683 / 1500$0.00094x
改寫行銷文案78 / 24$0.000294 / 38$0.00006x
全部 8 個任務3480 / 3560$0.01963922 / 4135$0.00316x
Mistral API 回報的用量,2026 年 10 月 9 日;價格取自 Mistral 官網定價頁同一天(Large 4 $1.36 / $4.18,Small 4 $0.15 / $0.60 每百萬 token,官網價)。

該用哪一個

輸出格式固定、輸入簡短時用 Small 4:文字轉 JSON 或表格、擷取你明確指名的欄位、對你提供的數字做快速運算、主要歐洲語言之間的短翻譯。你要直接採信答案、不打算檢查時用 Large 4:法律或合約審查、要上線的程式碼、任何要求「列出全部」的長文件項目、限制條件謎題、日文或其他重視俗語的語言,還有嚴格規則下的寫作。

在我們的聊天室,免費方案的前 3 則回覆用 Large 4,讓你自己在實際任務上看出差異,之後切換到 Small 4;點數包或 Pro 則每一則都用 Large 4。定價頁有列出兩個模型。

怎麼重現這個測試

兩個模型的呼叫方式一樣,只有模型名稱不同。這是我們用的請求,拿掉 API 金鑰。

# MISTRAL_KEY holds your Mistral Studio API key (set it in your shell)
curl https://api.mistral.ai/v1/chat/completions \
  -H "Authorization: Bearer $MISTRAL_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mistral-large-4",
    "messages": [{"role": "user", "content": "I am a freelance designer. List every risk in this clause for me, quoting the exact words that create each risk, and rewrite the clause so it is fair to both sides: ..."}],
    "reasoning_effort": "none",
    "temperature": 0.2,
    "max_tokens": 1500
  }'
# then the same call with "model": "mistral-small-2603"

FAQ

對比 Small 4 常見問題

延伸閱讀

更多 Mistral Large 4 資訊

拿一個真正的問題問 Mistral Large 4

貼上一段出錯的程式、一條合約條款,或一段亂糟糟的試算表備註。免費帳號每天送 15 點。

開始聊天