從 Large 3 到 Large 4 改變了什麼
兩次發表相隔十個月:Mistral Large 3(2512)在 2025 年 12 月 2 日推出,Mistral Large 4 在 2026 年 10 月 6 日進入公開預覽。最主要的改變是規模、推理和上下文。
- 規模:總參數 1.05 兆、每個 token 啟用 490 億,上一代是總參數 6,750 億、啟用 410 億(總參數 +56%,啟用參數 +20%)。
- 推理:Large 4 是指令與推理合一的混合模型,用 reasoning_effort("high" 或 "none")控制;Large 3 的模型卡則說明它不是專門的推理模型。
- 上下文:API 提供 524,288 個 token(Mistral 文件寫 1M),上一代是 256K。
- 語言:訓練資料涵蓋超過 160 種語言,包含所有歐盟官方語言;Large 3 的模型卡列出的是數十種語言。
- 視覺:兩者都能讀圖;Large 4 使用 16 億參數的視覺編碼器,Large 3 則是 25 億參數。
- 授權:Large 3 採用 Apache 2.0;Mistral 還沒公布 Large 4 的授權條款。
