本地部署

Mistral Large 4 本地部署指南

现在还不能在本地跑 Mistral Large 4:Mistral AI 计划 2026 年 10 月底发布权重。即使发布了,这个 1.05 万亿参数的模型光权重就要约 1.05 TB 显存(FP8)或约 525 GB(4-bit),需要的是多卡服务器,而不是一台台式机。

更新于 2026 年 10 月 7 日 · 作者 suifeng

Mistral Large 4 关键数据

开发方
Mistral AI(法国巴黎)
发布时间
2026 年 10 月 6 日(公开预览)
参数量
总参数 1.05 万亿,每个 token 激活 49B(混合专家 MoE)
上下文窗口
API 提供 524,288 token
最大输出
262,144 token
输入 / 输出
输入文本和图片,输出文本
API 价格(限时价)
每百万 token 输入 $0.68 / 输出 $2.09(原价 $1.36 / $4.18)
API 模型名
mistral-large-4
推理模式
reasoning_effort: "high" 或 "none"
开放权重
计划 2026 年 10 月底发布

来源:Mistral AI 发布公告和定价页、OpenRouter 模型页、Hugging Face 模型页,核对于 2026 年 10 月 6 日。

现在能在本地跑 Mistral Large 4 吗?

不能。截至 2026 年 10 月 6 日,Hugging Face 仓库 mistralai/Mistral-Large-4.0-1T05-A52B 显示为“即将发布”,里面还没有文件。Mistral 的发布公告承诺月底前放出权重;Hugging Face 页面写的预计日期是 10 月 31 日,也有好几家媒体报道是 10 月 27 日。

Mistral 还没公布许可证、权重文件的精度(BF16、FP8 还是 4-bit 格式),也没有给出推荐硬件清单。下面的内容全部根据已公布的参数量计算,你现在就可以先做硬件预算,等发布当天再核对实际文件大小。

如果你只是想用这个模型,这些都不需要:现在就能在本站首页注册免费账号,每天 15 积分,直接和 Large 4 聊天。

不同精度下的权重显存

权重显存很好算:参数量 × 每个参数的字节数。Large 4 总参数 1.05 万亿(1.05e12)。混合专家(MoE)模型虽然每个 token 只用到 49B 参数,但所有专家都必须常驻显存。

实际的量化文件会比纯按位数算的稍大,因为还要存缩放系数。比如平均每个权重 4.5 bit 的格式:1.05e12 × 4.5 / 8 = 590.6 GB,而不是 525 GB。1.6B 参数的视觉编码器占得很少:BF16 下 1.6e9 × 2 字节 = 3.2 GB。

精度每参数字节数公式仅权重
BF16 / FP1621.05e12 × 2≈ 2,100 GB(2.1 TB)
FP8 / INT811.05e12 × 1≈ 1,050 GB
6-bit0.751.05e12 × 0.75≈ 788 GB
4-bit(NVFP4、Q4 级)0.51.05e12 × 0.5≈ 525 GB
3-bit0.3751.05e12 × 0.375≈ 394 GB
2-bit0.251.05e12 × 0.25≈ 263 GB
来源:本站根据 Mistral Docs 和 Hugging Face 仓库名中的 1.05T 参数量计算;仅含权重,核对于 2026 年 10 月 6 日。

哪些显卡配置装得下 Mistral Large 4

跑 FP8,单机最宽裕的是 8 卡 B200;8 卡 H200 能装下 FP8 权重,但只剩约 78 GB;8 卡 H100 只能跑 4-bit。下表把每种配置的总显存和各精度的权重大小对比,并列出留给 KV 缓存和运行开销的余量。

要装下 BF16 权重,需要两台 8 卡 H200。512 GB 统一内存的工作站装不下 4-bit 权重,得用 3-bit 或更低的量化。

配置总显存BF16(2,100 GB)FP8(1,050 GB)4-bit(525 GB)
1× 24 GB 消费级显卡24 GB不行不行不行(权重约为显存的 22 倍)
4× H200 141 GB564 GB不行不行可以,剩约 39 GB(非常紧)
8× H100 80 GB640 GB不行不行可以,剩约 115 GB
8× H200 141 GB1,128 GB不行可以,剩约 78 GB(偏紧)可以,剩约 603 GB
8× B200 192 GB1,536 GB不行可以,剩约 486 GB可以,剩约 1,011 GB
16× H200(两台)2,256 GB可以,剩约 156 GB可以,剩约 1,206 GB可以
512 GB 统一内存512 GB不行不行不行(3-bit 为 394 GB,剩约 118 GB)
来源:本站计算(显卡数 × 单卡显存 − 权重大小),仅含权重,核对于 2026 年 10 月 6 日。

KV 缓存:权重之外还要预留的显存

除了权重,还要给 KV 缓存留显存。它存的是每个活跃对话里每个 token 的键和值,随上下文长度和同时服务的用户数线性增长。

公式是:KV 缓存字节数 = 2(键和值)× 层数 × KV 头数 × 每头维度 × 每个值的字节数 × token 数 × 并发序列数。Mistral 还没公布 Large 4 的层数和注意力结构;权重发布时这些会写在模型配置里,到时用这个公式就能算出每个 token 的准确开销。

举个算例,假设每个 token 的缓存是 100 KB:一个对话填满 524,288 token 的完整上下文,需要 524,288 × 100 KB ≈ 52.4 GB;8 个用户各用 32,768 token,需要 8 × 32,768 × 100 KB ≈ 26.2 GB。在 8 卡 H200 上跑 FP8,78 GB 的余量留给激活值就不多了,所以要跑长上下文,得用 FP8 KV 缓存或调低上限。

  • 推理引擎支持的话,把 KV 缓存从 BF16 改成 FP8 存储,占用减半。
  • 只开你真正需要的上下文长度;32,768 token 是 API 524,288 token 窗口的 1/16。
  • 显存紧张的配置要限制并发序列数,别让服务端按大量用户预分配。

对这部分有疑问?

直接问 Mistral Large 4。免费账号每天送 15 积分。

马上提问

软件支持:vLLM、SGLang、llama.cpp 和 Ollama

截至 2026 年 10 月 6 日,vLLM、SGLang、llama.cpp 和 Hugging Face Transformers 都还没有宣布支持 Mistral Large 4;在它们的 GitHub issue 和 pull request 里也没搜到针对这个模型的工作。Ollama 和 LM Studio 依赖 llama.cpp 风格的 GGUF 文件,所以要等那边先支持。

上一代的情况可以参考。Mistral Large 3 发布时就提供了 FP8 权重、NVFP4 版本,并且首发当天支持 vLLM(vLLM 1.12.0 及以上,配合 mistral_common 1.8.6 及以上);它的模型卡推荐 FP8 用单台 B200 或 H200 节点,NVFP4 用单台 H100 或 A100 节点。

模型总参数每 token 激活FP8 权重4-bit 权重
Mistral Large 3675B41B≈ 675 GB≈ 338 GB
Large 41.05 万亿49B≈ 1,050 GB≈ 525 GB
DeepSeek V4 Pro(0813)1.6 万亿49B≈ 1,600 GB≈ 800 GB
来源:Hugging Face 模型卡(Mistral Large 3、Mistral Large 4 仓库)、OpenRouter 上的 DeepSeek V4 Pro 模型信息;显存为本站计算,核对于 2026 年 10 月 6 日。

为什么速度取决于 49B 激活参数

总参数决定需要多少显存,激活参数决定每个 token 要算多少。Mistral Large 4 每个 token 激活 49B 参数(算上嵌入层和输出层是 52B),所以在 FP8 下,每生成一个 token 大约要读 49e9 × 1 字节 = 49 GB 权重。

这就是为什么一个 1.05 万亿参数的 MoE 模型,生成速度比它的体量看起来快:Artificial Analysis 测得托管 API 每秒输出 116.1 个 token。你自己部署的速度,取决于显存带宽,以及专家在各张卡之间怎么切分。

现在就准备,发布当天就下载

先腾出磁盘空间:光 FP8 版本下载就有约 1.05 TB,BF16 版本约 2.1 TB。下面的命令用来检查空间,并在 Mistral 发布文件后下载仓库。国内网络访问 Hugging Face 较慢时,可以先在海外服务器下载,再传回本地机房。

  • 现在就在本站首页的聊天框里用这个模型,不用任何配置。
  • 先基于托管 API 开发(见 API 教程和 API 价格页),以后再把接口地址换成你自己的服务器。
  • 权重发布日期、许可证和文件格式,关注 Hugging Face 权重页和更新动态页。
# Weight size in GB for a given precision (bytes per parameter)
python3 -c "print(1.05e12 * 1 / 1e9, 'GB at FP8'); print(1.05e12 * 0.5 / 1e9, 'GB at 4-bit')"

# Make sure the target disk has room (about 1.05 TB for FP8)
df -h /models

# Download after the weights are published on Hugging Face
hf download mistralai/Mistral-Large-4.0-1T05-A52B --local-dir /models/mistral-large-4

资料来源

FAQ

本地部署常见问题

继续阅读

更多 Mistral Large 4 资料

问 Mistral Large 4 一个真问题

贴一段报错代码、一条合同条款,或者一份乱糟糟的表格备注都行。免费账号每天送 15 积分。

开始聊天