对比 Small 4

Mistral Large 4 对比 Mistral Small 4

同样的 8 个提示词,同样的设置,两个模型都在 2026 年 10 月 9 日通过 Mistral API 调用。Large 4 在 8 项任务中有 6 项做得更好,2 项打成平手;Small 4 跑完全部任务用了 29.8 秒,Large 4 用了 55.1 秒,价格却便宜 6 倍。下面是每一项任务、谁做得更好、为什么。

更新于 2026 年 10 月 9 日 · 作者 suifeng

热门提示词

打开聊天

将打开全屏聊天,对话会保存在你的账号里。

Mistral Large 4 关键数据

开发方
Mistral AI(法国巴黎)
发布时间
2026 年 10 月 6 日(公开预览)
参数量
总参数 1.05 万亿,每个 token 激活 49B(混合专家 MoE)
上下文窗口
API 提供 524,288 token
最大输出
262,144 token
输入 / 输出
输入文本和图片,输出文本
API 价格(限时价)
每百万 token 输入 $0.68 / 输出 $2.09(原价 $1.36 / $4.18)
API 模型名
mistral-large-4
推理模式
reasoning_effort: "high" 或 "none"
开放权重
计划 2026 年 10 月底发布

来源:Mistral AI 发布公告和定价页、OpenRouter 模型页、Hugging Face 模型页,核对于 2026 年 10 月 6 日。

为什么我们要做这个测试

我们的免费聊天会给每个新账户前 3 次回复使用 Mistral Large 4,之后切换到 Mistral Small 4;Pro 和积分包保持使用 Large 4。我们想知道,用真实任务而不是跑分表,什么时候大模型才值这个价:按标价,Large 4 每百万输入 token 收费 $1.36、每百万输出 token 收费 $4.18,Small 4 分别是 $0.15 和 $0.60,输入大约贵 9 倍,输出大约贵 7 倍。

方法:8 个看起来像实际工作的提示词(不是脑筋急转弯),分别发给 mistral-large-4 和 mistral-small-2603,通过聊天补全 API 调用,reasoning_effort 设为 none,温度 0.2,输出上限 1,500 token。时间是亚洲一台机器上的墙钟时间,所以你的绝对数字会不同;两个模型之间的比例才是重点。每个提示词只跑一次,所以差异小的地方当噪音看。

成绩单

Large 4 在完整性和指令遵循上占优;Small 4 在定义明确的转换任务上能打成平手,速度快两到三倍。

任务Mistral Large 4Mistral Small 4更好的答案原因
合同条款风险13.3 s(首 token 1.4 s),607 tokens3.7 s(首 token 0.6 s),469 tokensLarge 4五个风险,每个都对应确切措辞;Small 4 找出三个,引用了整句
两季度对比6.8 s(首 token 0.8 s),373 tokens3.1 s(首 token 0.6 s),375 tokens平手两者都算对了毛利($2.56M / $2.30M)和营业利润($0.46M / $0.60M);Large 4 提的问题更尖锐
Python 代码审查10.5 s(首 token 0.8 s),1042 tokens4.6 s(首 token 0.6 s),785 tokensLarge 4两者都发现了注入漏洞、少循环一行和泄漏的连接;Large 4 用上下文管理器和具名列修复了它们
从 2,800-token 页面提取价格3.2 s(首 token 1.0 s),234 tokens3.8 s(首 token 0.7 s),488 tokensLarge 4Large 4 列出了提示词要求的四款模型;Small 4 列的是 Large 4 的价格档位。两者都算对了工作负载的价格
杂乱文本转 JSON3.0 s(首 token 1.0 s),195 tokens1.9 s(首 token 0.6 s),201 tokens平手数字完全一致,精确到分;Small 4 更快
带俗语的翻译5.4 s(首 token 1.9 s),255 tokens3.3 s(首 token 0.7 s),279 tokensLarge 4Large 4 把俗语翻译成了四种语言;Small 4 在日语版本里把“heads up”原样留成了英文
排班难题10.9 s(首 token 0.9 s),830 tokens8.7 s(首 token 0.6 s),1500 tokens,被截断Large 4Large 4 用案例分析找到了唯一可行顺序 A-D-B-C-E;Small 4 分析到一半撞上了 1,500-token 上限
改写营销文案2.0 s(首 token 1.2 s),24 tokens0.8 s(首 token 0.6 s),38 tokensLarge 4Large 4:22 个词,不浮夸;Small 4 用了“Boost”和“innovate daily”
我们自己的测试,2026 年 10 月 9 日,Mistral API,reasoning_effort none,温度 0.2,输出上限 1,500 token,每个提示词跑一次。

Large 4 明显更好的地方

六次胜利的规律:Large 4 按提示词字面要求做事,直到任务完成;Small 4 只回答了问题的大致轮廓。

  • 合同条款:要求列出每个风险并引用造成风险的确切措辞,Large 4 列出了五个风险(包括三条终止条款的综合影响),每个都引用了精确片段,然后写了一份完整的替换条款,含 30 天通知期和按比例付款。Small 4 列了三个风险,引用了整句,改写稿里还留着“[X days]”。
  • 代码审查:两者都发现了 SQL 注入、跳过第一行的循环和未关闭的连接。Large 4 的修复用了上下文管理器、带具名列的 sqlite3.Row 和“is not None”,这样空的状态字符串也能被过滤;Small 4 保留了位置索引,用“if conn in locals()”检查来关闭连接。
  • 长页面提取:提示词粘贴了我们 2,800-token 的 API 定价页面,要求列出每个 Mistral 模型及其每百万价格。Large 4 返回了四款模型(Large 4、Large 3、Medium 3.5、Small 4)。Small 4 返回了十行 Large 4 的价格档位(批量、优先、区域),没有其他模型。两者随后都正确计算了 50M 输入和 5M 输出 token 的价格:标价 $88.90,促销价 $44.45。
  • 带俗语的翻译:Large 4 把“heads up”和“swamped”地道地翻译成了法语、德语、西班牙语和日语。Small 4 在三种欧洲语言上没问题,但在日语句子里把“heads up”原样留成了英文,还加了条注释说明。
  • 排班难题:五场演讲,五条约束。Large 4 推演了 A-D 块的四种放法,找到了唯一可行顺序 A-D-B-C-E,用了 830 tokens。Small 4 详细解释了约束条件,第二个案例还没分析完就撞上了 1,500-token 上限。
  • 有约束的文案改写(60 词以内,不许浮夸词):Large 4 返回了 22 个朴素的词。Small 4 返回了 30 个词,开头是“Boost team productivity”,结尾是“innovate daily”。

Small 4 同样够用的地方

两项任务打成平手,而且 Small 4 在这两项上都更快。发票转 JSON 的转换,两个模型的结果完全一致,精确到分(小计 2,580,税 490.20,总计 3,070.20),Small 4 用了 1.9 秒,Large 4 用了 3.0 秒。两季度财务对比,两个模型算出的毛利和营业利润都一样;Large 4 的三个 CFO 问题更具体(问利润率下降是产品结构变化还是定价压力),Small 4 的也够用。

速度:Small 4 每项任务都是 0.6 到 0.7 秒后开始回答;Large 4 首 token 要 0.8 到 1.9 秒,完成整个任务大约慢两到三倍。对于简短、定义明确的工作,你要付出的唯一代价就是等待。

对这部分有疑问?

直接问 Mistral Large 4。免费账号每天送 15 积分。

马上提问

每个答案花了多少钱

Token 数量是 API 自己的用量数字;美元按 Mistral 的标价计算(我们测试时 Large 4 正在限时 5 折促销,所以它的列减半了)。在我们的网站上,这次测试里每个答案无论用哪个模型都花 1 个积分,因为免费套餐费率下 1 个积分大约能覆盖 $0.0067 的模型成本;价格差距只在长回复和长文档上才会显现。

任务Large 4 输入/输出 tokensLarge 4 费用Small 4 输入/输出 tokensSmall 4 费用倍数
合同条款风险84 / 607$0.002797 / 469$0.00039x
两季度对比97 / 373$0.0017119 / 375$0.00027x
Python 代码审查136 / 1042$0.0045149 / 785$0.00059x
从 2,800-token 页面提取价格2823 / 234$0.00483149 / 488$0.00086x
杂乱文本转 JSON122 / 195$0.0010150 / 201$0.00017x
带俗语的翻译69 / 255$0.001281 / 279$0.00026x
排班难题71 / 830$0.003683 / 1500$0.00094x
改写营销文案78 / 24$0.000294 / 38$0.00006x
全部 8 项任务3480 / 3560$0.01963922 / 4135$0.00316x
Mistral API 于 2026 年 10 月 9 日报告的用量;价格来自同一天 Mistral 的定价页面(Large 4 $1.36 / $4.18,Small 4 $0.15 / $0.60 每百万 tokens,标价)。

该用哪个

输出格式固定、输入简短的时候用 Small 4:文本转 JSON 或表格、提取你明确指定的字段、对你提供的数字做快速算术、欧洲主要语言之间的短翻译。你要直接使用答案而不再检查的时候用 Large 4:法律或合同审查、要发布的代码、任何要求从长文档里找出“所有”项目的任务、约束推理题、日语或其他对俗语敏感的语言,以及有严格规则的写作。

在我们的聊天上,免费套餐前 3 次回复用 Large 4,让你能在自己的任务上看出差别,之后切换到 Small 4;积分包或 Pro 每次回复都用 Large 4。定价页面两个都列了。

怎么复现

两个模型调用方式完全一样,只有模型名不同。这是我们用的请求,去掉了 API 密钥。

# MISTRAL_KEY holds your Mistral Studio API key (set it in your shell)
curl https://api.mistral.ai/v1/chat/completions \
  -H "Authorization: Bearer $MISTRAL_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mistral-large-4",
    "messages": [{"role": "user", "content": "I am a freelance designer. List every risk in this clause for me, quoting the exact words that create each risk, and rewrite the clause so it is fair to both sides: ..."}],
    "reasoning_effort": "none",
    "temperature": 0.2,
    "max_tokens": 1500
  }'
# then the same call with "model": "mistral-small-2603"

FAQ

对比 Small 4常见问题

继续阅读

更多 Mistral Large 4 资料

问 Mistral Large 4 一个真问题

贴一段报错代码、一条合同条款,或者一份乱糟糟的表格备注都行。免费账号每天送 15 积分。

开始聊天