一句话总结
Mistral Large 4 最强的是安全任务、法律和金融智能体,以及在图片里定位物体;在综合智能指数上属于中等水平。无论看 Mistral 自己的图表还是独立排行榜,都是这个规律。
- 安全:CyberGym-E2E 82%,Cybench 93%,领先 Mistral 拿来对比的所有开放权重模型。
- 法律:Harvey 法律智能体基准 15.8%,在 Vals AI 的 75 个模型中排第 6,高于 GPT-6 Astra(5.4%)。
- 编程智能体:DeepSWE v1.1 61.7%,高于 DeepSeek V4 Pro 0813(57)和 Qwen3.8 Max(51),低于 Kimi K3(68)。
- 视觉:Dense200 定位 42.0,略高于 GPT-6 Astra(41.5)。
- 综合:Artificial Analysis 给它 38 分,低于 Claude Opus 5.5(58)和 GPT-6 Astra(53),但高于 DeepSeek V4 Pro(36.0)。
