Kurz zusammengefasst
Am stärksten ist Mistral Large 4 bei Security-Aufgaben, Agenten für Recht und Finanzen sowie beim Lokalisieren von Objekten in Bildern; in breiten Intelligenz-Indizes liegt es im Durchschnitt. Dieses Muster zeigt sich sowohl in den eigenen Charts von Mistral als auch in den unabhängigen Ranglisten.
- Security: 82 % auf CyberGym-E2E und 93 % auf Cybench – vor allen Open-Weight-Modellen, mit denen Mistral sich verglichen hat.
- Recht: 15,8 % auf Harveys Legal Agent Benchmark, bei Vals AI Platz 6 von 75 Modellen und damit vor GPT-6 Astra (5,4 %).
- Coding-Agenten: 61,7 % auf DeepSWE v1.1, vor DeepSeek V4 Pro 0813 (57) und Qwen3.8 Max (51), hinter Kimi K3 (68).
- Bildverständnis: 42,0 auf Dense200 (Grounding), knapp vor GPT-6 Astra (41,5).
- Gesamt: Artificial Analysis vergibt 38 Punkte – hinter Claude Opus 5.5 (58) und GPT-6 Astra (53), aber vor DeepSeek V4 Pro (36,0).
