Benchmarks

Mistral Large 4 Benchmarks: offizielle und unabhängige Ergebnisse

Laut den Launch-Ergebnissen von Mistral AI erreicht Mistral Large 4 61,7 % auf DeepSWE v1.1, 93 % auf Cybench und 15,8 % auf Harveys Legal Agent Benchmark. Unabhängige Ranglisten sehen es insgesamt im Mittelfeld: 38 im Artificial Analysis Intelligence Index (Platz 64 von 225) und 48,05 % im Vals Index (Platz 32 von 44). Klar vorne liegt es bei IT-Sicherheit, juristischen Agenten und visueller Objekterkennung; GPT-6 Astra und Claude Opus 5.5 punkten in allgemeinen Intelligenz-Indizes weiterhin höher.

Aktualisiert am 7. Oktober 2026 · von suifeng

Mistral Large 4 auf einen Blick

Entwickler
Mistral AI (Paris, Frankreich)
Veröffentlicht
6. Oktober 2026 (Public Preview)
Parameter
1,05 Billionen insgesamt, 49 Mrd. aktiv pro Token (Mixture of Experts)
Kontextfenster
524.288 Token über die API
Max. Ausgabe
262.144 Token
Ein- / Ausgabe
Text und Bilder rein, Text raus
API-Preis (Aktion)
0,68 $ Input / 2,09 $ Output pro 1 Mio. Token (Listenpreis 1,36 $ / 4,18 $)
API-Modellname
mistral-large-4
Reasoning
reasoning_effort: "high" oder "none"
Offene Gewichte
Geplant für Ende Oktober 2026

Quellen: Ankündigung und Preisseite von Mistral AI, OpenRouter-Modellliste, Hugging-Face-Modellseite. Stand: 6. Oktober 2026.

Kurz zusammengefasst

Am stärksten ist Mistral Large 4 bei Security-Aufgaben, Agenten für Recht und Finanzen sowie beim Lokalisieren von Objekten in Bildern; in breiten Intelligenz-Indizes liegt es im Durchschnitt. Dieses Muster zeigt sich sowohl in den eigenen Charts von Mistral als auch in den unabhängigen Ranglisten.

  • Security: 82 % auf CyberGym-E2E und 93 % auf Cybench – vor allen Open-Weight-Modellen, mit denen Mistral sich verglichen hat.
  • Recht: 15,8 % auf Harveys Legal Agent Benchmark, bei Vals AI Platz 6 von 75 Modellen und damit vor GPT-6 Astra (5,4 %).
  • Coding-Agenten: 61,7 % auf DeepSWE v1.1, vor DeepSeek V4 Pro 0813 (57) und Qwen3.8 Max (51), hinter Kimi K3 (68).
  • Bildverständnis: 42,0 auf Dense200 (Grounding), knapp vor GPT-6 Astra (41,5).
  • Gesamt: Artificial Analysis vergibt 38 Punkte – hinter Claude Opus 5.5 (58) und GPT-6 Astra (53), aber vor DeepSeek V4 Pro (36,0).

Coding- und Agenten-Benchmarks (Herstellerangaben)

Bei Coding-Agenten schlägt Large 4 DeepSeek V4 Pro und Qwen3.8 Max, liegt in einigen Tests aber hinter GLM-5.3 und Kimi K3. Mistral hat die Tests mit den Harnesses von Artificial Analysis gefahren; jeder Konkurrent nutzte sein bevorzugtes Agenten-Tool (etwa Claude Code für Qwen3.8 Max und Codex für DeepSeek). Kleine Abstände sind daher eher ein Unentschieden.

Den kombinierten Coding Agent Index gibt Mistral mit 49,8 % an. In der verblindeten menschlichen Bewertung von Coding-Antworten durch Surge AI bekam das Modell 3,74 von 5 Punkten – vor Kimi K3 (3,59) und GLM-5.3 (3,60), aber hinter Claude Opus 5 (4,22).

BenchmarkMistral Large 4DeepSeek V4 Pro 0813Qwen3.8 MaxGLM-5.3Kimi K3
DeepSWE v1.161,7 %57516168
Terminal-Bench 4.028,3 %10174021
SWE-Atlas-QnA59,4 %66625962
AutomationBench (657 Workflows)59,9 %56,757,2 (2.4T A95B)62,258,3
Surge AI, menschliche Bewertung Coding (1–5)3,74--3,603,59
Quelle: Ankündigung von Mistral Large 4 durch Mistral AI (Herstellerangaben, Preview-Modell), Stand: 6. Okt. 2026.

Benchmarks zu IT-Sicherheit und Safety

In der IT-Sicherheit sticht Large 4 am deutlichsten heraus. Auf CyberGym-E2E, wo ein Modell echte Schwachstellen nachstellen und anschließend patchen muss, erreicht es 82 %. Claude Opus 5.5 und GPT-6 Astra kommen laut Mistral auf nahezu null, weil sie die Aufgaben verweigern. Im Cyber Index von Artificial Analysis löst es 50 Aufgaben, GPT-6 Astra 33 und Claude Opus 5.5 29.

Eindeutig schädliche Anfragen lehnt es trotzdem ab: im Schnitt 95,3 über JailbreakBench, StrongREJECT und AgentHarm sowie 93,3 % Angriffsresistenz im B3-Agenten-Sicherheitstest von Lakera. Cyber-Verantwortliche, geprüfte Partner und staatliche Stellen bekommen von Mistral schon vor der Veröffentlichung der Gewichte eine Version mit reduzierter Moderation für Red-Teaming.

BenchmarkMistral Large 4Bester gezeigter KonkurrentWeitere Konkurrenten
CyberGym-E2E (nachstellen + patchen)82 %MiMo-V2.6-Pro 79Grok 4.7 74, Kimi K3 58, GLM-5.3 29
Cybench (40 CTF-Aufgaben)93 %Kimi K3 90DeepSeek V4 Pro 0813 88, GLM-5.3 85
AA Cyber Index (gelöste Aufgaben)50GLM-5.3-Flash 50Kimi K3 41, GPT-6 Astra 33, Claude Opus 5.5 29
Ablehnung schädlicher Cyber-Anfragen (Schnitt)95,3Kimi K3 93,7GLM-5.3 87, DeepSeek V4 Pro 0813 77,7
B3 Agent Security (Lakera)93,3 %GLM-5.3 93,3Kimi K3 88,1, DeepSeek V4 Pro 0813 85,2
Quelle: Charts aus der Ankündigung von Mistral Large 4 durch Mistral AI (Herstellerangaben), Stand: 6. Okt. 2026.

Finanzen, Recht, Wissenschaft und Bildverständnis

Bei professioneller Arbeit führt Large 4 klar bei juristischen Agenten und ist bei Finanzen und Wissenschaft konkurrenzfähig. Seine 15,8 auf Harveys Legal Agent Benchmark sind etwa das Dreifache der 5,4 von GPT-6 Astra. Auf Finance Agent v2 erreicht es 54,7 – knapp vor GPT-6 Astra (53,5) und knapp hinter GLM-5.3 (55,8).

Bei Bildern liest es Diagramme und findet Objekte zuverlässig. Dense200 misst, wie präzise ein Modell Bounding Boxes zieht: Large 4 erreicht 42,0, GPT-6 Astra 41,5 und Kimi K3 28,9. Auf ChartQA Pro kommt es auf 63,1, knapp unter GPT-6 Astra (65,1).

BenchmarkMistral Large 4GPT-6 AstraKimi K3DeepSeek V4 Pro / V4.1 Flash
Harveys Legal Agent Benchmark15,85,412,97,5 (Pro)
Finance Agent v254,753,553,150,4 (Pro)
Finch (FinWorkBench)67,457,077,367,4 (Pro)
SciCode-Verified pass@191,894,290,391 (Pro)
Dense200 (visuelles Grounding)42,041,528,93,3 (V4.1 Flash)
ChartQA Pro63,165,161,759,9 (V4.1 Flash)
GDP.pdf18,6-2212,8 (V4.1 Flash)
Quelle: Ankündigung von Mistral Large 4 durch Mistral AI (Herstellerangaben), Stand: 6. Okt. 2026.

Noch Fragen dazu?

Frag Mistral Large 4 einfach selbst. Kostenloses Konto, jeden Tag 15 Credits.

Jetzt fragen

Unabhängige Ergebnisse: Artificial Analysis

Artificial Analysis bewertet Large 4 mit 38 Punkten im Intelligence Index v4.3.2 – Platz 64 von 225 Modellen und Platz 8 unter den Open-Weight-Modellen. Damit liegt es vor DeepSeek V4 Pro (36,0) und GLM-5.2 (33,7), aber hinter GLM-5.3 (45) und MiMo-V2.6-Pro (46).

Es ist schnell, aber redselig. Die Ausgabegeschwindigkeit liegt bei 116,1 Token pro Sekunde (Median: 87), doch für den kompletten Index brauchte es 200 Mio. Output-Token (Median: 81 Mio.). Lange Antworten erhöhen also Kosten und Wartezeit. Artificial Analysis führt es derzeit als proprietäres Modell, weil die Gewichte noch nicht öffentlich sind.

MessgrößeMistral Large 4Vergleichswert
Intelligence Index v4.3.238 (Platz 64 von 225)Claude Opus 5.5 58, GPT-6 Astra 53, Gemini 4 Argon 53, GPT-6.1 Sol 52
Rang unter Open-Weight-ModellenPlatz 8DeepSeek V4 Pro 36,0, GLM-5.2 33,7
Ausgabegeschwindigkeit116,1 Token/s (Platz 51)Median 87 Token/s
Zeit bis zum ersten Token1,46 s-
Output-Token für den kompletten Index200 Mio.Median 81 Mio.
Kosten pro Index-Aufgabe (Listenpreis)1,13 $-
Quelle: Modellseite von Artificial Analysis und Zusammenfassung der AA-Daten auf trendingtopics.eu, Stand: 6. Okt. 2026.

Unabhängige Ergebnisse: Vals AI

Vals AI sieht Mistral Large 4 mit 48,05 % im Vals Index v2.1 auf Platz 32 von 44 Modellen – nahezu gleichauf mit Qwen 3.8 Max (48,27 %) und DeepSeek V4 Pro 0813 (47,63 %). An der Spitze dieses Index steht Gemini 4 Argon mit 68,90 %, gefolgt von Claude Opus 5.5 mit 66,97 %.

Die besten Platzierungen bei Vals holt es bei Recht und Finanzen, die schwächsten bei formalen Beweisen und rätselartigem naturwissenschaftlichem Schlussfolgern.

Vals-BenchmarkErgebnisPlatz
Vals Index v2.148,05 %32 von 44
Harveys Legal Agent Benchmark15,83 %6 von 75
BioMysteryBench67,04 %17 von 24
Vibe Code Bench 1–10014,26 %16 von 21
Terminal-Bench 4.022,73 %20 von 44
Finance Agent v254,68 %22 von 75
Tax Agent Bench63,29 %25 von 66
Vibe Code Bench v1.178,40 %25 von 109
IOI45,28 %28 von 41
Code Migration30,56 %38 von 74
ProofBench v1.110,00 %42 von 47
MysteryMechanism12,16 %24 von 24
Quelle: Modellseite von Mistral Large 4 bei Vals AI und Vals Index, Stand: 6. Okt. 2026.

So liest du diese Zahlen richtig

Herstellerwerte und unabhängige Werte beantworten unterschiedliche Fragen. Die Abweichungen solltest du kennen, bevor du dich für ein Modell entscheidest.

  • Terminal-Bench 4.0 hängt vom Harness ab: 28,3 % im Lauf von Mistral über Artificial Analysis, 22,73 % bei Vals AI.
  • Mistral bezeichnet sein Ergebnis auf SciCode-Verified als Bestwert unter Open-Weight-Modellen, der eigene Chart zeigt aber MiMo-V2.6-Pro (91,9), GLM-5.3 (92,5) und Qwen3.8 2.4T A95B (93,8) über den 91,8.
  • Die interne Experten-Gewinnrate gegen GLM-5.3 liegt für MINT im Domänen-Chart bei 68 % und im Detail-Chart bei 69 %; CAD kommt auf 62 %, Finanzen auf 50 % und Code auf 48 %.
  • Alle Werte von Mistral beziehen sich auf die Preview-Version vom 6. Okt. 2026; mit den finalen Gewichten können sich die Ergebnisse noch ändern.
  • Der Reasoning-Aufwand verändert für manche Nutzer eher die Kosten als die Qualität: Auf Hacker News berichtete Simon Willison, dass er in seinem Test kaum Unterschiede zwischen reasoning_effort "high" und "none" sah.

Teste das Modell mit deinen eigenen Prompts

Benchmarks zeigen Durchschnittswerte – entscheidend sind deine eigenen Aufgaben. Im Chat auf unserer Startseite kannst du Mistral Large 4 deine Coding-, Rechts- oder Finanzfragen direkt stellen, auch auf Deutsch; ein kostenloses Konto bekommt 15 Credits pro Tag. Was diese Leistung pro Token kostet, steht auf unserer Seite zu den API-Preisen, und die Vergleiche mit DeepSeek V4 und Mistral Large 3 gehen ins Detail.

Quellen

FAQ

Fragen zu: Benchmarks

Weiterlesen

Mehr zu Mistral Large 4

Stell Mistral Large 4 eine echte Aufgabe

Füg einen Bug, eine Vertragsklausel oder eine chaotische Tabellennotiz ein. Mit einem kostenlosen Konto bekommst du jeden Tag 15 Credits.

Jetzt chatten