Benchmarks

Mistral Large 4 benchmarks: officiële en onafhankelijke resultaten

Volgens de lanceringscijfers van Mistral AI haalt Mistral Large 4 61,7% op DeepSWE v1.1, 93% op Cybench en 15,8% op Harvey’s Legal Agent Benchmark. Onafhankelijke ranglijsten zetten het model over de hele linie in de middenmoot: 38 op de Artificial Analysis Intelligence Index (#64 van 225) en 48,05% op de Vals Index (#32 van 44). De duidelijkste voorsprong zit in cybersecurity, juridische agents en het lokaliseren van objecten in beeld; GPT-6 Astra en Claude Opus 5.5 scoren nog hoger op de algemene intelligentie-indexen.

Bijgewerkt op 2026-10-07 · Door suifeng

Mistral Large 4 in het kort

Ontwikkelaar
Mistral AI (Parijs, Frankrijk)
Uitgebracht
6 oktober 2026 (public preview)
Parameters
1,05 biljoen in totaal, 49 miljard actief per token (Mixture of Experts)
Contextvenster
524.288 tokens via de API
Maximale output
262.144 tokens
Invoer / uitvoer
Tekst en afbeeldingen erin, tekst eruit
API-prijs (actie)
$ 0,68 input / $ 2,09 output per 1M tokens (normaal $ 1,36 / $ 4,18)
Modelnaam in de API
mistral-large-4
Redeneren
reasoning_effort: "high" of "none"
Open gewichten
Gepland voor eind oktober 2026

Bronnen: aankondiging en prijspagina van Mistral AI, modelpagina op OpenRouter, modelpagina op Hugging Face. Gecontroleerd op 6 okt. 2026.

Kort samengevat

Mistral Large 4 is het sterkst in securitywerk, juridische en financiële agents en het aanwijzen van objecten in afbeeldingen; op brede intelligentie-indexen zit het rond het gemiddelde. Dat patroon zie je zowel in de eigen grafieken van Mistral als in de onafhankelijke ranglijsten.

  • Security: 82% op CyberGym-E2E en 93% op Cybench, hoger dan elk open-weight-model waarmee Mistral vergeleek.
  • Juridisch: 15,8% op Harvey’s Legal Agent Benchmark, plek #6 van 75 modellen bij Vals AI, boven GPT-6 Astra (5,4%).
  • Codeeragents: 61,7% op DeepSWE v1.1, boven DeepSeek V4 Pro 0813 (57) en Qwen3.8 Max (51), onder Kimi K3 (68).
  • Beeld: 42,0 op Dense200-grounding, net boven GPT-6 Astra (41,5).
  • Totaal: Artificial Analysis geeft het een 38, achter Claude Opus 5.5 (58) en GPT-6 Astra (53), maar voor DeepSeek V4 Pro (36,0).

Benchmarks voor programmeren en agents (volgens Mistral)

Bij codeeragents verslaat Large 4 DeepSeek V4 Pro en Qwen3.8 Max, maar op sommige tests moet het GLM-5.3 en Kimi K3 voor laten gaan. Mistral draaide deze tests met de harnesses van Artificial Analysis; elke concurrent gebruikte zijn eigen favoriete agenttool (bijvoorbeeld Claude Code voor Qwen3.8 Max en Codex voor DeepSeek), dus kleine verschillen zijn eigenlijk gelijkspel.

Mistral meldt een gecombineerde Coding Agent Index van 49,8%. In de blinde menselijke beoordeling van code-antwoorden door Surge AI gaven beoordelaars het een 3,74 op 5, meer dan Kimi K3 (3,59) en GLM-5.3 (3,60), maar minder dan Claude Opus 5 (4,22).

BenchmarkMistral Large 4DeepSeek V4 Pro 0813Qwen3.8 MaxGLM-5.3Kimi K3
DeepSWE v1.161,7%57516168
Terminal-Bench 4.028,3%10174021
SWE-Atlas-QnA59,4%66625962
AutomationBench (657 workflows)59,9%56,757,2 (2.4T A95B)62,258,3
Menselijke beoordeling Surge AI, code (1-5)3,74--3,603,59
Bron: aankondiging van Mistral Large 4 door Mistral AI (cijfers van de fabrikant, previewmodel), gecontroleerd op 6 okt. 2026.

Benchmarks voor cybersecurity en veiligheid

Op cybersecurity springt Large 4 er het meest uit. Op CyberGym-E2E, waar een model echte kwetsbaarheden moet reproduceren en daarna dichten, scoort het 82%, terwijl Claude Opus 5.5 en GPT-6 Astra volgens Mistral rond nul uitkomen omdat ze de opdrachten weigeren. Op de Cyber Index van Artificial Analysis voert het 50 opdrachten uit, tegenover 33 voor GPT-6 Astra en 29 voor Claude Opus 5.5.

Tegelijk weigert het duidelijk schadelijke verzoeken: gemiddeld 95,3 over JailbreakBench, StrongREJECT en AgentHarm, en 93,3% weerstand tegen aanvallen in de B3-agentbeveiligingstest van Lakera. Cyberspecialisten, gescreende partners en overheidsinstanties krijgen van Mistral een versie met minder moderatie voor red-teaming, nog voordat de gewichten uitkomen.

BenchmarkMistral Large 4Sterkste getoonde concurrentAndere concurrenten
CyberGym-E2E (reproduceren + patchen)82%MiMo-V2.6-Pro 79Grok 4.7 74, Kimi K3 58, GLM-5.3 29
Cybench (40 CTF-opdrachten)93%Kimi K3 90DeepSeek V4 Pro 0813 88, GLM-5.3 85
AA Cyber Index (geslaagde opdrachten)50GLM-5.3-Flash 50Kimi K3 41, GPT-6 Astra 33, Claude Opus 5.5 29
Weigeren van schadelijke cyberverzoeken (gem.)95,3Kimi K3 93,7GLM-5.3 87, DeepSeek V4 Pro 0813 77,7
B3 Agent Security (Lakera)93,3%GLM-5.3 93,3Kimi K3 88,1, DeepSeek V4 Pro 0813 85,2
Bron: grafieken bij de aankondiging van Mistral Large 4 door Mistral AI (cijfers van de fabrikant), gecontroleerd op 6 okt. 2026.

Financiën, juridisch, wetenschap en beeld

Voor professioneel werk heeft Large 4 een duidelijke voorsprong bij juridische agents en doet het goed mee bij financiën en wetenschap. Met 15,8 op Harvey’s Legal Agent Benchmark scoort het ongeveer drie keer zo hoog als GPT-6 Astra (5,4). Op Finance Agent v2 haalt het 54,7, net boven GPT-6 Astra (53,5) en net onder GLM-5.3 (55,8).

In afbeeldingen leest het grafieken goed en vindt het objecten nauwkeurig. Dense200 meet hoe precies een model kaders rond objecten tekent; Large 4 haalt 42,0, tegenover 41,5 voor GPT-6 Astra en 28,9 voor Kimi K3. Op ChartQA Pro scoort het 63,1, iets onder GPT-6 Astra (65,1).

BenchmarkMistral Large 4GPT-6 AstraKimi K3DeepSeek V4 Pro / V4.1 Flash
Harvey’s Legal Agent Benchmark15,85,412,97,5 (Pro)
Finance Agent v254,753,553,150,4 (Pro)
Finch (FinWorkBench)67,457,077,367,4 (Pro)
SciCode-Verified pass@191,894,290,391 (Pro)
Dense200 visual grounding42,041,528,93,3 (V4.1 Flash)
ChartQA Pro63,165,161,759,9 (V4.1 Flash)
GDP.pdf18,6-2212,8 (V4.1 Flash)
Bron: aankondiging van Mistral Large 4 door Mistral AI (cijfers van de fabrikant), gecontroleerd op 6 okt. 2026.

Heb je hier een vraag over?

Vraag het Mistral Large 4 zelf. Gratis account, elke dag 15 credits.

Nu vragen

Onafhankelijke resultaten: Artificial Analysis

Artificial Analysis geeft Large 4 een 38 op zijn Intelligence Index v4.3.2. Daarmee staat het op plek #64 van 225 modellen en op de 8e plaats onder de open-weight-modellen. Het staat voor DeepSeek V4 Pro (36,0) en GLM-5.2 (33,7), en achter GLM-5.3 (45) en MiMo-V2.6-Pro (46).

Het model is snel, maar praat graag. De uitvoersnelheid is 116,1 tokens per seconde tegenover een mediaan van 87, maar voor de hele index gebruikte het 200M output-tokens tegenover een mediaan van 81M. Lange antwoorden tellen dus mee in kosten en wachttijd. Artificial Analysis noemt het voorlopig een propriëtair model, omdat de gewichten nog niet openbaar zijn.

MetingMistral Large 4Ter vergelijking
Intelligence Index v4.3.238 (#64 van 225)Claude Opus 5.5 58, GPT-6 Astra 53, Gemini 4 Argon 53, GPT-6.1 Sol 52
Plaats onder open-weight-modellen8eDeepSeek V4 Pro 36,0, GLM-5.2 33,7
Uitvoersnelheid116,1 tokens/s (#51)Mediaan 87 tokens/s
Tijd tot eerste token1,46 s-
Output-tokens voor de hele index200MMediaan 81M
Kosten per indexopdracht (normale prijs)$ 1,13-
Bron: modelpagina van Artificial Analysis en de samenvatting van AA-data op trendingtopics.eu, gecontroleerd op 6 okt. 2026.

Onafhankelijke resultaten: Vals AI

Vals AI geeft Mistral Large 4 48,05% op de Vals Index v2.1, plek #32 van 44 modellen, vrijwel gelijk met Qwen 3.8 Max (48,27%) en DeepSeek V4 Pro 0813 (47,63%). Gemini 4 Argon staat op die index bovenaan met 68,90%, gevolgd door Claude Opus 5.5 met 66,97%.

De beste Vals-plaatsen haalt het met juridisch en financieel werk; het zwakst is het in formele bewijzen en wetenschappelijk redeneren in puzzelvorm.

Vals-benchmarkScorePlaats
Vals Index v2.148,05%#32 van 44
Harvey’s Legal Agent Benchmark15,83%#6 van 75
BioMysteryBench67,04%#17 van 24
Vibe Code Bench 1-10014,26%#16 van 21
Terminal-Bench 4.022,73%#20 van 44
Finance Agent v254,68%#22 van 75
Tax Agent Bench63,29%#25 van 66
Vibe Code Bench v1.178,40%#25 van 109
IOI45,28%#28 van 41
Code Migration30,56%#38 van 74
ProofBench v1.110,00%#42 van 47
MysteryMechanism12,16%#24 van 24
Bron: modelpagina van Mistral Large 4 en de Vals Index op Vals AI, gecontroleerd op 6 okt. 2026.

Zo lees je deze cijfers

Scores van de fabrikant en onafhankelijke scores beantwoorden verschillende vragen. De verschillen ertussen wil je kennen voordat je een model kiest.

  • Terminal-Bench 4.0 verschilt per harness: 28,3% in de Artificial Analysis-run van Mistral, tegenover 22,73% bij Vals AI.
  • Mistral noemt zijn SciCode-Verified-resultaat het beste onder de open-weight-modellen, maar in de eigen grafiek staan MiMo-V2.6-Pro (91,9), GLM-5.3 (92,5) en Qwen3.8 2.4T A95B (93,8) boven de 91,8 van Large 4.
  • Het interne winpercentage tegen GLM-5.3 volgens experts is 68% voor STEM in de domeingrafiek en 69% in de detailgrafiek; voor CAD 62%, financiën 50% en code 48%.
  • Alle cijfers van Mistral gelden voor de previewversie van 6 oktober 2026; scores kunnen veranderen zodra de definitieve gewichten uitkomen.
  • Voor sommige gebruikers verandert de redeneerinstelling vooral de kosten, niet de kwaliteit: op Hacker News meldde Simon Willison in zijn test weinig verschil tussen reasoning_effort "high" en "none".

Probeer het model met je eigen prompts

Benchmarks laten gemiddelden zien; jouw eigen prompts zijn wat telt. Stuur Mistral Large 4 je eigen vragen over code, recht of financiën via de chat op onze homepage; met een gratis account krijg je elke dag 15 credits. Wat deze prestaties in tokens kosten, lees je in onze uitleg over de API-prijzen, en in de vergelijkingen met DeepSeek V4 en Mistral Large 3 zetten we de modellen een-op-een naast elkaar.

Bronnen

FAQ

Vragen over Benchmarks

Lees verder

Meer over Mistral Large 4

Stel Mistral Large 4 een echte vraag

Plak een bug, een contractclausule of een rommelige notitie uit een spreadsheet. Met een gratis account krijg je elke dag 15 credits.

Begin met chatten