Benchmarks

Benchmarks de Mistral Large 4 : résultats officiels et tests indépendants

Selon les résultats de lancement de Mistral AI, Mistral Large 4 obtient 61,7 % sur DeepSWE v1.1, 93 % sur Cybench et 15,8 % sur le Legal Agent Benchmark de Harvey, tandis que les indices indépendants le placent en milieu de peloton au classement général : 38 à l’Intelligence Index d’Artificial Analysis (64e sur 225) et 48,05 % au Vals Index (32e sur 44). Son avance la plus nette concerne la cybersécurité, les agents juridiques et la localisation visuelle ; GPT-6 Astra et Claude Opus 5.5 restent devant sur les indices d’intelligence générale.

Mis à jour le 7 octobre 2026 · Par suifeng

Mistral Large 4 en bref

Développeur
Mistral AI (Paris, France)
Sortie
6 octobre 2026 (préversion publique)
Paramètres
1 050 milliards au total, 49 milliards actifs par token (Mixture of Experts)
Fenêtre de contexte
524 288 tokens via l’API
Sortie maximale
262 144 tokens
Entrées / sorties
Texte et images en entrée, texte en sortie
Prix de l’API (promo)
0,68 $ en entrée / 2,09 $ en sortie par million de tokens (prix catalogue 1,36 $ / 4,18 $)
Nom du modèle dans l’API
mistral-large-4
Raisonnement
reasoning_effort : "high" ou "none"
Poids ouverts
Prévus pour fin octobre 2026

Sources : annonce et page de tarifs de Mistral AI, fiche du modèle sur OpenRouter, page du modèle sur Hugging Face. Vérifié le 6 oct. 2026.

L’essentiel en bref

Mistral Large 4 excelle en cybersécurité, sur les agents juridiques et financiers et pour pointer des objets dans des images ; il est dans la moyenne sur les indices d’intelligence générale. Ce profil se retrouve aussi bien dans les graphiques de Mistral que dans les classements indépendants.

  • Sécurité : 82 % sur CyberGym-E2E et 93 % sur Cybench, devant tous les modèles à poids ouverts auxquels Mistral s’est comparé.
  • Droit : 15,8 % sur le Legal Agent Benchmark de Harvey, 6e sur 75 modèles chez Vals AI, devant GPT-6 Astra (5,4 %).
  • Agents de code : 61,7 % sur DeepSWE v1.1, devant DeepSeek V4 Pro 0813 (57) et Qwen3.8 Max (51), derrière Kimi K3 (68).
  • Vision : 42,0 en localisation sur Dense200, légèrement au-dessus de GPT-6 Astra (41,5).
  • Classement général : Artificial Analysis lui attribue 38, derrière Claude Opus 5.5 (58) et GPT-6 Astra (53), mais devant DeepSeek V4 Pro (36,0).

Benchmarks de code et d’agents (annoncés par Mistral)

Sur les agents de code, Large 4 bat DeepSeek V4 Pro et Qwen3.8 Max, mais reste derrière GLM-5.3 et Kimi K3 sur certains tests. Mistral a utilisé les harnais d’Artificial Analysis ; chaque concurrent a tourné avec son outil d’agent préféré (par exemple Claude Code pour Qwen3.8 Max et Codex pour DeepSeek) : considérez les petits écarts comme des matchs serrés.

Mistral annonce un Coding Agent Index combiné de 49,8 %. Dans l’évaluation humaine à l’aveugle de Surge AI sur des réponses de code, les évaluateurs lui ont donné 3,74 sur 5, devant Kimi K3 (3,59) et GLM-5.3 (3,60), mais derrière Claude Opus 5 (4,22).

BenchmarkMistral Large 4DeepSeek V4 Pro 0813Qwen3.8 MaxGLM-5.3Kimi K3
DeepSWE v1.161,7 %57516168
Terminal-Bench 4.028,3 %10174021
SWE-Atlas-QnA59,4 %66625962
AutomationBench (657 workflows)59,9 %56,757,2 (2.4T A95B)62,258,3
Évaluation humaine Surge AI, code (1-5)3,74--3,603,59
Source : annonce de Mistral Large 4 par Mistral AI (chiffres de l’éditeur, modèle en préversion), vérifiée le 6 oct. 2026.

Benchmarks de cybersécurité et de sûreté

La cybersécurité est le domaine où Large 4 se démarque le plus. Sur CyberGym-E2E, qui demande de reproduire puis de corriger de vraies vulnérabilités, il obtient 82 %, alors que selon Mistral Claude Opus 5.5 et GPT-6 Astra tombent presque à zéro parce qu’ils refusent les tâches. Sur le Cyber Index d’Artificial Analysis, il réussit 50 tâches, contre 33 pour GPT-6 Astra et 29 pour Claude Opus 5.5.

Il refuse aussi les demandes clairement malveillantes : une moyenne de 95,3 sur JailbreakBench, StrongREJECT et AgentHarm, et 93,3 % de résistance aux attaques sur le test de sécurité d’agents B3 de Lakera. Mistral fournit aux acteurs majeurs de la cybersécurité, à des partenaires sélectionnés et aux autorités publiques une version à modération réduite pour le red teaming, avant la publication des poids.

BenchmarkMistral Large 4Meilleur concurrent affichéAutres concurrents
CyberGym-E2E (reproduction + correctif)82 %MiMo-V2.6-Pro 79Grok 4.7 74, Kimi K3 58, GLM-5.3 29
Cybench (40 épreuves CTF)93 %Kimi K3 90DeepSeek V4 Pro 0813 88, GLM-5.3 85
AA Cyber Index (réussites)50GLM-5.3-Flash 50Kimi K3 41, GPT-6 Astra 33, Claude Opus 5.5 29
Refus des demandes cyber malveillantes (moyenne)95,3Kimi K3 93,7GLM-5.3 87, DeepSeek V4 Pro 0813 77,7
B3 Agent Security (Lakera)93,3 %GLM-5.3 93,3Kimi K3 88,1, DeepSeek V4 Pro 0813 85,2
Source : graphiques de l’annonce de Mistral Large 4 par Mistral AI (chiffres de l’éditeur), vérifiés le 6 oct. 2026.

Finance, droit, sciences et vision

Pour le travail professionnel, Large 4 domine nettement sur les agents juridiques et reste compétitif en finance et en sciences. Ses 15,8 sur le Legal Agent Benchmark de Harvey représentent environ trois fois les 5,4 de GPT-6 Astra. Sur Finance Agent v2, il obtient 54,7, juste au-dessus de GPT-6 Astra (53,5) et juste en dessous de GLM-5.3 (55,8).

Sur les images, il lit bien les graphiques et localise bien les objets. Dense200 mesure la précision avec laquelle un modèle trace des boîtes englobantes : Large 4 obtient 42,0, contre 41,5 pour GPT-6 Astra et 28,9 pour Kimi K3. Sur ChartQA Pro, il obtient 63,1, un peu sous GPT-6 Astra (65,1).

BenchmarkMistral Large 4GPT-6 AstraKimi K3DeepSeek V4 Pro / V4.1 Flash
Legal Agent Benchmark de Harvey15,85,412,97,5 (Pro)
Finance Agent v254,753,553,150,4 (Pro)
Finch (FinWorkBench)67,457,077,367,4 (Pro)
SciCode-Verified pass@191,894,290,391 (Pro)
Localisation visuelle Dense20042,041,528,93,3 (V4.1 Flash)
ChartQA Pro63,165,161,759,9 (V4.1 Flash)
GDP.pdf18,6-2212,8 (V4.1 Flash)
Source : annonce de Mistral Large 4 par Mistral AI (chiffres de l’éditeur), vérifiée le 6 oct. 2026.

Une question sur ce sujet ?

Posez-la directement à Mistral Large 4. Compte gratuit, 15 crédits chaque jour.

Poser ma question

Résultats indépendants : Artificial Analysis

Artificial Analysis attribue à Large 4 un score de 38 sur son Intelligence Index v4.3.2, soit la 64e place sur 225 modèles et la 8e parmi les modèles à poids ouverts. Il se classe devant DeepSeek V4 Pro (36,0) et GLM-5.2 (33,7), et derrière GLM-5.3 (45) et MiMo-V2.6-Pro (46).

Il est rapide mais bavard. Sa vitesse de génération atteint 116,1 tokens par seconde contre une médiane de 87, mais il lui a fallu 200 millions de tokens de sortie pour boucler l’indice, contre une médiane de 81 millions : les longues réponses pèsent sur le coût et le temps d’attente. Artificial Analysis le classe pour l’instant comme modèle propriétaire, faute de poids publics.

IndicateurMistral Large 4Point de comparaison
Intelligence Index v4.3.238 (64e sur 225)Claude Opus 5.5 58, GPT-6 Astra 53, Gemini 4 Argon 53, GPT-6.1 Sol 52
Rang parmi les poids ouverts8eDeepSeek V4 Pro 36,0, GLM-5.2 33,7
Vitesse de génération116,1 tokens/s (51e)Médiane 87 tokens/s
Délai avant le premier token1,46 s-
Tokens de sortie pour l’indice complet200MMédiane 81M
Coût par tâche de l’indice (prix catalogue)1,13 $-
Source : page du modèle sur Artificial Analysis et synthèse des données AA par trendingtopics.eu, vérifiées le 6 oct. 2026.

Résultats indépendants : Vals AI

Vals AI place Mistral Large 4 à 48,05 % sur le Vals Index v2.1, 32e sur 44 modèles, quasiment à égalité avec Qwen 3.8 Max (48,27 %) et DeepSeek V4 Pro 0813 (47,63 %). Gemini 4 Argon mène cet indice avec 68,90 %, suivi de Claude Opus 5.5 à 66,97 %.

Ses meilleurs classements chez Vals concernent le droit et la finance ; ses plus faibles, les preuves formelles et le raisonnement scientifique façon énigme.

Benchmark ValsScoreRang
Vals Index v2.148,05 %32e sur 44
Legal Agent Benchmark de Harvey15,83 %6e sur 75
BioMysteryBench67,04 %17e sur 24
Vibe Code Bench 1-10014,26 %16e sur 21
Terminal-Bench 4.022,73 %20e sur 44
Finance Agent v254,68 %22e sur 75
Tax Agent Bench63,29 %25e sur 66
Vibe Code Bench v1.178,40 %25e sur 109
IOI45,28 %28e sur 41
Code Migration30,56 %38e sur 74
ProofBench v1.110,00 %42e sur 47
MysteryMechanism12,16 %24e sur 24
Source : page du modèle Mistral Large 4 sur Vals AI et Vals Index, vérifiés le 6 oct. 2026.

Comment lire ces chiffres

Les scores de l’éditeur et les scores indépendants ne répondent pas à la même question ; mieux vaut connaître leurs écarts avant de choisir un modèle.

  • Terminal-Bench 4.0 varie selon le harnais : 28,3 % dans le test Artificial Analysis mené par Mistral, contre 22,73 % chez Vals AI.
  • Mistral qualifie son résultat SciCode-Verified d’état de l’art parmi les modèles à poids ouverts, mais son propre graphique place MiMo-V2.6-Pro (91,9), GLM-5.3 (92,5) et Qwen3.8 2.4T A95B (93,8) au-dessus de ses 91,8.
  • Le taux de victoire interne d’experts face à GLM-5.3 est de 68 % en STEM sur le graphique par domaine et de 69 % sur le graphique détaillé ; 62 % en CAO, 50 % en finance et 48 % en code.
  • Tous les chiffres de Mistral portent sur la préversion sortie le 6 octobre 2026 ; les scores peuvent évoluer avec les poids définitifs.
  • Le niveau de raisonnement change parfois plus le coût que la qualité : sur Hacker News, Simon Willison a constaté peu de différence entre reasoning_effort "high" et "none" dans son test.

Testez le modèle sur vos propres prompts

Les benchmarks donnent des moyennes ; ce qui compte, ce sont vos prompts. Envoyez vos propres questions de code, de droit ou de finance à Mistral Large 4 dans le chat de notre page d’accueil : un compte gratuit reçoit 15 crédits par jour. Le coût en tokens de ce niveau de performance est détaillé sur notre page Prix de l’API, et nos comparatifs avec DeepSeek V4 et Mistral Large 3 opposent les modèles point par point.

Sources

FAQ

Questions fréquentes : Benchmarks

À lire aussi

En savoir plus sur Mistral Large 4

Posez à Mistral Large 4 une vraie question

Collez un bug, une clause de contrat ou une note de tableur en désordre. Un compte gratuit vous donne 15 crédits chaque jour.

Commencer à discuter