En local

Comment faire tourner Mistral Large 4 en local

Impossible pour l’instant de faire tourner Mistral Large 4 en local : Mistral AI prévoit de publier les poids fin octobre 2026, et même alors ce modèle de 1 050 milliards de paramètres demandera environ 1,05 To de mémoire GPU en FP8, ou environ 525 Go en 4 bits, rien que pour les poids. Il faut donc un serveur multi-GPU, pas un PC de bureau.

Mis à jour le 7 octobre 2026 · Par suifeng

Mistral Large 4 en bref

Développeur
Mistral AI (Paris, France)
Sortie
6 octobre 2026 (préversion publique)
Paramètres
1 050 milliards au total, 49 milliards actifs par token (Mixture of Experts)
Fenêtre de contexte
524 288 tokens via l’API
Sortie maximale
262 144 tokens
Entrées / sorties
Texte et images en entrée, texte en sortie
Prix de l’API (promo)
0,68 $ en entrée / 2,09 $ en sortie par million de tokens (prix catalogue 1,36 $ / 4,18 $)
Nom du modèle dans l’API
mistral-large-4
Raisonnement
reasoning_effort : "high" ou "none"
Poids ouverts
Prévus pour fin octobre 2026

Sources : annonce et page de tarifs de Mistral AI, fiche du modèle sur OpenRouter, page du modèle sur Hugging Face. Vérifié le 6 oct. 2026.

Peut-on faire tourner Mistral Large 4 en local aujourd’hui ?

Non. Au 6 octobre 2026, le dépôt Hugging Face mistralai/Mistral-Large-4.0-1T05-A52B est listé comme une publication à venir, sans fichiers. L’article de lancement de Mistral promet les poids d’ici la fin du mois ; la page Hugging Face affiche une date prévue au 31 octobre, et plusieurs médias parlent du 27 octobre.

Mistral n’a encore annoncé ni la licence, ni la précision des fichiers (BF16, FP8 ou un format 4 bits), ni une liste de matériel recommandé. Tout ce qui suit est de l’arithmétique à partir du nombre de paramètres publié : vous pouvez budgéter le matériel dès maintenant et confirmer la taille exacte des fichiers le jour de la sortie.

Si vous voulez seulement utiliser le modèle, rien de tout cela n’est nécessaire : discutez dès maintenant avec Large 4 sur notre page d’accueil, avec un compte gratuit et 15 crédits par jour.

Mémoire des poids selon la précision

La mémoire des poids se calcule simplement : paramètres × octets par paramètre. Large 4 compte 1 050 milliards de paramètres au total (1.05e12), et dans un modèle Mixture-of-Experts chaque expert doit résider en mémoire, même si seuls 49 milliards de paramètres servent pour chaque token.

Les fichiers quantifiés réels sont un peu plus lourds que le simple nombre de bits, car ils stockent aussi des facteurs d’échelle. Par exemple, un format à 4,5 bits par poids en moyenne donne 1.05e12 × 4,5 / 8 = 590,6 Go au lieu de 525 Go. L’encodeur visuel de 1,6 milliard de paramètres pèse peu : 1.6e9 × 2 octets = 3,2 Go en BF16.

PrécisionOctets par paramètreFormulePoids seuls
BF16 / FP1621.05e12 × 2≈ 2 100 Go (2,1 To)
FP8 / INT811.05e12 × 1≈ 1 050 Go
6 bits0,751.05e12 × 0,75≈ 788 Go
4 bits (NVFP4, classe Q4)0,51.05e12 × 0,5≈ 525 Go
3 bits0,3751.05e12 × 0,375≈ 394 Go
2 bits0,251.05e12 × 0,25≈ 263 Go
Source : nos calculs à partir des 1 050 milliards de paramètres indiqués par la documentation Mistral et le nom du dépôt Hugging Face ; poids seuls, vérifié le 6 oct. 2026.

Quelles configurations GPU accueillent Mistral Large 4

Un nœud 8× B200 est la cible mono-nœud la plus confortable en FP8 ; 8× H200 accueille les poids FP8 avec seulement environ 78 Go de marge ; 8× H100 ne fonctionne qu’en 4 bits. Le tableau compare la mémoire totale à chaque taille de poids et montre ce qui reste pour le cache KV et le surcoût d’exécution.

Il faut deux nœuds 8× H200 pour loger les poids BF16. Une station de travail à mémoire unifiée de 512 Go ne peut pas contenir les poids 4 bits et aurait besoin d’une quantification 3 bits ou inférieure.

ConfigurationMémoire totaleBF16 (2 100 Go)FP8 (1 050 Go)4 bits (525 Go)
1 GPU grand public de 24 Go24 GoNonNonNon (les poids font environ 22× sa mémoire)
4× H200 141 Go564 GoNonNonOui, environ 39 Go de marge (très juste)
8× H100 80 Go640 GoNonNonOui, environ 115 Go de marge
8× H200 141 Go1 128 GoNonOui, environ 78 Go de marge (juste)Oui, environ 603 Go de marge
8× B200 192 Go1 536 GoNonOui, environ 486 Go de margeOui, environ 1 011 Go de marge
16× H200 (deux nœuds)2 256 GoOui, environ 156 Go de margeOui, environ 1 206 Go de margeOui
Mémoire unifiée de 512 Go512 GoNonNonNon (en 3 bits, 394 Go laissent environ 118 Go)
Source : nos calculs (nombre de GPU × mémoire par GPU, moins la taille des poids), poids seuls, vérifié le 6 oct. 2026.

Cache KV : la mémoire à prévoir en plus des poids

Prévoyez de la mémoire au-delà des poids pour le cache KV, qui stocke les clés et les valeurs de chaque token de chaque conversation active. Il croît linéairement avec la longueur du contexte et avec le nombre d’utilisateurs servis en même temps.

La formule : octets du cache KV = 2 (clés et valeurs) × couches × têtes KV × dimension des têtes × octets par valeur × tokens × séquences simultanées. Mistral n’a pas encore publié le nombre de couches ni l’architecture d’attention de Large 4 ; ils figureront dans la configuration du modèle à la sortie des poids, et le coût exact par token découlera alors de cette formule.

Exemple de calcul pour un cache de 100 Ko par token : une conversation qui remplit tout le contexte de 524 288 tokens demande 524 288 × 100 Ko ≈ 52,4 Go, tandis que 8 utilisateurs à 32 768 tokens chacun demandent 8 × 32 768 × 100 Ko ≈ 26,2 Go. Sur 8× H200 en FP8, il reste alors peu des 78 Go de marge pour les activations : les longs contextes y imposent un cache KV en FP8 ou des limites plus courtes.

  • Divisez le cache par deux en le stockant en FP8 plutôt qu’en BF16, si votre moteur d’inférence le permet.
  • Limitez le contexte à ce dont vous avez réellement besoin ; 32 768 tokens représentent 1/16 de la fenêtre de 524 288 tokens de l’API.
  • Limitez le nombre de séquences simultanées sur les configurations justes, au lieu de laisser le serveur préallouer pour de nombreux utilisateurs.

Une question sur ce sujet ?

Posez-la directement à Mistral Large 4. Compte gratuit, 15 crédits chaque jour.

Poser ma question

Prise en charge logicielle : vLLM, SGLang, llama.cpp et Ollama

Au 6 octobre 2026, aucune prise en charge de Mistral Large 4 n’a été annoncée dans vLLM, SGLang, llama.cpp ou Hugging Face Transformers ; une recherche dans leurs issues et pull requests GitHub n’a trouvé aucun travail spécifique au modèle. Ollama et LM Studio reposent sur des fichiers GGUF de type llama.cpp : ils dépendent donc de l’arrivée préalable de cette prise en charge.

La génération précédente montre le chemin probable. Mistral Large 3 est sorti avec des poids FP8, une variante NVFP4 et une prise en charge vLLM dès le premier jour (vLLM 1.12.0 ou plus récent avec mistral_common 1.8.6 ou plus récent), et sa fiche recommande un seul nœud de B200 ou de H200 en FP8, et un seul nœud de H100 ou d’A100 en NVFP4.

ModèleParamètres totauxActifs par tokenPoids FP8Poids 4 bits
Mistral Large 3675 Md41 Md≈ 675 Go≈ 338 Go
Large 41,05T49 Md≈ 1 050 Go≈ 525 Go
DeepSeek V4 Pro (0813)1,6T49 Md≈ 1 600 Go≈ 800 Go
Source : fiches des modèles sur Hugging Face (Mistral Large 3, dépôt de Mistral Large 4), fiche OpenRouter de DeepSeek V4 Pro ; mémoire calculée par nos soins, vérifié le 6 oct. 2026.

Pourquoi la vitesse dépend des 49 milliards de paramètres actifs

Le nombre total de paramètres fixe la mémoire nécessaire ; le nombre de paramètres actifs fixe le travail par token. Mistral Large 4 active 49 milliards de paramètres par token (52 milliards en comptant les couches d’embedding et de sortie) : en FP8, chaque token généré lit donc environ 49e9 × 1 octet = 49 Go de poids.

Voilà pourquoi un modèle MoE de 1 050 milliards de paramètres peut générer plus vite que sa taille ne le laisse penser : Artificial Analysis a mesuré 116,1 tokens de sortie par seconde sur l’API hébergée. Votre propre vitesse dépendra de la bande passante mémoire des GPU et de la répartition des experts entre les cartes.

Préparez-vous dès maintenant, téléchargez le jour J

Libérez d’abord de l’espace disque : le téléchargement FP8 seul pèse environ 1,05 To, et une copie BF16 environ 2,1 To. Ces commandes vérifient l’espace disponible et récupèrent le dépôt dès que Mistral publie les fichiers.

  • Utilisez le modèle dès aujourd’hui dans le chat de notre page d’accueil, sans aucune installation.
  • Développez dès maintenant sur l’API hébergée (voir nos pages Guide de l’API et Prix de l’API), puis basculez l’endpoint vers votre propre serveur plus tard.
  • Suivez nos pages Hugging Face et Actualités pour la date des poids, la licence et les formats de fichiers.
# Weight size in GB for a given precision (bytes per parameter)
python3 -c "print(1.05e12 * 1 / 1e9, 'GB at FP8'); print(1.05e12 * 0.5 / 1e9, 'GB at 4-bit')"

# Make sure the target disk has room (about 1.05 TB for FP8)
df -h /models

# Download after the weights are published on Hugging Face
hf download mistralai/Mistral-Large-4.0-1T05-A52B --local-dir /models/mistral-large-4

Sources

FAQ

Questions fréquentes : En local

À lire aussi

En savoir plus sur Mistral Large 4

Posez à Mistral Large 4 une vraie question

Collez un bug, une clause de contrat ou une note de tableur en désordre. Un compte gratuit vous donne 15 crédits chaque jour.

Commencer à discuter