Lokaal draaien

Mistral Large 4 lokaal draaien: wat heb je nodig?

Mistral Large 4 lokaal draaien kan nog niet: Mistral AI wil de gewichten eind oktober 2026 publiceren. En ook dan heeft het model van 1,05 biljoen parameters alleen voor de gewichten al ongeveer 1,05 TB GPU-geheugen nodig in FP8, of ongeveer 525 GB in 4-bit. Dat betekent een server met meerdere GPU’s, geen desktop-pc.

Bijgewerkt op 2026-10-07 · Door suifeng

Mistral Large 4 in het kort

Ontwikkelaar
Mistral AI (Parijs, Frankrijk)
Uitgebracht
6 oktober 2026 (public preview)
Parameters
1,05 biljoen in totaal, 49 miljard actief per token (Mixture of Experts)
Contextvenster
524.288 tokens via de API
Maximale output
262.144 tokens
Invoer / uitvoer
Tekst en afbeeldingen erin, tekst eruit
API-prijs (actie)
$ 0,68 input / $ 2,09 output per 1M tokens (normaal $ 1,36 / $ 4,18)
Modelnaam in de API
mistral-large-4
Redeneren
reasoning_effort: "high" of "none"
Open gewichten
Gepland voor eind oktober 2026

Bronnen: aankondiging en prijspagina van Mistral AI, modelpagina op OpenRouter, modelpagina op Hugging Face. Gecontroleerd op 6 okt. 2026.

Kun je Mistral Large 4 vandaag al lokaal draaien?

Nee. Op 6 oktober 2026 staat de Hugging Face-repo mistralai/Mistral-Large-4.0-1T05-A52B vermeld als aankomende release, nog zonder bestanden. In de lanceringspost belooft Mistral de gewichten voor het einde van de maand; de Hugging Face-pagina noemt 31 oktober als verwachte datum en verschillende media melden 27 oktober.

De licentie, de precisie van de bestanden (BF16, FP8 of een 4-bit-formaat) en een aanbevolen hardwarelijst zijn nog niet bekendgemaakt. Alles hieronder is rekenwerk op basis van het gepubliceerde aantal parameters: zo kun je nu al hardware begroten en op de releasedag de exacte bestandsgrootte bevestigen.

Wil je het model alleen gebruiken? Dan heb je dit allemaal niet nodig: je chat nu al met Large 4 op onze homepage, met een gratis account en 15 credits per dag.

Geheugen voor de gewichten per precisie

Het geheugen voor de gewichten is eenvoudig: parameters × bytes per parameter. Large 4 heeft in totaal 1,05 biljoen parameters (1,05e12). In een Mixture-of-Experts-model moet elke expert in het geheugen staan, ook al worden er per token maar 49 miljard parameters gebruikt.

Echte gekwantiseerde bestanden zijn iets groter dan het pure aantal bits, omdat ze ook schaalfactoren opslaan. Een formaat met gemiddeld 4,5 bits per gewicht geeft bijvoorbeeld 1,05e12 × 4,5 / 8 = 590,6 GB in plaats van 525 GB. De vision-encoder van 1,6 miljard parameters voegt weinig toe: 1,6e9 × 2 bytes = 3,2 GB in BF16.

PrecisieBytes per parameterFormuleAlleen gewichten
BF16 / FP1621,05e12 × 2≈ 2.100 GB (2,1 TB)
FP8 / INT811,05e12 × 1≈ 1.050 GB
6-bit0,751,05e12 × 0,75≈ 788 GB
4-bit (NVFP4, Q4-klasse)0,51,05e12 × 0,5≈ 525 GB
3-bit0,3751,05e12 × 0,375≈ 394 GB
2-bit0,251,05e12 × 0,25≈ 263 GB
Bron: ons eigen rekenwerk op basis van de 1,05 biljoen parameters in de Mistral Docs en de naam van de Hugging Face-repo; alleen gewichten, gecontroleerd op 6 okt. 2026.

Welke GPU-opstellingen passen bij Mistral Large 4

Een node met 8× B200 is voor FP8 het meest comfortabele doel op één node; 8× H200 past FP8-gewichten met maar ongeveer 78 GB over; 8× H100 werkt alleen in 4-bit. De tabel zet het totale geheugen naast elke gewichtsgrootte en laat zien wat er overblijft voor de KV-cache en de runtime.

Voor BF16-gewichten heb je twee nodes van 8× H200 nodig. Een werkstation met 512 GB unified memory kan de 4-bit-gewichten niet kwijt en heeft een kwantisatie van 3-bit of kleiner nodig.

OpstellingTotaal geheugenBF16 (2.100 GB)FP8 (1.050 GB)4-bit (525 GB)
1× consumenten-GPU van 24 GB24 GBNeeNeeNee (de gewichten zijn ca. 22× het geheugen)
4× H200 141 GB564 GBNeeNeeJa, ca. 39 GB over (erg krap)
8× H100 80 GB640 GBNeeNeeJa, ca. 115 GB over
8× H200 141 GB1.128 GBNeeJa, ca. 78 GB over (krap)Ja, ca. 603 GB over
8× B200 192 GB1.536 GBNeeJa, ca. 486 GB overJa, ca. 1.011 GB over
16× H200 (twee nodes)2.256 GBJa, ca. 156 GB overJa, ca. 1.206 GB overJa
512 GB unified memory512 GBNeeNeeNee (3-bit met 394 GB laat ca. 118 GB over)
Bron: ons eigen rekenwerk (aantal GPU’s × geheugen per GPU min de gewichtsgrootte), alleen gewichten, gecontroleerd op 6 okt. 2026.

KV-cache: het geheugen dat je bovenop de gewichten nodig hebt

Reken naast de gewichten op geheugen voor de KV-cache. Die bewaart keys en values voor elk token in elk actief gesprek en groeit lineair mee met de contextlengte en met het aantal gebruikers dat je tegelijk bedient.

De formule: bytes KV-cache = 2 (keys en values) × lagen × KV-heads × head-dimensie × bytes per waarde × tokens × gelijktijdige sequenties. Het aantal lagen en de attention-opbouw van Large 4 zijn nog niet gepubliceerd; die staan in de modelconfiguratie zodra de gewichten uitkomen, en dan volgt de exacte kosten per token uit deze formule.

Rekenvoorbeeld voor een cache van 100 KB per token: één gesprek dat de volledige context van 524.288 tokens vult, heeft 524.288 × 100 KB ≈ 52,4 GB nodig, terwijl 8 gebruikers met elk 32.768 tokens 8 × 32.768 × 100 KB ≈ 26,2 GB nodig hebben. Op 8× H200 in FP8 blijft er dan weinig over van de 78 GB ruimte voor activaties, dus lange contexten vragen daar om een KV-cache in FP8 of lagere limieten.

  • Halveer de cache door hem in FP8 op te slaan in plaats van BF16, als je inference-engine dat ondersteunt.
  • Beperk de contextlengte tot wat je echt nodig hebt; 32.768 tokens is 1/16 van het API-venster van 524.288 tokens.
  • Beperk op krappe opstellingen het aantal gelijktijdige sequenties, in plaats van de server voor veel gebruikers vooraf geheugen te laten reserveren.

Heb je hier een vraag over?

Vraag het Mistral Large 4 zelf. Gratis account, elke dag 15 credits.

Nu vragen

Software: vLLM, SGLang, llama.cpp en Ollama

Op 6 oktober 2026 is er in vLLM, SGLang, llama.cpp en Hugging Face Transformers nog geen ondersteuning voor Mistral Large 4 aangekondigd; in hun GitHub-issues en pull requests vonden we geen modelspecifiek werk. Ollama en LM Studio bouwen op GGUF-bestanden in de stijl van llama.cpp en zijn dus afhankelijk van die ondersteuning.

De vorige generatie laat de waarschijnlijke route zien. Mistral Large 3 kwam uit met FP8-gewichten, een NVFP4-variant en vLLM-ondersteuning vanaf dag één (vLLM 1.12.0 of nieuwer met mistral_common 1.8.6 of nieuwer). De modelkaart raadt één node met B200’s of H200’s aan voor FP8, en één node met H100’s of A100’s voor NVFP4.

ModelTotaal parametersActief per tokenFP8-gewichten4-bit-gewichten
Mistral Large 3675B41B≈ 675 GB≈ 338 GB
Large 41,05T49B≈ 1.050 GB≈ 525 GB
DeepSeek V4 Pro (0813)1,6T49B≈ 1.600 GB≈ 800 GB
Bron: modelkaarten op Hugging Face (Mistral Large 3, repo van Mistral Large 4), modelvermelding van DeepSeek V4 Pro op OpenRouter; geheugen is ons eigen rekenwerk, gecontroleerd op 6 okt. 2026.

Waarom de snelheid afhangt van de 49 miljard actieve parameters

Het totaal aantal parameters bepaalt hoeveel geheugen je nodig hebt; de actieve parameters bepalen hoeveel werk elk token kost. Mistral Large 4 activeert 49 miljard parameters per token (52 miljard inclusief embeddings en output-lagen), dus in FP8 leest elk gegenereerd token ruwweg 49e9 × 1 byte = 49 GB aan gewichten.

Daarom kan een MoE-model van 1,05 biljoen parameters sneller genereren dan je op basis van de grootte zou denken: Artificial Analysis mat 116,1 output-tokens per seconde op de gehoste API. Jouw eigen snelheid hangt af van de geheugenbandbreedte van je GPU’s en van hoe de experts over de kaarten verdeeld zijn.

Bereid je nu voor, download op de releasedag

Maak eerst schijfruimte vrij: alleen de FP8-download is al ongeveer 1,05 TB, en een BF16-kopie zou ongeveer 2,1 TB zijn. Met deze commando’s controleer je de ruimte en haal je de repo binnen zodra Mistral de bestanden publiceert.

  • Gebruik het model vandaag al in de chat op onze homepage, zonder installatie.
  • Bouw nu tegen de gehoste API (zie onze API-handleiding en de uitleg over API-prijzen) en zet het endpoint later om naar je eigen server.
  • Volg onze pagina’s over Hugging Face en de laatste updates voor de datum, licentie en bestandsformaten van de gewichten.
# Weight size in GB for a given precision (bytes per parameter)
python3 -c "print(1.05e12 * 1 / 1e9, 'GB at FP8'); print(1.05e12 * 0.5 / 1e9, 'GB at 4-bit')"

# Make sure the target disk has room (about 1.05 TB for FP8)
df -h /models

# Download after the weights are published on Hugging Face
hf download mistralai/Mistral-Large-4.0-1T05-A52B --local-dir /models/mistral-large-4

Bronnen

FAQ

Vragen over Lokaal draaien

Lees verder

Meer over Mistral Large 4

Stel Mistral Large 4 een echte vraag

Plak een bug, een contractclausule of een rommelige notitie uit een spreadsheet. Met een gratis account krijg je elke dag 15 credits.

Begin met chatten