vs Small 4

Mistral Large 4 vs Mistral Small 4

Dieselben 8 Prompts, dieselben Einstellungen, beide Modelle über die Mistral-API am 9. Oktober 2026. Large 4 hat bei 6 von 8 Aufgaben die bessere Arbeit geleistet und bei 2 gleichgezogen; Small 4 brauchte für den gesamten Satz 29,8 Sekunden gegenüber 55,1 bei Large 4 und kostete 6-mal weniger. Unten steht jede Aufgabe, wer sie besser gemacht hat und warum.

Aktualisiert am 9. Oktober 2026 · von suifeng

Beliebte Prompts

Chat öffnen

Öffnet den Vollbild-Chat. Deine Chats werden in deinem Konto gespeichert.

Mistral Large 4 auf einen Blick

Entwickler
Mistral AI (Paris, Frankreich)
Veröffentlicht
6. Oktober 2026 (Public Preview)
Parameter
1,05 Billionen insgesamt, 49 Mrd. aktiv pro Token (Mixture of Experts)
Kontextfenster
524.288 Token über die API
Max. Ausgabe
262.144 Token
Ein- / Ausgabe
Text und Bilder rein, Text raus
API-Preis (Aktion)
0,68 $ Input / 2,09 $ Output pro 1 Mio. Token (Listenpreis 1,36 $ / 4,18 $)
API-Modellname
mistral-large-4
Reasoning
reasoning_effort: "high" oder "none"
Offene Gewichte
Geplant für Ende Oktober 2026

Quellen: Ankündigung und Preisseite von Mistral AI, OpenRouter-Modellliste, Hugging-Face-Modellseite. Stand: 6. Oktober 2026.

Warum wir das getestet haben

Unser kostenloser Chat gibt jedem neuen Konto die ersten 3 Antworten auf Mistral Large 4 und wechselt dann zu Mistral Small 4; Pro und Guthaben-Pakete bleiben auf Large 4. Wir wollten mit echten Aufgaben statt Benchmark-Tabellen wissen, wann das größere Modell seinen Preis wert ist: Zum Listenpreis kostet Large 4 $1,36 pro Million Input-Token und $4,18 pro Million Output-Token, Small 4 $0,15 und $0,60, etwa neunmal mehr beim Input und siebenmal mehr beim Output.

Methode: acht Prompts, die wie echte Arbeit aussehen (keine Rätsel), jeweils einmal an mistral-large-4 und mistral-small-2603 über die Chat-Completions-API geschickt, mit reasoning_effort auf none gesetzt, Temperatur 0,2 und einem 1.500-Token-Ausgabelimit. Die Zeit ist Wall-Clock von einem Rechner in Asien, Ihre absoluten Zahlen werden also abweichen; das Verhältnis zwischen den beiden Modellen ist der Punkt. Ein Lauf pro Prompt, kleine Unterschiede also als Rauschen behandeln.

Die Wertungstabelle

Large 4 gewinnt, wo Vollständigkeit und Befolgen von Anweisungen zählen; Small 4 kommt bei klar definierten Konvertierungen gleich und ist zwei- bis dreimal schneller.

AufgabeMistral Large 4Mistral Small 4Bessere AntwortWarum
Vertragsklausel-Risiken13,3 s (erstes Token 1,4 s), 607 Token3,7 s (erstes Token 0,6 s), 469 TokenLarge 4Fünf Risiken, jedes an die exakten Wörter gebunden; Small 4 fand drei und zitierte ganze Sätze
Zwei-Quartals-Vergleich6,8 s (erstes Token 0,8 s), 373 Token3,1 s (erstes Token 0,6 s), 375 TokenGleichstandBeide bekamen Bruttogewinn ($2,56M / $2,30M) und operativen Gewinn ($0,46M / $0,60M) richtig; Large 4 stellte schärfere Fragen
Python-Code-Review10,5 s (erstes Token 0,8 s), 1042 Token4,6 s (erstes Token 0,6 s), 785 TokenLarge 4Beide fanden die Injection, den Off-by-one und die geleakte Verbindung; Large 4 behob sie mit Context-Managern und benannten Spalten
Preise von einer 2.800-Token-Seite3,2 s (erstes Token 1,0 s), 234 Token3,8 s (erstes Token 0,7 s), 488 TokenLarge 4Large 4 listete die vier Modelle, die der Prompt verlangte; Small 4 listete Large-4-Preisstufen. Beide bewerteten die Arbeitslast richtig
Unordentlicher Text zu JSON3,0 s (erstes Token 1,0 s), 195 Token1,9 s (erstes Token 0,6 s), 201 TokenGleichstandIdentische Zahlen bis auf den Cent; Small 4 war schneller
Übersetzung mit einer Redewendung5,4 s (erstes Token 1,9 s), 255 Token3,3 s (erstes Token 0,7 s), 279 TokenLarge 4Large 4 übersetzte die Redewendung in alle vier Sprachen; Small 4 ließ „heads up“ im Japanischen auf Englisch
Planungsrätsel10,9 s (erstes Token 0,9 s), 830 Token8,7 s (erstes Token 0,6 s), 1500 Token , abgeschnittenLarge 4Large 4 fand die einzige gültige Reihenfolge A-D-B-C-E mit einer Fallanalyse; Small 4 traf bei 1.500 Token auf das Limit
Marketingtext umschreiben2,0 s (erstes Token 1,2 s), 24 Token0,8 s (erstes Token 0,6 s), 38 TokenLarge 4Large 4: 22 Wörter, kein Hype; Small 4 nutzte „Boost“ und „innovate daily“
Unser eigener Lauf, 9. Oktober 2026, Mistral-API, reasoning_effort none, Temperatur 0,2, max. 1.500 Output-Token, ein Lauf pro Prompt.

Wo Large 4 klar besser war

Das Muster bei den sechs Siegen: Large 4 tut, was der Prompt wörtlich verlangt, und macht weiter, bis die Aufgabe erledigt ist; Small 4 beantwortet die allgemeine Form der Frage.

  • Vertragsklausel: nach jedem Risiko mit den exakten Wörtern, die es erzeugen, gefragt, listete Large 4 fünf Risiken (einschließlich der kombinierten Wirkung der drei Kündigungsklauseln) und zitierte für jedes das präzise Fragment, dann schrieb es eine vollständige Ersatzklausel mit 30-tägiger Kündigungsfrist und anteiliger Zahlung. Small 4 listete drei Risiken, zitierte ganze Sätze und ließ „[X days]“ in seiner Umschreibung stehen.
  • Code-Review: beide fanden die SQL-Injection, die Schleife, die die erste Zeile überspringt, und die nicht geschlossene Verbindung. Large 4s Fix nutzte Context-Manager, sqlite3.Row mit benannten Spalten und „is not None“, damit ein leerer Status-String trotzdem filtert; Small 4 behielt Positionsindizes bei und schloss die Verbindung mit einer „if conn in locals()“-Prüfung.
  • Extraktion von einer langen Seite: der Prompt fügte unsere 2.800-Token-API-Preisseite ein und verlangte jedes Mistral-Modell mit Preisen pro Million. Large 4 lieferte die vier Modelle (Large 4, Large 3, Medium 3.5, Small 4). Small 4 lieferte zehn Zeilen von Large-4-Preisstufen (Batch, Priorität, regional) und kein anderes Modell. Beide bewerteten dann 50M Input- und 5M Output-Token korrekt: $88,90 Listenpreis, $44,45 im Angebot.
  • Übersetzung mit einer Redewendung: Large 4 wiedergab „heads up“ und „swamped“ idiomatisch auf Französisch, Deutsch, Spanisch und Japanisch. Small 4 war in den drei europäischen Sprachen in Ordnung, ließ aber „heads up“ im japanischen Satz auf Englisch und fügte eine Anmerkung dazu hinzu.
  • Planungsrätsel: fünf Vorträge, fünf Bedingungen. Large 4 arbeitete die vier Platzierungen des A-D-Blocks durch und fand die einzige gültige Reihenfolge, A-D-B-C-E, in 830 Token. Small 4 erklärte die Bedingungen ausführlich und stieß vor dem Abschluss seines zweiten Falls auf das 1.500-Token-Limit.
  • Copy-Umschreibung unter Vorgaben (60 Wörter, keine Hype-Wörter): Large 4 lieferte 22 sachliche Wörter. Small 4 lieferte 30 Wörter, die mit „Boost team productivity“ eröffneten und mit „innovate daily“ endeten.

Wo Small 4 genauso gut war

Zwei Aufgaben waren Gleichstand, und bei beiden war Small 4 schneller. Die Rechnung-zu-JSON-Konvertierung kam von beiden Modellen identisch zurück bis auf den Cent (Zwischensumme 2.580, Steuer 490,20, Summe 3.070,20), in 1,9 Sekunden von Small 4 gegenüber 3,0 von Large 4. Der Zwei-Quartals-Finanzvergleich ergab bei beiden denselben Bruttogewinn und operativen Gewinn; Large 4s drei CFO-Fragen waren spezifischer (fragte, ob der Margenrückgang Mix-Verschiebung oder Preisdruck ist), Small 4s waren angemessen.

Geschwindigkeit: Small 4 begann bei jeder Aufgabe nach 0,6 bis 0,7 Sekunden zu antworten; Large 4 brauchte 0,8 bis 1,9 Sekunden bis zum ersten Token und etwa zwei- bis dreimal länger bis zum Ende. Bei kurzen, klar definierten Aufgaben ist die Wartezeit das Einzige, was Sie aufgeben.

Noch Fragen dazu?

Frag Mistral Large 4 einfach selbst. Kostenloses Konto, jeden Tag 15 Credits.

Jetzt fragen

Was jede Antwort kostete

Die Token-Zahlen sind die eigenen Nutzungsangaben der API; die Dollar-Beträge gelten zu Mistrals Listenpreisen (Large 4 war zum Zeitpunkt unseres Tests in einem befristeten 50%-Angebot, was seine Spalte halbiert). Auf unserer Seite kostete jede Antwort in diesem Test ein Credit bei beiden Modellen, denn ein Credit deckt bis zu etwa $0,0067 Modellkosten zum Satz des kostenlosen Tarifs; der Preisunterschied zeigt sich erst bei langen Antworten und langen Dokumenten.

AufgabeLarge 4 Token ein / ausLarge 4 KostenSmall 4 Token ein / ausSmall 4 KostenVerhältnis
Vertragsklausel-Risiken84 / 607$0.002797 / 469$0.00039x
Zwei-Quartals-Vergleich97 / 373$0.0017119 / 375$0.00027x
Python-Code-Review136 / 1042$0.0045149 / 785$0.00059x
Preise von einer 2.800-Token-Seite2823 / 234$0.00483149 / 488$0.00086x
Unordentlicher Text zu JSON122 / 195$0.0010150 / 201$0.00017x
Übersetzung mit einer Redewendung69 / 255$0.001281 / 279$0.00026x
Planungsrätsel71 / 830$0.003683 / 1500$0.00094x
Marketingtext umschreiben78 / 24$0.000294 / 38$0.00006x
Alle 8 Aufgaben3480 / 3560$0.01963922 / 4135$0.00316x
Nutzung laut Mistral-API am 9. Oktober 2026; Preise von Mistrals Preisseite am selben Tag (Large 4 $1,36 / $4,18, Small 4 $0,15 / $0,60 pro Million Token, Listenpreis).

Welches Modell Sie nutzen sollten

Nutzen Sie Small 4, wenn das Ausgabeformat feststeht und der Input kurz ist: Text in JSON oder eine Tabelle umwandeln, Felder extrahieren, die Sie ausdrücklich nennen, schnelle Rechenaufgaben mit Zahlen, die Sie liefern, kurze Übersetzungen zwischen großen europäischen Sprachen. Nutzen Sie Large 4, wenn Sie auf die Antwort handeln, ohne sie zu prüfen: rechtliche oder Vertragsprüfung, Code, den Sie ausliefern, alles, was nach „jedem“ Element in einem langen Dokument fragt, Bedingungsrätsel, Japanisch oder andere Sprachen, wo Idiomatik zählt, und Schreiben unter strengen Regeln.

In unserem Chat läuft der kostenlose Tarif Ihre ersten 3 Antworten auf Large 4, damit Sie den Unterschied an Ihrer eigenen Aufgabe sehen können, dann wechselt er zu Small 4; ein Guthaben-Paket oder Pro hält jede Antwort auf Large 4. Die Preisseite listet beide.

Wie Sie es reproduzieren

Beide Modelle werden gleich aufgerufen; nur der Modellname ändert sich. Das ist die Anfrage, die wir verwendet haben, ohne den API-Schlüssel.

# MISTRAL_KEY holds your Mistral Studio API key (set it in your shell)
curl https://api.mistral.ai/v1/chat/completions \
  -H "Authorization: Bearer $MISTRAL_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mistral-large-4",
    "messages": [{"role": "user", "content": "I am a freelance designer. List every risk in this clause for me, quoting the exact words that create each risk, and rewrite the clause so it is fair to both sides: ..."}],
    "reasoning_effort": "none",
    "temperature": 0.2,
    "max_tokens": 1500
  }'
# then the same call with "model": "mistral-small-2603"

FAQ

Fragen zu: vs Small 4

Weiterlesen

Mehr zu Mistral Large 4

Stell Mistral Large 4 eine echte Aufgabe

Füg einen Bug, eine Vertragsklausel oder eine chaotische Tabellennotiz ein. Mit einem kostenlosen Konto bekommst du jeden Tag 15 Credits.

Jetzt chatten