벤치마크

Mistral Large 4 벤치마크: 공식 결과와 독립 평가

Mistral AI의 출시 발표에 따르면 Mistral Large 4는 DeepSWE v1.1 61.7%, Cybench 93%, Harvey 법률 에이전트 벤치마크 15.8%를 기록했습니다. 반면 독립 지수에서는 전체적으로 중위권입니다. Artificial Analysis Intelligence Index는 38점(225개 중 64위), Vals Index는 48.05%(44개 중 32위)입니다. 가장 확실하게 앞서는 분야는 사이버 보안, 법률 에이전트, 시각적 위치 찾기이며, 종합 지능 지수에서는 아직 GPT-6 Astra와 Claude Opus 5.5가 더 높습니다.

2026년 10월 7일 업데이트 · 작성자 suifeng

Mistral Large 4 한눈에 보기

개발사
Mistral AI (프랑스 파리)
출시
2026년 10월 6일 (퍼블릭 프리뷰)
파라미터
총 1.05조 개, 토큰당 활성 490억 개(49B) (전문가 혼합, MoE)
컨텍스트 윈도우
API 기준 524,288 토큰
최대 출력
262,144 토큰
입력 / 출력
텍스트·이미지 입력, 텍스트 출력
API 가격 (할인가)
100만 토큰당 입력 $0.68 / 출력 $2.09 (정가 $1.36 / $4.18)
API 모델명
mistral-large-4
추론
reasoning_effort: "high" 또는 "none"
오픈 웨이트
2026년 10월 말 공개 예정

출처: Mistral AI 발표문 및 가격 페이지, OpenRouter 모델 목록, Hugging Face 모델 페이지. 2026년 10월 6일 확인.

핵심만 먼저

Mistral Large 4는 보안 업무, 법률·금융 에이전트, 이미지 속 객체 지목에 가장 강하고, 폭넓은 종합 지능 지수에서는 평균 수준입니다. 이 경향은 Mistral 자체 차트와 독립 리더보드 모두에서 똑같이 나타납니다.

  • 보안: CyberGym-E2E 82%, Cybench 93%로 Mistral이 비교한 모든 오픈 웨이트 모델보다 앞섭니다.
  • 법률: Harvey 법률 에이전트 벤치마크 15.8%로 Vals AI 기준 75개 모델 중 6위이며, GPT-6 Astra(5.4%)보다 높습니다.
  • 코딩 에이전트: DeepSWE v1.1 61.7%로 DeepSeek V4 Pro 0813(57)과 Qwen3.8 Max(51)보다 높고, Kimi K3(68)보다는 낮습니다.
  • 비전: Dense200 위치 찾기 42.0점으로 GPT-6 Astra(41.5)를 근소하게 앞섭니다.
  • 종합: Artificial Analysis 38점으로 Claude Opus 5.5(58), GPT-6 Astra(53)에는 못 미치지만 DeepSeek V4 Pro(36.0)보다는 높습니다.

코딩·에이전트 벤치마크 (Mistral 발표)

코딩 에이전트 분야에서 Large 4는 DeepSeek V4 Pro와 Qwen3.8 Max를 이기지만, 일부 테스트에서는 GLM-5.3과 Kimi K3에 밀립니다. Mistral은 Artificial Analysis 테스트 환경으로 측정했고, 경쟁 모델은 각자 선호하는 에이전트 도구(예: Qwen3.8 Max는 Claude Code, DeepSeek은 Codex)를 썼으므로 작은 차이는 박빙으로 보는 것이 맞습니다.

Mistral이 발표한 종합 Coding Agent Index는 49.8%입니다. Surge AI의 코딩 답변 블라인드 사람 평가에서는 5점 만점에 3.74점을 받아 Kimi K3(3.59), GLM-5.3(3.60)보다 높고 Claude Opus 5(4.22)보다는 낮았습니다.

벤치마크Mistral Large 4DeepSeek V4 Pro 0813Qwen3.8 MaxGLM-5.3Kimi K3
DeepSWE v1.161.7%57516168
Terminal-Bench 4.028.3%10174021
SWE-Atlas-QnA59.4%66625962
AutomationBench (워크플로 657개)59.9%56.757.2 (2.4T A95B)62.258.3
Surge AI 사람 평가, 코딩 (1-5)3.74--3.603.59
출처: Mistral AI의 Mistral Large 4 발표(업체 발표 수치, 프리뷰 모델). 2026년 10월 6일 확인.

사이버 보안·안전성 벤치마크

Large 4가 가장 돋보이는 분야는 사이버 보안입니다. 실제 취약점을 재현한 뒤 패치까지 하게 하는 CyberGym-E2E에서 82%를 기록했는데, Mistral에 따르면 Claude Opus 5.5와 GPT-6 Astra는 과제 수행을 거부해 점수가 0에 가까웠습니다. Artificial Analysis Cyber Index에서는 과제 50개를 해결해 GPT-6 Astra(33개), Claude Opus 5.5(29개)를 앞섰습니다.

명백히 해로운 요청은 거부합니다. JailbreakBench, StrongREJECT, AgentHarm 평균 95.3점, Lakera의 B3 에이전트 보안 테스트에서 공격 저항률 93.3%를 기록했습니다. Mistral은 웨이트 공개 전에 사이버 보안 선도 기업, 검증된 파트너, 정부 기관에 레드팀 테스트용으로 검열을 완화한 빌드를 제공합니다.

벤치마크Mistral Large 4최고 경쟁 모델기타 경쟁 모델
CyberGym-E2E (재현 + 패치)82%MiMo-V2.6-Pro 79Grok 4.7 74, Kimi K3 58, GLM-5.3 29
Cybench (CTF 과제 40개)93%Kimi K3 90DeepSeek V4 Pro 0813 88, GLM-5.3 85
AA Cyber Index (성공 수)50GLM-5.3-Flash 50Kimi K3 41, GPT-6 Astra 33, Claude Opus 5.5 29
해로운 사이버 요청 거부 (평균)95.3Kimi K3 93.7GLM-5.3 87, DeepSeek V4 Pro 0813 77.7
B3 에이전트 보안 (Lakera)93.3%GLM-5.3 93.3Kimi K3 88.1, DeepSeek V4 Pro 0813 85.2
출처: Mistral AI의 Mistral Large 4 발표 차트(업체 발표 수치). 2026년 10월 6일 확인.

금융, 법률, 과학, 비전

전문 업무에서는 법률 에이전트에서 확실히 앞서고 금융과 과학에서도 경쟁력이 있습니다. Harvey 법률 에이전트 벤치마크 15.8점은 GPT-6 Astra(5.4)의 약 3배입니다. Finance Agent v2에서는 54.7점으로 GPT-6 Astra(53.5)보다 조금 높고 GLM-5.3(55.8)보다 조금 낮습니다.

이미지에서는 차트를 읽고 객체 위치를 찾는 능력이 좋습니다. Dense200은 모델이 바운딩 박스를 얼마나 정확하게 그리는지 측정하는데, Large 4는 42.0점으로 GPT-6 Astra 41.5점, Kimi K3 28.9점보다 높습니다. ChartQA Pro는 63.1점으로 GPT-6 Astra(65.1)보다 약간 낮습니다.

벤치마크Mistral Large 4GPT-6 AstraKimi K3DeepSeek V4 Pro / V4.1 Flash
Harvey 법률 에이전트 벤치마크15.85.412.97.5 (Pro)
Finance Agent v254.753.553.150.4 (Pro)
Finch (FinWorkBench)67.457.077.367.4 (Pro)
SciCode-Verified pass@191.894.290.391 (Pro)
Dense200 시각적 위치 찾기42.041.528.93.3 (V4.1 Flash)
ChartQA Pro63.165.161.759.9 (V4.1 Flash)
GDP.pdf18.6-2212.8 (V4.1 Flash)
출처: Mistral AI의 Mistral Large 4 발표(업체 발표 수치). 2026년 10월 6일 확인.

궁금한 점이 있나요?

Mistral Large 4에게 직접 물어보세요. 무료 계정이면 매일 15크레딧을 받아요.

지금 물어보기

독립 평가: Artificial Analysis

Artificial Analysis는 Intelligence Index v4.3.2에서 Large 4에 38점을 매겨 225개 모델 중 64위, 오픈 웨이트 모델 중 8위로 평가했습니다. DeepSeek V4 Pro(36.0)와 GLM-5.2(33.7)보다 높고, GLM-5.3(45)과 MiMo-V2.6-Pro(46)보다 낮습니다.

빠르지만 말이 많습니다. 출력 속도는 초당 116.1토큰으로 중앙값 87보다 빠르지만, 지수를 끝내는 데 출력 토큰 2억 개를 써서 중앙값 8,100만 개를 크게 넘었습니다. 답변이 길어지면 비용과 대기 시간도 늘어납니다. 웨이트가 아직 공개되지 않아 Artificial Analysis는 현재 이 모델을 비공개(proprietary) 모델로 분류하고 있습니다.

지표Mistral Large 4비교 기준
Intelligence Index v4.3.238 (225개 중 64위)Claude Opus 5.5 58, GPT-6 Astra 53, Gemini 4 Argon 53, GPT-6.1 Sol 52
오픈 웨이트 순위8위DeepSeek V4 Pro 36.0, GLM-5.2 33.7
출력 속도116.1 토큰/초 (51위)중앙값 87 토큰/초
첫 토큰까지 걸린 시간1.46초-
지수 전체 실행에 쓴 출력 토큰200M중앙값 81M
지수 과제당 비용 (정가)$1.13-
출처: Artificial Analysis 모델 페이지, trendingtopics.eu의 AA 데이터 요약. 2026년 10월 6일 확인.

독립 평가: Vals AI

Vals AI는 Mistral Large 4를 Vals Index v2.1에서 48.05%로 44개 모델 중 32위에 올렸습니다. Qwen 3.8 Max(48.27%), DeepSeek V4 Pro 0813(47.63%)과 거의 같은 수준입니다. 이 지수 1위는 68.90%의 Gemini 4 Argon, 2위는 66.97%의 Claude Opus 5.5입니다.

Vals에서 가장 순위가 높은 분야는 법률과 금융 업무이고, 가장 약한 분야는 형식 증명과 퍼즐형 과학 추론입니다.

Vals 벤치마크점수순위
Vals Index v2.148.05%44개 중 32위
Harvey 법률 에이전트 벤치마크15.83%75개 중 6위
BioMysteryBench67.04%24개 중 17위
Vibe Code Bench 1-10014.26%21개 중 16위
Terminal-Bench 4.022.73%44개 중 20위
Finance Agent v254.68%75개 중 22위
Tax Agent Bench63.29%66개 중 25위
Vibe Code Bench v1.178.40%109개 중 25위
IOI45.28%41개 중 28위
Code Migration30.56%74개 중 38위
ProofBench v1.110.00%47개 중 42위
MysteryMechanism12.16%24개 중 24위
출처: Vals AI의 Mistral Large 4 모델 페이지와 Vals Index. 2026년 10월 6일 확인.

이 숫자들을 읽는 법

업체 발표 점수와 독립 평가 점수는 서로 다른 질문에 답합니다. 모델을 고르기 전에 둘 사이의 차이를 알아 두면 도움이 됩니다.

  • Terminal-Bench 4.0은 테스트 환경에 따라 다릅니다. Mistral의 Artificial Analysis 실행에서는 28.3%, Vals AI에서는 22.73%입니다.
  • Mistral은 SciCode-Verified 결과를 오픈 웨이트 모델 중 최고 수준이라고 했지만, 자체 차트에서도 MiMo-V2.6-Pro(91.9), GLM-5.3(92.5), Qwen3.8 2.4T A95B(93.8)가 Large 4의 91.8보다 높습니다.
  • GLM-5.3 대비 내부 전문가 승률은 STEM이 분야 차트에서 68%, 세부 차트에서 69%이고, CAD 62%, 금융 50%, 코드 48%입니다.
  • Mistral의 모든 수치는 2026년 10월 6일 공개된 프리뷰 빌드 기준이며, 최종 웨이트가 나오면 점수가 바뀔 수 있습니다.
  • 일부 사용자에게는 추론 강도가 품질보다 비용에 더 큰 영향을 줍니다. Hacker News에서 Simon Willison은 자신의 테스트에서 reasoning_effort "high"와 "none"의 차이가 거의 없었다고 밝혔습니다.

내 프롬프트로 직접 확인하기

벤치마크는 평균을 보여 줄 뿐이고, 중요한 건 내 프롬프트에서의 결과입니다. 홈페이지 채팅에서 코딩, 법률, 금융 질문을 Mistral Large 4에 직접 보내 보세요. 무료 계정이면 하루 15크레딧을 받습니다. 이 성능을 내는 데 드는 토큰 비용은 API 가격 페이지에, 모델 간 정면 비교는 DeepSeek V4 비교와 Mistral Large 3 비교 가이드에 정리해 두었습니다.

출처

FAQ

벤치마크 자주 묻는 질문

이어서 읽기

Mistral Large 4 더 알아보기

Mistral Large 4에게 진짜 일을 맡겨 보세요

버그 코드, 계약서 조항, 엉망인 엑셀 메모를 붙여 넣어 보세요. 무료 계정이면 매일 15크레딧을 받아요.

채팅 시작하기