핵심만 먼저
Mistral Large 4는 보안 업무, 법률·금융 에이전트, 이미지 속 객체 지목에 가장 강하고, 폭넓은 종합 지능 지수에서는 평균 수준입니다. 이 경향은 Mistral 자체 차트와 독립 리더보드 모두에서 똑같이 나타납니다.
- 보안: CyberGym-E2E 82%, Cybench 93%로 Mistral이 비교한 모든 오픈 웨이트 모델보다 앞섭니다.
- 법률: Harvey 법률 에이전트 벤치마크 15.8%로 Vals AI 기준 75개 모델 중 6위이며, GPT-6 Astra(5.4%)보다 높습니다.
- 코딩 에이전트: DeepSWE v1.1 61.7%로 DeepSeek V4 Pro 0813(57)과 Qwen3.8 Max(51)보다 높고, Kimi K3(68)보다는 낮습니다.
- 비전: Dense200 위치 찾기 42.0점으로 GPT-6 Astra(41.5)를 근소하게 앞섭니다.
- 종합: Artificial Analysis 38점으로 Claude Opus 5.5(58), GPT-6 Astra(53)에는 못 미치지만 DeepSeek V4 Pro(36.0)보다는 높습니다.
