로컬 실행

Mistral Large 4 로컬에서 실행하는 방법

Mistral Large 4는 아직 로컬에서 실행할 수 없습니다. Mistral AI는 2026년 10월 말에 웨이트를 공개할 계획이며, 공개되더라도 1.05조 파라미터 모델은 웨이트만으로 FP8 기준 약 1.05TB, 4비트 기준 약 525GB의 GPU 메모리가 필요합니다. 데스크톱 PC가 아니라 멀티 GPU 서버가 있어야 한다는 뜻입니다.

2026년 10월 7일 업데이트 · 작성자 suifeng

Mistral Large 4 한눈에 보기

개발사
Mistral AI (프랑스 파리)
출시
2026년 10월 6일 (퍼블릭 프리뷰)
파라미터
총 1.05조 개, 토큰당 활성 490억 개(49B) (전문가 혼합, MoE)
컨텍스트 윈도우
API 기준 524,288 토큰
최대 출력
262,144 토큰
입력 / 출력
텍스트·이미지 입력, 텍스트 출력
API 가격 (할인가)
100만 토큰당 입력 $0.68 / 출력 $2.09 (정가 $1.36 / $4.18)
API 모델명
mistral-large-4
추론
reasoning_effort: "high" 또는 "none"
오픈 웨이트
2026년 10월 말 공개 예정

출처: Mistral AI 발표문 및 가격 페이지, OpenRouter 모델 목록, Hugging Face 모델 페이지. 2026년 10월 6일 확인.

지금 Mistral Large 4를 로컬에서 돌릴 수 있나요?

아니요. 2026년 10월 6일 기준 Hugging Face 저장소 mistralai/Mistral-Large-4.0-1T05-A52B는 파일 없이 공개 예정 상태로만 올라와 있습니다. Mistral 출시 글은 이달 말까지 웨이트를 공개하겠다고 했고, Hugging Face 페이지의 예정일은 10월 31일이며, 여러 매체는 10월 27일로 보도했습니다.

Mistral은 라이선스, 파일 정밀도(BF16, FP8 또는 4비트 포맷), 권장 하드웨어 목록을 아직 발표하지 않았습니다. 아래 내용은 모두 공개된 파라미터 수로 계산한 값이므로, 지금 하드웨어 예산을 잡아 두고 공개일에 정확한 파일 크기만 확인하면 됩니다.

모델을 쓰기만 하려면 이런 준비가 전혀 필요 없습니다. 홈페이지에서 무료 계정으로 하루 15크레딧을 받아 지금 바로 Large 4와 대화할 수 있습니다.

정밀도별 웨이트 메모리

웨이트 메모리 계산은 간단합니다. 파라미터 수 × 파라미터당 바이트입니다. Large 4의 총 파라미터는 1.05조 개(1.05e12)이고, 전문가 혼합(MoE) 모델은 토큰당 490억 개(49B)만 쓰더라도 모든 전문가가 메모리에 올라가 있어야 합니다.

실제 양자화 파일은 스케일 값도 함께 저장하기 때문에 순수 비트 계산보다 조금 큽니다. 예를 들어 가중치당 평균 4.5비트인 포맷은 525GB가 아니라 1.05e12 × 4.5 / 8 = 590.6GB가 됩니다. 16억 파라미터(1.6B) 비전 인코더는 BF16 기준 1.6e9 × 2바이트 = 3.2GB로 거의 영향이 없습니다.

정밀도파라미터당 바이트공식웨이트만
BF16 / FP1621.05e12 × 2≈ 2,100 GB (2.1 TB)
FP8 / INT811.05e12 × 1≈ 1,050 GB
6비트0.751.05e12 × 0.75≈ 788 GB
4비트 (NVFP4, Q4 계열)0.51.05e12 × 0.5≈ 525 GB
3비트0.3751.05e12 × 0.375≈ 394 GB
2비트0.251.05e12 × 0.25≈ 263 GB
출처: Mistral Docs와 Hugging Face 저장소 이름에 나온 1.05T 파라미터 수로 직접 계산(웨이트만). 2026년 10월 6일 확인.

Mistral Large 4가 들어가는 GPU 구성

FP8로 단일 노드에 가장 여유 있게 올리려면 8× B200 노드가 좋습니다. 8× H200은 FP8 웨이트가 들어가지만 남는 메모리가 약 78GB뿐이고, 8× H100은 4비트에서만 가능합니다. 아래 표는 각 구성의 총 메모리를 웨이트 크기와 비교하고, KV 캐시와 런타임에 쓸 수 있는 남은 메모리를 보여 줍니다.

BF16 웨이트를 올리려면 8× H200 노드 두 대가 필요합니다. 512GB 통합 메모리 워크스테이션에는 4비트 웨이트도 들어가지 않아 3비트 이하 양자화가 필요합니다.

구성총 메모리BF16 (2,100 GB)FP8 (1,050 GB)4비트 (525 GB)
24 GB 소비자용 GPU 1장24 GB불가불가불가 (웨이트가 메모리의 약 22배)
4× H200 141 GB564 GB불가불가가능, 약 39 GB 남음 (매우 빠듯)
8× H100 80 GB640 GB불가불가가능, 약 115 GB 남음
8× H200 141 GB1,128 GB불가가능, 약 78 GB 남음 (빠듯)가능, 약 603 GB 남음
8× B200 192 GB1,536 GB불가가능, 약 486 GB 남음가능, 약 1,011 GB 남음
16× H200 (두 노드)2,256 GB가능, 약 156 GB 남음가능, 약 1,206 GB 남음가능
512 GB 통합 메모리512 GB불가불가불가 (3비트 394 GB면 약 118 GB 남음)
출처: 직접 계산(GPU 수 × GPU당 메모리 − 웨이트 크기, 웨이트만 기준). 2026년 10월 6일 확인.

KV 캐시: 웨이트 외에 추가로 필요한 메모리

웨이트 외에 KV 캐시용 메모리도 계획해야 합니다. KV 캐시는 진행 중인 모든 대화의 모든 토큰에 대해 키와 값을 저장하며, 컨텍스트 길이와 동시 사용자 수에 비례해 늘어납니다.

공식은 다음과 같습니다. KV 캐시 바이트 = 2(키와 값) × 레이어 수 × KV 헤드 수 × 헤드 차원 × 값당 바이트 × 토큰 수 × 동시 시퀀스 수. Mistral은 Large 4의 레이어 수와 어텐션 구조를 아직 공개하지 않았습니다. 웨이트가 나오면 모델 설정(config)에 들어 있을 것이고, 그때 이 공식으로 토큰당 정확한 비용을 구할 수 있습니다.

토큰당 100KB가 드는 캐시를 예로 계산해 보겠습니다. 524,288 토큰 컨텍스트 전체를 채우는 대화 하나는 524,288 × 100KB ≈ 52.4GB, 사용자 8명이 각각 32,768 토큰을 쓰면 8 × 32,768 × 100KB ≈ 26.2GB가 필요합니다. 8× H200에 FP8로 올리면 78GB 여유 중 활성화 값에 쓸 공간이 거의 남지 않으므로, 긴 컨텍스트를 쓰려면 FP8 KV 캐시를 쓰거나 길이 제한을 줄여야 합니다.

  • 추론 엔진이 지원한다면 캐시를 BF16 대신 FP8로 저장해 절반으로 줄이세요.
  • 실제로 필요한 만큼만 컨텍스트 길이를 제한하세요. 32,768 토큰은 API의 524,288 토큰 창의 16분의 1입니다.
  • 여유가 적은 구성에서는 서버가 많은 사용자 몫을 미리 할당하지 않도록 동시 시퀀스 수를 제한하세요.

궁금한 점이 있나요?

Mistral Large 4에게 직접 물어보세요. 무료 계정이면 매일 15크레딧을 받아요.

지금 물어보기

소프트웨어 지원: vLLM, SGLang, llama.cpp, Ollama

2026년 10월 6일 기준 vLLM, SGLang, llama.cpp, Hugging Face Transformers 어디에서도 Mistral Large 4 지원이 발표되지 않았고, 각 GitHub 이슈와 풀 리퀘스트를 검색해도 이 모델 전용 작업은 찾을 수 없었습니다. Ollama와 LM Studio는 llama.cpp 방식의 GGUF 파일을 쓰므로, 그쪽 지원이 먼저 들어와야 합니다.

이전 세대를 보면 예상 경로가 보입니다. Mistral Large 3는 FP8 웨이트, NVFP4 변형과 함께 출시 첫날부터 vLLM을 지원했고(vLLM 1.12.0 이상, mistral_common 1.8.6 이상), 모델 카드에서는 FP8에 B200 또는 H200 단일 노드, NVFP4에 H100 또는 A100 단일 노드를 권장했습니다.

모델총 파라미터토큰당 활성FP8 웨이트4비트 웨이트
Mistral Large 3675B41B≈ 675 GB≈ 338 GB
Large 41.05T49B≈ 1,050 GB≈ 525 GB
DeepSeek V4 Pro (0813)1.6T49B≈ 1,600 GB≈ 800 GB
출처: Hugging Face 모델 카드(Mistral Large 3, Mistral Large 4 저장소), DeepSeek V4 Pro의 OpenRouter 모델 목록. 메모리는 직접 계산. 2026년 10월 6일 확인.

속도가 활성 파라미터 490억 개에 달린 이유

필요한 메모리는 총 파라미터가, 토큰 하나를 만드는 작업량은 활성 파라미터가 결정합니다. Mistral Large 4는 토큰당 490억 개(49B) 파라미터를 활성화하므로(임베딩과 출력 레이어를 포함하면 520억 개), FP8에서는 토큰 하나를 생성할 때마다 약 49e9 × 1바이트 = 49GB의 웨이트를 읽습니다.

그래서 1.05조 파라미터 MoE 모델이 크기에 비해 빠르게 생성할 수 있습니다. Artificial Analysis는 호스팅 API에서 초당 116.1 출력 토큰을 측정했습니다. 직접 돌릴 때의 속도는 GPU 메모리 대역폭과 전문가를 카드에 어떻게 나눠 올리는지에 따라 달라집니다.

지금 준비하고, 공개일에 내려받기

먼저 디스크 공간을 확보하세요. FP8 파일만 약 1.05TB이고, BF16 사본은 약 2.1TB입니다. 아래 명령어로 공간을 확인하고, Mistral이 파일을 공개하면 저장소를 내려받을 수 있습니다.

  • 설치 없이 지금 바로 홈페이지 채팅에서 모델을 써 보세요.
  • 지금은 호스팅 API로 개발하고(API 사용법, API 가격 가이드 참고), 나중에 엔드포인트만 내 서버로 바꾸세요.
  • 웨이트 공개일, 라이선스, 파일 포맷은 웨이트·라이선스 페이지와 업데이트 페이지에서 확인하세요.
# Weight size in GB for a given precision (bytes per parameter)
python3 -c "print(1.05e12 * 1 / 1e9, 'GB at FP8'); print(1.05e12 * 0.5 / 1e9, 'GB at 4-bit')"

# Make sure the target disk has room (about 1.05 TB for FP8)
df -h /models

# Download after the weights are published on Hugging Face
hf download mistralai/Mistral-Large-4.0-1T05-A52B --local-dir /models/mistral-large-4

출처

FAQ

로컬 실행 자주 묻는 질문

이어서 읽기

Mistral Large 4 더 알아보기

Mistral Large 4에게 진짜 일을 맡겨 보세요

버그 코드, 계약서 조항, 엉망인 엑셀 메모를 붙여 넣어 보세요. 무료 계정이면 매일 15크레딧을 받아요.

채팅 시작하기