Small 4와 비교

Mistral Large 4 vs Mistral Small 4

같은 8개의 프롬프트, 같은 설정으로 2026년 10월 9일 Mistral API를 통해 두 모델을 테스트했어요. Large 4가 8개 작업 중 6개에서 더 나은 결과를 냈고, 2개는 동점이에요. Small 4는 전체 작업을 29.8초에 끝냈고, Large 4는 55.1초가 걸렸어요. 그리고 비용은 6배나 저렴했어요. 아래에서 각 작업별로 누가 더 잘했는지, 왜 그런지 전부 보여드릴게요.

2026년 10월 9일 업데이트 · 작성자 suifeng

인기 프롬프트

채팅 열기

전체 화면 채팅이 열려요. 대화는 계정에 저장돼요.

Mistral Large 4 한눈에 보기

개발사
Mistral AI (프랑스 파리)
출시
2026년 10월 6일 (퍼블릭 프리뷰)
파라미터
총 1.05조 개, 토큰당 활성 490억 개(49B) (전문가 혼합, MoE)
컨텍스트 윈도우
API 기준 524,288 토큰
최대 출력
262,144 토큰
입력 / 출력
텍스트·이미지 입력, 텍스트 출력
API 가격 (할인가)
100만 토큰당 입력 $0.68 / 출력 $2.09 (정가 $1.36 / $4.18)
API 모델명
mistral-large-4
추론
reasoning_effort: "high" 또는 "none"
오픈 웨이트
2026년 10월 말 공개 예정

출처: Mistral AI 발표문 및 가격 페이지, OpenRouter 모델 목록, Hugging Face 모델 페이지. 2026년 10월 6일 확인.

왜 이 테스트를 했는지

저희 무료 채팅은 신규 계정에게 첫 3번의 답변을 Mistral Large 4로 제공하고, 그다음부터는 Mistral Small 4로 전환돼요. Pro와 크레딧 팩은 계속 Large 4를 사용하고요. 벤치마크 표가 아니라 실제 작업으로, 더 큰 모델이 언제 제값을 하는지 알고 싶었어요. 정가 기준으로 Large 4는 입력 토큰 백만 개당 $1.36, 출력 토큰 백만 개당 $4.18이고, Small 4는 $0.15와 $0.60이에요. 입력은 약 9배, 출력은 약 7배 비싸요.

방법: 실제 업무처럼 보이는(수수께끼가 아닌) 8개의 프롬프트를 각각 mistral-large-4와 mistral-small-2603에 채팅 완성 API로 한 번씩 보냈어요. reasoning_effort는 none으로 설정하고, temperature 0.2, 출력 토큰 상한 1,500으로 했어요. 시간은 아시아에 있는 한 기기에서 측정한 실제 경과 시간이에요. 절대적인 숫자는 다를 수 있지만, 두 모델 사이의 비율이 중요해요. 프롬프트당 한 번씩만 실행했으니 작은 차이는 노이즈로 봐주세요.

점수판

Large 4는 완성도와 지시 이행이 중요한 곳에서 이기고, Small 4는 잘 정의된 변환 작업에서 따라잡고 2~3배 빨라요.

작업Mistral Large 4Mistral Small 4더 나은 답변이유
계약 조항 리스크13.3 s (첫 토큰 1.4 s), 607 tokens3.7 s (첫 토큰 0.6 s), 469 tokensLarge 4다섯 가지 리스크를 각각 정확한 단어와 연결해서 제시; Small 4는 세 가지만 찾고 문장 전체를 인용
두 분기 비교6.8 s (첫 토큰 0.8 s), 373 tokens3.1 s (첫 토큰 0.6 s), 375 tokens동점둘 다 매출총이익($2.56M / $2.30M)과 영업이익($0.46M / $0.60M)을 맞혔어요; Large 4가 더 날카로운 질문을 했어요
파이썬 코드 리뷰10.5 s (첫 토큰 0.8 s), 1042 tokens4.6 s (첫 토큰 0.6 s), 785 tokensLarge 4둘 다 인젝션, 첫 행을 건너뛰는 문제, 닫히지 않은 연결을 찾았어요; Large 4는 컨텍스트 매니저와 이름 있는 열로 고쳤어요
2,800-token 페이지에서 가격 추출3.2 s (첫 토큰 1.0 s), 234 tokens3.8 s (첫 토큰 0.7 s), 488 tokensLarge 4Large 4는 요청한 네 개 모델을 나열했어요; Small 4는 Large 4 가격 등급만 나열했어요. 둘 다 작업 비용은 정확히 계산했어요
지저분한 텍스트를 JSON으로3.0 s (첫 토큰 1.0 s), 195 tokens1.9 s (첫 토큰 0.6 s), 201 tokens동점센트 단위까지 동일한 숫자; Small 4가 더 빨랐어요
관용구가 있는 번역5.4 s (첫 토큰 1.9 s), 255 tokens3.3 s (첫 토큰 0.7 s), 279 tokensLarge 4Large 4는 네 개 언어 모두에서 관용구를 번역했어요; Small 4는 일본어 버전에 "heads up"을 영어 그대로 남겨뒀어요
일정 짜기 퍼즐10.9 s (첫 토큰 0.9 s), 830 tokens8.7 s (첫 토큰 0.6 s), 1500 tokens , cut offLarge 4Large 4는 케이스 분석으로 유일하게 유효한 순서 A-D-B-C-E를 찾았어요; Small 4는 1,500-token 상한에 걸려 두 번째 케이스 도중에 끊겼어요
마케팅 카피 다시 쓰기2.0 s (첫 토큰 1.2 s), 24 tokens0.8 s (첫 토큰 0.6 s), 38 tokensLarge 4Large 4: 22단어, 과장 없음; Small 4는 "Boost"와 "innovate daily"를 썼어요
저희 직접 실행, 2026년 10월 9일, Mistral API, reasoning_effort none, temperature 0.2, 출력 토큰 최대 1,500, 프롬프트당 한 번씩.

Large 4가 확실히 더 나았던 부분

6번 승리한 패턴을 보면, Large 4는 프롬프트가 literally 요청한 것을 정확히 하고 작업이 끝날 때까지 계속해요. Small 4는 질문의 대략적인 형태에 답해요.

  • 계약 조항: 모든 리스크를 해당 리스크를 만드는 정확한 단어와 함께 요청했더니, Large 4는 다섯 가지 리스크(세 가지 해지 조항의 복합 효과 포함)를 나열하고 각각에 대해 정확한 문구를 인용한 다음, 30일 통보와 비례 배상 조항이 포함된 완전한 대체 조항을 작성했어요. Small 4는 세 가지 리스크를 나열하고 문장 전체를 인용했으며, 다시 쓴 조항에 "[X days]"를 그대로 남겨뒀어요.
  • 코드 리뷰: 둘 다 SQL 인젝션, 첫 행을 건너뛰는 루프, 닫히지 않은 연결을 잡아냈어요. Large 4의 수정안은 컨텍스트 매니저, 이름 있는 열이 있는 sqlite3.Row, 그리고 빈 상태 문자열도 걸러내는 "is not None"을 사용했어요. Small 4는 위치 인덱스를 유지했고 "if conn in locals()" 검사로 연결을 닫았어요.
  • 긴 페이지에서 추출: 프롬프트에 저희 2,800-token API 가격 페이지를 붙여넣고 백만 개당 가격이 있는 모든 Mistral 모델을 요청했어요. Large 4는 네 개 모델(Large 4, Large 3, Medium 3.5, Small 4)을 반환했어요. Small 4는 Large 4 가격 등급(배치, 우선, 지역) 열 개 행을 반환했고 다른 모델은 없었어요. 둘 다 50M 입력과 5M 출력 토큰을 정확히 계산했어요: 정가 $88.90, 세일가 $44.45.
  • 관용구가 있는 번역: Large 4는 프랑스어, 독일어, 스페인어, 일본어에서 "heads up"과 "swamped"를 관용적으로 번역했어요. Small 4는 유럽 언어 세 개에서는 괜찮았지만 일본어 문장 안에 "heads up"을 영어 그대로 남겨두고 그에 대한 설명을 덧붙였어요.
  • 일정 짜기 퍼즐: 다섯 개 발표, 다섯 개 제약 조건. Large 4는 A-D 블록의 네 가지 배치 위치를 따져보고 유일하게 유효한 순서인 A-D-B-C-E를 830 tokens로 찾아냈어요. Small 4는 제약 조건을 길게 설명하다가 두 번째 케이스를 끝내기 전에 1,500-token 상한에 걸렸어요.
  • 제약 조건 하에 카피 다시 쓰기(60단어, 과장 단어 없음): Large 4는 22개의 평범한 단어를 반환했어요. Small 4는 "Boost team productivity"로 시작해서 "innovate daily"로 끝나는 30단어를 반환했어요.

Small 4가 충분했던 부분

두 작업은 동점이었고, 둘 다 Small 4가 더 빨랐어요. 송장-JSON 변환은 두 모델 모두 센트 단위까지 동일한 결과를 냈어요(소계 2,580, 세금 490.20, 합계 3,070.20). Small 4는 1.9초, Large 4는 3.0초가 걸렸어요. 두 분기 재무 비교도 두 모델 모두 같은 매출총이익과 영업이익을 냈어요. Large 4의 CFO 질문 세 개는 더 구체적이었고(마진 하락이 믹스 변화인지 가격 압박인지 묻는 등), Small 4의 질문도 충분했어요.

속도: Small 4는 모든 작업에서 0.6~0.7초 만에 답변을 시작했어요. Large 4는 첫 토큰까지 0.8~1.9초, 전체 완료까지 약 2~3배 더 오래 걸렸어요. 짧고 잘 정의된 작업에서는 기다리는 시간이 포기하는 전부예요.

궁금한 점이 있나요?

Mistral Large 4에게 직접 물어보세요. 무료 계정이면 매일 15크레딧을 받아요.

지금 물어보기

각 답변이 얼마 들었는지

토큰 수는 API 자체 사용량 수치예요. 달러는 Mistral 정가 기준이에요(테스트 당시 Large 4는 기간 한정 50% 세일 중이라 해당 열이 절반이에요). 저희 사이트에서는 이 테스트의 모든 답변이 두 모델 모두 크레딧 하나씩 들었어요. 크레딧 하나가 무료 플랜 요금 기준으로 모델 비용 약 $0.0067까지 커버하기 때문이에요. 가격 차이는 긴 답변과 긴 문서에서만 나타나요.

작업Large 4 토큰 입력 / 출력Large 4 비용Small 4 토큰 입력 / 출력Small 4 비용비율
계약 조항 리스크84 / 607$0.002797 / 469$0.00039x
두 분기 비교97 / 373$0.0017119 / 375$0.00027x
파이썬 코드 리뷰136 / 1042$0.0045149 / 785$0.00059x
2,800-token 페이지에서 가격 추출2823 / 234$0.00483149 / 488$0.00086x
지저분한 텍스트를 JSON으로122 / 195$0.0010150 / 201$0.00017x
관용구가 있는 번역69 / 255$0.001281 / 279$0.00026x
일정 짜기 퍼즐71 / 830$0.003683 / 1500$0.00094x
마케팅 카피 다시 쓰기78 / 24$0.000294 / 38$0.00006x
전체 8개 작업3480 / 3560$0.01963922 / 4135$0.00316x
2026년 10월 9일 Mistral API 사용량 보고; 같은 날 Mistral 가격 페이지 기준 가격(Large 4 $1.36 / $4.18, Small 4 $0.15 / $0.60, 백만 토큰당, 정가).

어떤 걸 쓸까요

출력 형식이 정해져 있고 입력이 짧을 때는 Small 4를 쓰세요: 텍스트를 JSON이나 표로 변환, 직접 지정한 필드 추출, 직접 입력한 숫자로 하는 간단한 계산, 주요 유럽 언어 간 짧은 번역. 답변을 확인하지 않고 바로 실행할 때는 Large 4를 쓰세요: 법률 또는 계약 검토, 배포할 코드, 긴 문서에서 "모든" 항목을 요청하는 작업, 제약 조건 퍼즐, 관용구가 중요한 일본어 등 다른 언어, 엄격한 규칙 하의 글쓰기.

저희 채팅에서는 무료 플랜이 첫 3번의 답변을 Large 4로 받아 직접 작업에서 차이를 확인할 수 있게 하고, 그다음부터는 Small 4로 전환돼요. 크레딧 팩이나 Pro는 모든 답변에 Large 4를 사용해요. 가격 페이지에 둘 다 나와 있어요.

직접 재현하는 방법

두 모델은 같은 방식으로 호출해요. 모델 이름만 바뀌어요. API 키를 뺀, 저희가 사용한 요청이에요.

# MISTRAL_KEY holds your Mistral Studio API key (set it in your shell)
curl https://api.mistral.ai/v1/chat/completions \
  -H "Authorization: Bearer $MISTRAL_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mistral-large-4",
    "messages": [{"role": "user", "content": "I am a freelance designer. List every risk in this clause for me, quoting the exact words that create each risk, and rewrite the clause so it is fair to both sides: ..."}],
    "reasoning_effort": "none",
    "temperature": 0.2,
    "max_tokens": 1500
  }'
# then the same call with "model": "mistral-small-2603"

FAQ

Small 4와 비교 자주 묻는 질문

이어서 읽기

Mistral Large 4 더 알아보기

Mistral Large 4에게 진짜 일을 맡겨 보세요

버그 코드, 계약서 조항, 엉망인 엑셀 메모를 붙여 넣어 보세요. 무료 계정이면 매일 15크레딧을 받아요.

채팅 시작하기