1:1 대결

Llama 4 (Scout / Maverick) 로고vsDeepSeek-V4 로고

Llama 4 (Scout / Maverick) vs DeepSeek-V4: 2026년, 어떤 AI 모델이 이길까?

Llama 4 (Scout / Maverick)($0.60/1M out (Maverick, hosted))와 DeepSeek-V4($0.87/1M out)는 2026년 가장 많이 쓰이는 AI 모델 중 둘입니다. 커뮤니티 투표 3건 기준, DeepSeek-V4가 지지율 57%로 앞서고 있습니다.

빠른 평결

추론 항목에서는 DeepSeek-V4를 고르세요: 아레나 점수 4.5/5, Llama 4 (Scout / Maverick)는 2.5/5입니다. 둘 다 같은 가격에서 시작합니다: $0.60/1M out (Maverick, hosted).

항목별 비교

시작 가격
$0.60/1M out (Maverick, hosted)Meta의 자체 유료 API는 없습니다. Maverick의 일반적인 서드파티 호스팅 요율 기준입니다(Scout는 DeepInfra에서 1M당 약 $0.10/$0.30, Groq에서 $0.11/$0.34부터). 호스팅 Scout의 컨텍스트는 명목 스펙 10M보다 훨씬 낮게 제한됩니다(예: DeepInfra 약 320K).
$0.87/1M outV4-Pro 요금제: 입력 $0.435/1M(캐시 히트 $0.003625), 출력 $0.87/1M. 더 저렴한 V4-Flash 요금제는 $0.14/$0.28(캐시 히트 $0.0028). 출시 기념 75% 할인은 2026-05-22에 정식 가격이 되었습니다. 2026년 7월 중순 정식 출시에서 피크/오프피크 요금제가 도입되어 베이징 피크 시간대에는 표기 요율이 두 배가 됩니다.
제공사
Meta
DeepSeek
컨텍스트 윈도우
10M tokens (Scout) / 1M (Maverick)
1M tokens (384K max output)
입력 가격
$0.15/1M in (Maverick, hosted)
$0.435/1M in (cache hit $0.003625)
출력 가격
$0.60/1M out (Maverick, hosted)
$0.87/1M out
모달리티
text, vision (image input)
text only
오픈 웨이트
있음
있음
대중 점수
50%(0)
57%(3)
아레나 평점(1-5)
추론
2.5
4.5
코딩
2.0
4.5
글쓰기
2.5
3.5
속도
4.5
3.0
가성비
3.5
5.0

강점과 약점

Llama 4 (Scout / Maverick)

  • MoE 효율: 토큰당 활성 파라미터가 17B뿐(Scout 109B/16 experts, Maverick 400B/128 experts)이라 GPT-4o급에 근접한 챗을 훨씬 적은 컴퓨트로 제공합니다
  • 매우 저렴한 호스팅 추론: Maverick은 입력 약 $0.15/1M, 출력 약 $0.60/1M부터, Scout는 DeepInfra 기준 약 $0.10/$0.30, Groq 기준 $0.11/$0.34부터
  • 오픈 웨이트 모델에서 네이티브 얼리퓨전 멀티모달(텍스트와 이미지, 최대 8장 테스트 완료)
  • 출시 시점 오픈 웨이트 최대의 명목 컨텍스트: Scout 10M 토큰, Maverick 1M
  • Scout는 Int4 양자화로 H100 GPU 한 장에 올라가며, 200개 언어로 사전학습되었습니다
  • 높은 처리량: 활성 17B 파라미터로 고속 프로바이더에서 500+ tokens/s에 도달합니다(Groq는 Scout를 594 TPS로 표기)
  • 벤치마크 신뢰 훼손: Meta가 미공개 챗 최적화 Maverick 변종을 LMArena에 제출했고(ELO 1417), 공개 가중치는 그보다 낮게 나와 개발자들이 기만적이라고 비판했습니다
  • 장문 컨텍스트 주장이 실전에서 무너집니다: Scout는 Fiction.LiveBench 128K에서 약 15.6%(Gemini 2.5 Pro는 90.6%)를 기록했고, 호스팅 프로바이더들은 Scout를 10M보다 훨씬 낮게 제한합니다(예: DeepInfra 약 320K)
  • 코딩은 r/LocalLlama와 HN에서 혹평받았으며, 비슷한 가격의 DeepSeek V3에 실전 개발 작업에서 밀립니다
  • OSI 기준 오픈소스가 아닙니다: 라이선스가 EU 소재 기업을 배제하고, 700M MAU 초과 시 별도 라이선스를 요구하며, Llama 브랜딩을 의무화합니다
  • 총 파라미터 109B/400B는 소비자 GPU에 너무 크고, 계보도 멈췄습니다: 추론 변종은 출시되지 않았고 Behemoth는 끝내 나오지 않았습니다

DeepSeek-V4

  • 1M 토큰 컨텍스트 윈도우(V3.2의 128K 대비 8배)와 최대 384K 출력 토큰을 공식 API에서 기본 제공합니다
  • 공격적인 가격: 1M 토큰당 $0.435/$0.87(V4-Pro)로 출력 토큰 기준 Claude Opus 4.8보다 약 28.7배 저렴하며, 캐시 히트 입력은 $0.003625/1M까지 떨어집니다(99% 이상 할인)
  • V4-Pro와 V4-Flash 모두 Hugging Face에 MIT 라이선스 오픈 웨이트로 공개: 상업적 사용, 파인튜닝, 재배포가 허용됩니다
  • 에이전트 코딩의 오픈소스 SOTA: SWE-bench Verified 80.6(Think Max 구성)으로 Gemini 3.1 Pro와 동률, Codeforces 레이팅 3206(인간 대비 약 23위)
  • Artificial Analysis Intelligence Index에서 93개 모델 중 3위(점수 44)로 평균 25를 크게 웃돕니다
  • 희소 어텐션 스택이 1M 컨텍스트 추론을 V3.2 대비 FLOPs 27%, KV 캐시 10% 수준으로 줄입니다
  • 간헐적인 툴 호출 형식 오류: 함수 호출이 tool_calls 필드 대신 content에 일반 텍스트로 출력되는 경우가 있습니다(GitHub 이슈 deepseek-ai #1244)
  • thinking 모드가 에이전트 프레임워크에서 긴 멀티턴 툴 호출 체인을 400 오류로 끊습니다(OpenClaw 이슈 #72044, 수정 미완)
  • 커스텀 코드베이스에서 존재하지 않는 API를 지어내고, 에이전트 루프에서 환각된 사용자 입력에 따라 행동한다는 개발자 보고가 있습니다
  • 매우 장황하고(평가 출력 토큰 180M vs 중앙값 95M) 속도도 중위권인 54.6 tok/s(93개 중 39위)라, 낮은 토큰당 가격이 실전에서는 상당 부분 상쇄됩니다
  • 텍스트 전용(비전, 오디오 없음)이며 아직 프리뷰입니다: 2026년 7월 중순 예정인 정식 출시에서 베이징 업무 시간대에 표기 API 요율이 두 배가 되는 피크 요금제가 도입됩니다

평결을 내리세요

검투사 한 명당 툴별 추천 한 번. 모두가 보는 대중 점수가 바뀝니다.

Llama 4 (Scout / Maverick)$0.60/1M out (Maverick, hosted)
50%대중 점수 · 0
DeepSeek-V4$0.87/1M out
57%대중 점수 · 3

Llama 4 (Scout / Maverick)에 대한 아레나의 평결

EU 밖에서 대용량 챗, 추출, 다국어 워크로드를 위한 저렴하고 빠른 자체 호스팅 멀티모달 모델이 필요하다면 Llama 4를 선택하십시오. Maverick은 GPT-4o에 근접한 품질을 대략 10분의 1 가격에 제공합니다. 코딩, 어려운 추론, 진짜 백만 토큰 검색에는 피하십시오, 그 영역에서는 DeepSeek, Qwen 3, Gemini가 확실히 앞섭니다. Llama 3.3 70B 대비 네이티브 비전과 더 긴 윈도우가 추가되었지만, 순수 텍스트 품질에서는 구형 dense 모델이나 Qwen이 더 믿을 만하다는 개발자가 많았고, 10M 컨텍스트는 대체로 서류상의 숫자입니다.

DeepSeek-V4에 대한 아레나의 평결

Claude Opus나 GPT-5.5 가격의 3배에서 거의 30배 낮은 비용으로 프런티어급에 근접한 추론과 에이전트 코딩을 원하거나, 자체 호스팅과 파인튜닝을 위한 MIT 라이선스 가중치가 중요하다면 DeepSeek-V4를 선택하십시오. V3.2 대비 결정적인 업그레이드입니다: 8배 긴 컨텍스트, 훨씬 저렴한 장문 컨텍스트 추론, 더 강한 코딩, 게다가 레거시 deepseek-chat/reasoner 엔드포인트는 어차피 2026년 7월 24일에 지원이 종료됩니다. 형식 오류가 난 툴 호출과 지어낸 API 보고가 여전한 만큼 견고한 멀티턴 툴 호출에 의존하는 프로덕션 에이전트에는 피하고, 텍스트 전용이므로 비전이나 오디오 작업에도 피하십시오. 장황함과 중위권 54.6 tok/s 출력 속도가 비용 우위를 일부 상쇄하니 지연 시간에 민감한 앱은 먼저 테스트하고, 7월 중순 정식 출시와 함께 오는 피크 시간대 가격 2배도 예산에 반영하십시오.

대중의 목소리

Llama 4 (Scout / Maverick)에 대해

아직 평결이 없습니다. 첫 번째로 발언해 보세요.

DeepSeek-V4에 대해

엄지 다운니쿠스

Tool calling is flaky. Function calls sometimes land as plain text instead of the tool_calls field, and thinking mode 400s on long multi-turn chains. Not agent-ready yet.

공정한 리뷰어

MIT license on both Pro and Flash weights is the real story. Fine-tune, redistribute, ship commercially, no lawyer needed. Plus 384K output tokens for long-doc generation.

출시왕 경

MIT weights, 1M context, and output tokens roughly 29x cheaper than Opus 4.8. Cache hits make input basically free. Moved my bulk pipelines over and the bill collapsed.

자주 묻는 질문

Llama 4 (Scout / Maverick)가 DeepSeek-V4보다 나은가요?

현재 대중은 DeepSeek-V4의 편입니다: 추천율 57%, Llama 4 (Scout / Maverick)는 50%입니다(투표 3건). 추론 항목에서는 DeepSeek-V4가 더 높은 평가를 받았습니다(4.5/5 vs 2.5/5). 정답은 용도에 따라 다릅니다. 이 페이지의 항목별 비교에서 가격, 핵심 스펙, 아레나 평점을 자세히 다룹니다.

Llama 4 (Scout / Maverick)와 DeepSeek-V4 중 어느 쪽이 더 저렴한가요?

시작 가격은 같습니다: 둘 다 $0.60/1M out (Maverick, hosted)부터입니다.

Llama 4 (Scout / Maverick)와 DeepSeek-V4의 1M 토큰당 비용은 얼마인가요?

Llama 4 (Scout / Maverick): 입력 토큰 1M당 $0.15/1M in (Maverick, hosted), 출력 토큰 1M당 $0.60/1M out (Maverick, hosted). DeepSeek-V4: 입력 토큰 1M당 $0.435/1M in (cache hit $0.003625), 출력 토큰 1M당 $0.87/1M out.