아레나 · AI 모델 리뷰
Llama 4 (Scout / Maverick)
제공: Meta
Meta의 오픈 웨이트 MoE 듀오: 활성 파라미터 17B, 네이티브 이미지 입력, 서류상 10M 토큰 컨텍스트
$0.60/1M out (Maverick, hosted)
Meta의 자체 유료 API는 없습니다. Maverick의 일반적인 서드파티 호스팅 요율 기준입니다(Scout는 DeepInfra에서 1M당 약 $0.10/$0.30, Groq에서 $0.11/$0.34부터). 호스팅 Scout의 컨텍스트는 명목 스펙 10M보다 훨씬 낮게 제한됩니다(예: DeepInfra 약 320K).
Meta
10M tokens (Scout) / 1M (Maverick)
$0.15/1M in (Maverick, hosted)
$0.60/1M out (Maverick, hosted)
text, vision (image input)
있음
Llama 4 (Scout / Maverick)은(는) 어떤 툴인가?
2025년 4월 5일에 출시된 Meta 최초의 네이티브 멀티모달 mixture-of-experts 오픈 웨이트 모델입니다. Scout(총 109B 파라미터, 16 experts)는 명목상 10M 토큰 컨텍스트로 단일 GPU 배포를 겨냥하고, Maverick(총 400B, 128 experts)은 1M 토큰 윈도우를 갖춘 플래그십 챗 모델입니다.
Llama 4 (Scout / Maverick)의 장단점
장점
- MoE 효율: 토큰당 활성 파라미터가 17B뿐(Scout 109B/16 experts, Maverick 400B/128 experts)이라 GPT-4o급에 근접한 챗을 훨씬 적은 컴퓨트로 제공합니다
- 매우 저렴한 호스팅 추론: Maverick은 입력 약 $0.15/1M, 출력 약 $0.60/1M부터, Scout는 DeepInfra 기준 약 $0.10/$0.30, Groq 기준 $0.11/$0.34부터
- 오픈 웨이트 모델에서 네이티브 얼리퓨전 멀티모달(텍스트와 이미지, 최대 8장 테스트 완료)
- 출시 시점 오픈 웨이트 최대의 명목 컨텍스트: Scout 10M 토큰, Maverick 1M
- Scout는 Int4 양자화로 H100 GPU 한 장에 올라가며, 200개 언어로 사전학습되었습니다
- 높은 처리량: 활성 17B 파라미터로 고속 프로바이더에서 500+ tokens/s에 도달합니다(Groq는 Scout를 594 TPS로 표기)
단점
- 벤치마크 신뢰 훼손: Meta가 미공개 챗 최적화 Maverick 변종을 LMArena에 제출했고(ELO 1417), 공개 가중치는 그보다 낮게 나와 개발자들이 기만적이라고 비판했습니다
- 장문 컨텍스트 주장이 실전에서 무너집니다: Scout는 Fiction.LiveBench 128K에서 약 15.6%(Gemini 2.5 Pro는 90.6%)를 기록했고, 호스팅 프로바이더들은 Scout를 10M보다 훨씬 낮게 제한합니다(예: DeepInfra 약 320K)
- 코딩은 r/LocalLlama와 HN에서 혹평받았으며, 비슷한 가격의 DeepSeek V3에 실전 개발 작업에서 밀립니다
- OSI 기준 오픈소스가 아닙니다: 라이선스가 EU 소재 기업을 배제하고, 700M MAU 초과 시 별도 라이선스를 요구하며, Llama 브랜딩을 의무화합니다
- 총 파라미터 109B/400B는 소비자 GPU에 너무 크고, 계보도 멈췄습니다: 추론 변종은 출시되지 않았고 Behemoth는 끝내 나오지 않았습니다
아레나의 평결
EU 밖에서 대용량 챗, 추출, 다국어 워크로드를 위한 저렴하고 빠른 자체 호스팅 멀티모달 모델이 필요하다면 Llama 4를 선택하십시오. Maverick은 GPT-4o에 근접한 품질을 대략 10분의 1 가격에 제공합니다. 코딩, 어려운 추론, 진짜 백만 토큰 검색에는 피하십시오, 그 영역에서는 DeepSeek, Qwen 3, Gemini가 확실히 앞섭니다. Llama 3.3 70B 대비 네이티브 비전과 더 긴 윈도우가 추가되었지만, 순수 텍스트 품질에서는 구형 dense 모델이나 Qwen이 더 믿을 만하다는 개발자가 많았고, 10M 컨텍스트는 대체로 서류상의 숫자입니다.
엄지 위인가, 엄지 아래인가
평결을 내리세요
Llama 4 (Scout / Maverick)을(를) 추천하시겠습니까, 아니면 대중에게 경고하시겠습니까?
Llama 4 (Scout / Maverick) 대안 베스트
모든 대안 보기Anthropic의 최고속 모델: Sonnet 4.5 코딩 실력의 약 90%를 1M 토큰당 $1/$5에, 200K 컨텍스트.
Anthropic의 2026년 6월 Mythos급 플래그십: SWE-bench Pro 80.3%, 다른 모든 프런티어 모델을 11점 차로 앞섬
Anthropic의 2026년 4월 Opus: SWE-bench Verified 87.6%, 1M 컨텍스트, 고해상도 비전, 현재는 Opus 4.8에 뒤처짐
Llama 4 (Scout / Maverick) 1:1 비교
Llama 4 (Scout / Maverick): 자주 묻는 질문
Llama 4 (Scout / Maverick)의 1M 토큰당 비용은 얼마인가요?
Llama 4 (Scout / Maverick)은(는) 입력 토큰 1M당 $0.15/1M in (Maverick, hosted), 출력 토큰 1M당 $0.60/1M out (Maverick, hosted)입니다. Meta의 자체 유료 API는 없습니다. Maverick의 일반적인 서드파티 호스팅 요율 기준입니다(Scout는 DeepInfra에서 1M당 약 $0.10/$0.30, Groq에서 $0.11/$0.34부터). 호스팅 Scout의 컨텍스트는 명목 스펙 10M보다 훨씬 낮게 제한됩니다(예: DeepInfra 약 320K).