1:1 대결

Llama 4 (Scout / Maverick) 로고vsGemini 3 Pro 로고

Llama 4 (Scout / Maverick) vs Gemini 3 Pro: 2026년, 어떤 AI 모델이 이길까?

Llama 4 (Scout / Maverick)($0.60/1M out (Maverick, hosted))와 Gemini 3 Pro($12/1M out (prompts ≤200K))는 2026년 가장 많이 쓰이는 AI 모델 중 둘입니다. 커뮤니티 투표 3건 기준, Gemini 3 Pro가 지지율 57%로 앞서고 있습니다.

빠른 평결

추론 항목에서는 Gemini 3 Pro를 고르세요: 아레나 점수 4.5/5, Llama 4 (Scout / Maverick)는 2.5/5입니다. 예산 면에서는 Llama 4 (Scout / Maverick)의 승리입니다: $0.60/1M out (Maverick, hosted)부터 시작하는 반면, Gemini 3 Pro는 $12/1M out (prompts ≤200K)부터입니다.

항목별 비교

시작 가격
$0.60/1M out (Maverick, hosted)Meta의 자체 유료 API는 없습니다. Maverick의 일반적인 서드파티 호스팅 요율 기준입니다(Scout는 DeepInfra에서 1M당 약 $0.10/$0.30, Groq에서 $0.11/$0.34부터). 호스팅 Scout의 컨텍스트는 명목 스펙 10M보다 훨씬 낮게 제한됩니다(예: DeepInfra 약 320K).
$12/1M out (prompts ≤200K)표준 요금제: 프롬프트 ≤200K는 1M 토큰당 $2/$12, 200K 초과는 $4/$18, 배치 50% 할인. 2026년 3월 9일 퇴역, 후속 Gemini 3.1 Pro가 동일 가격을 유지합니다.
제공사
Meta
Google (DeepMind)
컨텍스트 윈도우
10M tokens (Scout) / 1M (Maverick)
1M tokens (64K output)
입력 가격
$0.15/1M in (Maverick, hosted)
$2/1M in (prompts ≤200K)
출력 가격
$0.60/1M out (Maverick, hosted)
$12/1M out (prompts ≤200K)
모달리티
text, vision (image input)
text, image, audio, video in; text out
오픈 웨이트
있음
없음
대중 점수
50%(0)
57%(3)
아레나 평점(1-5)
추론
2.5
4.5
코딩
2.0
4.5
글쓰기
2.5
3.5
속도
4.5
3.5
가성비
3.5
4.0

강점과 약점

Llama 4 (Scout / Maverick)

  • MoE 효율: 토큰당 활성 파라미터가 17B뿐(Scout 109B/16 experts, Maverick 400B/128 experts)이라 GPT-4o급에 근접한 챗을 훨씬 적은 컴퓨트로 제공합니다
  • 매우 저렴한 호스팅 추론: Maverick은 입력 약 $0.15/1M, 출력 약 $0.60/1M부터, Scout는 DeepInfra 기준 약 $0.10/$0.30, Groq 기준 $0.11/$0.34부터
  • 오픈 웨이트 모델에서 네이티브 얼리퓨전 멀티모달(텍스트와 이미지, 최대 8장 테스트 완료)
  • 출시 시점 오픈 웨이트 최대의 명목 컨텍스트: Scout 10M 토큰, Maverick 1M
  • Scout는 Int4 양자화로 H100 GPU 한 장에 올라가며, 200개 언어로 사전학습되었습니다
  • 높은 처리량: 활성 17B 파라미터로 고속 프로바이더에서 500+ tokens/s에 도달합니다(Groq는 Scout를 594 TPS로 표기)
  • 벤치마크 신뢰 훼손: Meta가 미공개 챗 최적화 Maverick 변종을 LMArena에 제출했고(ELO 1417), 공개 가중치는 그보다 낮게 나와 개발자들이 기만적이라고 비판했습니다
  • 장문 컨텍스트 주장이 실전에서 무너집니다: Scout는 Fiction.LiveBench 128K에서 약 15.6%(Gemini 2.5 Pro는 90.6%)를 기록했고, 호스팅 프로바이더들은 Scout를 10M보다 훨씬 낮게 제한합니다(예: DeepInfra 약 320K)
  • 코딩은 r/LocalLlama와 HN에서 혹평받았으며, 비슷한 가격의 DeepSeek V3에 실전 개발 작업에서 밀립니다
  • OSI 기준 오픈소스가 아닙니다: 라이선스가 EU 소재 기업을 배제하고, 700M MAU 초과 시 별도 라이선스를 요구하며, Llama 브랜딩을 의무화합니다
  • 총 파라미터 109B/400B는 소비자 GPU에 너무 크고, 계보도 멈췄습니다: 추론 변종은 출시되지 않았고 Behemoth는 끝내 나오지 않았습니다

Gemini 3 Pro

  • 출시 시점 LMArena 1위(기록적인 1501 Elo)와 GPQA Diamond 91.9%로 당시 최고 기록
  • ARC-AGI-2 31.1%로 당시 Gemini 2.5 Pro(4.9%)의 약 6배, GPT-5.1(17.6%)의 거의 두 배
  • 동급 최고의 멀티모달 이해: MMMU-Pro 81%, Video-MMMU 87.6%, 1M 토큰 컨텍스트 윈도우
  • 강력한 에이전트 코딩: SWE-bench Verified 76.2%, Terminal-Bench 2.0 54.2%, WebDev Arena 1487 Elo
  • 1M 토큰당 $2/$12로 경쟁사보다 저렴했으며, Claude Sonnet급 가격($3/$15)보다 낮았습니다
  • 조절 가능한 thinking_level(low/medium/high)로 추론 깊이와 지연 시간, 비용을 맞바꿀 수 있습니다
  • 과신에 찬 환각: AA-Omniscience에서 답을 거절하는 대신 88%의 확률로 오답을 냈습니다, Claude Sonnet 4.5는 48%였습니다(the-decoder)
  • 아부 성향이 리뷰어들 사이에서 널리 지적되었습니다(Zvi Mowshowitz: '척추 없는 방대한 지능'). 엄격한 시스템 프롬프트가 필요합니다
  • 에이전트 스택에서 툴 호출 신뢰성 문제: 툴 출력이 챗 스레드에 그대로 쏟아지고, OpenAI/Anthropic 모델보다 스캐폴딩이 더 필요하다는 개발자 보고가 있습니다
  • high thinking 레벨에서 느립니다: 출력 속도는 약 130 tok/s인데도 AI Studio에서 첫 토큰까지 약 30-60초가 측정되었습니다
  • 퇴역: 2026년 3월 9일에 Gemini API와 AI Studio에서 종료되었으며, gemini-3-pro-preview는 이제 Gemini 3.1 Pro로 연결됩니다

평결을 내리세요

검투사 한 명당 툴별 추천 한 번. 모두가 보는 대중 점수가 바뀝니다.

Llama 4 (Scout / Maverick)$0.60/1M out (Maverick, hosted)
50%대중 점수 · 0
Gemini 3 Pro$12/1M out (prompts ≤200K)
57%대중 점수 · 3

Llama 4 (Scout / Maverick)에 대한 아레나의 평결

EU 밖에서 대용량 챗, 추출, 다국어 워크로드를 위한 저렴하고 빠른 자체 호스팅 멀티모달 모델이 필요하다면 Llama 4를 선택하십시오. Maverick은 GPT-4o에 근접한 품질을 대략 10분의 1 가격에 제공합니다. 코딩, 어려운 추론, 진짜 백만 토큰 검색에는 피하십시오, 그 영역에서는 DeepSeek, Qwen 3, Gemini가 확실히 앞섭니다. Llama 3.3 70B 대비 네이티브 비전과 더 긴 윈도우가 추가되었지만, 순수 텍스트 품질에서는 구형 dense 모델이나 Qwen이 더 믿을 만하다는 개발자가 많았고, 10M 컨텍스트는 대체로 서류상의 숫자입니다.

Gemini 3 Pro에 대한 아레나의 평결

2025년 말 Google을 다시 정상에 올려놓은 기념비적인 릴리스로, Gemini 2.5 Pro 대비 거대한 추론 도약과 세대 최고의 멀티모달 점수를 보였습니다. 그러나 2026년 중반 기준으로 선택할 이유가 없습니다: Google이 2026년 3월 9일에 API에서 종료했고, Gemini 3.1 Pro가 정확히 같은 가격에 ARC-AGI-2 성능을 두 배 이상(77.1% vs 31.1%)으로 끌어올렸습니다. 레거시 배포를 쓰는 팀은 3.1 Pro로 이전해야 하며, 어차피 기존 모델 ID도 이제 그쪽을 가리킵니다. 리뷰어들이 반복해서 지적한 약점인 만큼, 그라운딩 없이는 환각에 민감한 워크로드에 피하십시오.

대중의 목소리

Llama 4 (Scout / Maverick)에 대해

아직 평결이 없습니다. 첫 번째로 발언해 보세요.

Gemini 3 Pro에 대해

공포의 판관

Confidently wrong is its worst mode. On AA-Omniscience it gave a wrong answer 88% of the time instead of declining. Add the sycophancy and you need a tight system prompt to trust it.

바이브의 챔피언

ARC-AGI-2 at 31% was about 6x Gemini 2.5 Pro and nearly double GPT-5.1 at the time. For visual-heavy work (81 MMMU-Pro) nothing else came close.

글로리우스 막시무스

1501 Elo on LMArena at launch was deserved. Multimodal is where it kills, I feed it lecture videos and dense PDFs and it just gets it. 1M context helps.

자주 묻는 질문

Llama 4 (Scout / Maverick)가 Gemini 3 Pro보다 나은가요?

현재 대중은 Gemini 3 Pro의 편입니다: 추천율 57%, Llama 4 (Scout / Maverick)는 50%입니다(투표 3건). 추론 항목에서는 Gemini 3 Pro가 더 높은 평가를 받았습니다(4.5/5 vs 2.5/5). 정답은 용도에 따라 다릅니다. 이 페이지의 항목별 비교에서 가격, 핵심 스펙, 아레나 평점을 자세히 다룹니다.

Llama 4 (Scout / Maverick)와 Gemini 3 Pro 중 어느 쪽이 더 저렴한가요?

Llama 4 (Scout / Maverick)가 더 저렴합니다: $0.60/1M out (Maverick, hosted)부터 시작하는 반면, Gemini 3 Pro는 $12/1M out (prompts ≤200K)부터입니다.

Llama 4 (Scout / Maverick)와 Gemini 3 Pro의 1M 토큰당 비용은 얼마인가요?

Llama 4 (Scout / Maverick): 입력 토큰 1M당 $0.15/1M in (Maverick, hosted), 출력 토큰 1M당 $0.60/1M out (Maverick, hosted). Gemini 3 Pro: 입력 토큰 1M당 $2/1M in (prompts ≤200K), 출력 토큰 1M당 $12/1M out (prompts ≤200K).