1:1 대결
Llama 4 (Scout / Maverick) vs Claude Opus 4.8: 2026년, 어떤 AI 모델이 이길까?
Llama 4 (Scout / Maverick)($0.60/1M out (Maverick, hosted))와 Claude Opus 4.8($25/1M out)는 2026년 가장 많이 쓰이는 AI 모델 중 둘입니다. 커뮤니티 투표 3건 기준, Claude Opus 4.8가 지지율 57%로 앞서고 있습니다.
빠른 평결
추론 항목에서는 Claude Opus 4.8를 고르세요: 아레나 점수 4.5/5, Llama 4 (Scout / Maverick)는 2.5/5입니다. 예산 면에서는 Llama 4 (Scout / Maverick)의 승리입니다: $0.60/1M out (Maverick, hosted)부터 시작하는 반면, Claude Opus 4.8는 $25/1M out부터입니다.
항목별 비교
강점과 약점
Llama 4 (Scout / Maverick)
- MoE 효율: 토큰당 활성 파라미터가 17B뿐(Scout 109B/16 experts, Maverick 400B/128 experts)이라 GPT-4o급에 근접한 챗을 훨씬 적은 컴퓨트로 제공합니다
- 매우 저렴한 호스팅 추론: Maverick은 입력 약 $0.15/1M, 출력 약 $0.60/1M부터, Scout는 DeepInfra 기준 약 $0.10/$0.30, Groq 기준 $0.11/$0.34부터
- 오픈 웨이트 모델에서 네이티브 얼리퓨전 멀티모달(텍스트와 이미지, 최대 8장 테스트 완료)
- 출시 시점 오픈 웨이트 최대의 명목 컨텍스트: Scout 10M 토큰, Maverick 1M
- Scout는 Int4 양자화로 H100 GPU 한 장에 올라가며, 200개 언어로 사전학습되었습니다
- 높은 처리량: 활성 17B 파라미터로 고속 프로바이더에서 500+ tokens/s에 도달합니다(Groq는 Scout를 594 TPS로 표기)
- 벤치마크 신뢰 훼손: Meta가 미공개 챗 최적화 Maverick 변종을 LMArena에 제출했고(ELO 1417), 공개 가중치는 그보다 낮게 나와 개발자들이 기만적이라고 비판했습니다
- 장문 컨텍스트 주장이 실전에서 무너집니다: Scout는 Fiction.LiveBench 128K에서 약 15.6%(Gemini 2.5 Pro는 90.6%)를 기록했고, 호스팅 프로바이더들은 Scout를 10M보다 훨씬 낮게 제한합니다(예: DeepInfra 약 320K)
- 코딩은 r/LocalLlama와 HN에서 혹평받았으며, 비슷한 가격의 DeepSeek V3에 실전 개발 작업에서 밀립니다
- OSI 기준 오픈소스가 아닙니다: 라이선스가 EU 소재 기업을 배제하고, 700M MAU 초과 시 별도 라이선스를 요구하며, Llama 브랜딩을 의무화합니다
- 총 파라미터 109B/400B는 소비자 GPU에 너무 크고, 계보도 멈췄습니다: 추론 변종은 출시되지 않았고 Behemoth는 끝내 나오지 않았습니다
Claude Opus 4.8
- SWE-Bench Pro 69.2%(Opus 4.7은 64.3%)에 모든 effort 레벨에서 CursorBench 기준 이전 Opus 모델들을 능가하며, 대규모 리팩터링과 다중 파일 버그 추적에서 실사용 평가가 좋습니다
- 자기가 생성한 코드의 결함을 지적 없이 통과시킬 확률이 Opus 4.7 대비 약 4배 낮고, 수학 추론이 크게 뛰었습니다(USAMO 2026: 96.7% vs 69.3%)
- 1M 토큰 컨텍스트와 128K 출력을 가격 변동 없이 $5/$25에, 장문 컨텍스트 할증 없이 제공하며 배치 API는 50% 할인($2.50/$12.50)입니다
- Fast mode(리서치 프리뷰)가 $10/$50에 최대 2.5배 출력 속도를 내며, Opus 4.7의 fast 요금제($30/$150)보다 3배 저렴합니다
- 에이전트를 위한 고유 API 기능: 프롬프트 캐시를 유지하는 대화 중간 시스템 메시지, Claude Code에서 병렬 서브에이전트를 생성하는 Dynamic Workflows
- Online-Mind2Web 브라우저 자동화 84%, Legal Agent Benchmark 신기록(전 항목 통과율 10%를 넘긴 최초 모델), 기업 지식 업무도 강력합니다(Box 내부 측정 87% vs 77%)
- 턴 단위 퇴보 보고가 있습니다: 기획 문서의 명백한 지시를 놓치거나, 목표의 일부만 답하거나, 단순 UI 원샷 생성이 4.7보다 못한 경우가 있습니다
- 헤비 유저들이 문체를 비판합니다: 과도한 얼버무림, '대담하거나 재미있는 건 다 잘라내는' 지나치게 조심스러운 편집(Steve Yegge), 근거가 충분한 논지에도 반박을 반복하는 루프
- 언어 혼입 버그: 긴 리서치 스레드에서 중국어, 키릴 문자, 그리스 문자가 무작위로 끼어든다는 사용자 보고가 있습니다
- 광고된 1M 윈도우에도 불구하고 실사용에서 약 200K 토큰을 넘으면 눈에 띄는 품질 저하가 나타납니다
- Vending-Bench 퇴보: 사기 공급업체에 속는 빈도가 4.7보다 약 30배 높고 협상도 더 못합니다(더 엄격해진 정직성 정렬의 부작용)
평결을 내리세요
검투사 한 명당 툴별 추천 한 번. 모두가 보는 대중 점수가 바뀝니다.
Llama 4 (Scout / Maverick)에 대한 아레나의 평결
EU 밖에서 대용량 챗, 추출, 다국어 워크로드를 위한 저렴하고 빠른 자체 호스팅 멀티모달 모델이 필요하다면 Llama 4를 선택하십시오. Maverick은 GPT-4o에 근접한 품질을 대략 10분의 1 가격에 제공합니다. 코딩, 어려운 추론, 진짜 백만 토큰 검색에는 피하십시오, 그 영역에서는 DeepSeek, Qwen 3, Gemini가 확실히 앞섭니다. Llama 3.3 70B 대비 네이티브 비전과 더 긴 윈도우가 추가되었지만, 순수 텍스트 품질에서는 구형 dense 모델이나 Qwen이 더 믿을 만하다는 개발자가 많았고, 10M 컨텍스트는 대체로 서류상의 숫자입니다.
Claude Opus 4.8에 대한 아레나의 평결
Opus 4.7 사용자에게는 그대로 갈아 끼우면 되는 업그레이드입니다: API 구조와 $5/$25 가격이 동일하면서 장기 에이전트 코딩, 코드 리뷰, 기업 분석에서 실질적인 향상이 있습니다. Claude Code, 다중 파일 마이그레이션, 보안 감사, 여러 단계에 걸쳐 검사하고 실행하고 검증하는 에이전트 파이프라인을 운영한다면 이 모델을 선택하십시오. 사용자들이 퇴보를 보고하는 빠른 원샷 UI 스니펫이나 4.7 동작에 정밀 튜닝된 프롬프트에는 건너뛰고, 최고 성능보다 비용이 중요하다면 Sonnet 5($3/$15, 2026년 8월까지 프로모션 $2/$10)를 선택하십시오. 얼버무림과 과도하게 조심스러운 편집에 민감한 작가라면 문체가 답답하게 느껴질 수 있습니다.
대중의 목소리
Llama 4 (Scout / Maverick)에 대해
아직 평결이 없습니다. 첫 번째로 발언해 보세요.
Claude Opus 4.8에 대해
“Writing took a hit. It hedges everything and edits any bold or funny line out of my drafts. Also caught it answering a narrow slice of my planning doc and calling it done.”
“Threw USAMO-level math at it for a lark and it just grinds through. 96.7 vs 69 for 4.7 tracks with what I see. Same $5/$25, 1M context, no excuse not to switch.”
“Upgraded from 4.7 for a monorepo refactor and the difference is real. It actually flags its own sketchy code instead of shipping it. Multi-file bug hunts feel way less babysat.”
비교 계속하기
자주 묻는 질문
Llama 4 (Scout / Maverick)가 Claude Opus 4.8보다 나은가요?
현재 대중은 Claude Opus 4.8의 편입니다: 추천율 57%, Llama 4 (Scout / Maverick)는 50%입니다(투표 3건). 추론 항목에서는 Claude Opus 4.8가 더 높은 평가를 받았습니다(4.5/5 vs 2.5/5). 정답은 용도에 따라 다릅니다. 이 페이지의 항목별 비교에서 가격, 핵심 스펙, 아레나 평점을 자세히 다룹니다.
Llama 4 (Scout / Maverick)와 Claude Opus 4.8 중 어느 쪽이 더 저렴한가요?
Llama 4 (Scout / Maverick)가 더 저렴합니다: $0.60/1M out (Maverick, hosted)부터 시작하는 반면, Claude Opus 4.8는 $25/1M out부터입니다.
Llama 4 (Scout / Maverick)와 Claude Opus 4.8의 1M 토큰당 비용은 얼마인가요?
Llama 4 (Scout / Maverick): 입력 토큰 1M당 $0.15/1M in (Maverick, hosted), 출력 토큰 1M당 $0.60/1M out (Maverick, hosted). Claude Opus 4.8: 입력 토큰 1M당 $5/1M in, 출력 토큰 1M당 $25/1M out.