1:1 대결

Gemini 3 Pro 로고vsClaude Sonnet 5 로고

Gemini 3 Pro vs Claude Sonnet 5: 2026년, 어떤 AI 모델이 이길까?

Gemini 3 Pro($12/1M out (prompts ≤200K))와 Claude Sonnet 5($15/1M out ($10 intro until 2026-08-31))는 2026년 가장 많이 쓰이는 AI 모델 중 둘입니다. 커뮤니티 투표 6건 기준, Gemini 3 Pro가 지지율 57%로 앞서고 있습니다.

빠른 평결

추론 항목에서는 Gemini 3 Pro와 Claude Sonnet 5가 4.5/5로 동점입니다. 예산 면에서는 Gemini 3 Pro의 승리입니다: $12/1M out (prompts ≤200K)부터 시작하는 반면, Claude Sonnet 5는 $15/1M out ($10 intro until 2026-08-31)부터입니다.

항목별 비교

시작 가격
$12/1M out (prompts ≤200K)표준 요금제: 프롬프트 ≤200K는 1M 토큰당 $2/$12, 200K 초과는 $4/$18, 배치 50% 할인. 2026년 3월 9일 퇴역, 후속 Gemini 3.1 Pro가 동일 가격을 유지합니다.
$15/1M out ($10 intro until 2026-08-31)단일 요금제: 표준 1M 토큰당 $3/$15, 2026년 8월 31일까지 프로모션 $2/$10. Batch API -50%. 새 토크나이저는 같은 텍스트에서 약 30% 더 많은 토큰을 산출해(Anthropic 기준 1.0-1.35x) 실질 비용이 올라갑니다.
제공사
Google (DeepMind)
Anthropic
컨텍스트 윈도우
1M tokens (64K output)
1M tokens (128K max output)
입력 가격
$2/1M in (prompts ≤200K)
$3/1M in ($2 intro until 2026-08-31)
출력 가격
$12/1M out (prompts ≤200K)
$15/1M out ($10 intro until 2026-08-31)
모달리티
text, image, audio, video in; text out
text, vision (image input, text output)
오픈 웨이트
없음
없음
대중 점수
57%(3)
57%(3)
아레나 평점(1-5)
추론
4.5
4.5
코딩
4.5
4.5
글쓰기
3.5
4.5
속도
3.5
4.0
가성비
4.0
4.5

강점과 약점

Gemini 3 Pro

  • 출시 시점 LMArena 1위(기록적인 1501 Elo)와 GPQA Diamond 91.9%로 당시 최고 기록
  • ARC-AGI-2 31.1%로 당시 Gemini 2.5 Pro(4.9%)의 약 6배, GPT-5.1(17.6%)의 거의 두 배
  • 동급 최고의 멀티모달 이해: MMMU-Pro 81%, Video-MMMU 87.6%, 1M 토큰 컨텍스트 윈도우
  • 강력한 에이전트 코딩: SWE-bench Verified 76.2%, Terminal-Bench 2.0 54.2%, WebDev Arena 1487 Elo
  • 1M 토큰당 $2/$12로 경쟁사보다 저렴했으며, Claude Sonnet급 가격($3/$15)보다 낮았습니다
  • 조절 가능한 thinking_level(low/medium/high)로 추론 깊이와 지연 시간, 비용을 맞바꿀 수 있습니다
  • 과신에 찬 환각: AA-Omniscience에서 답을 거절하는 대신 88%의 확률로 오답을 냈습니다, Claude Sonnet 4.5는 48%였습니다(the-decoder)
  • 아부 성향이 리뷰어들 사이에서 널리 지적되었습니다(Zvi Mowshowitz: '척추 없는 방대한 지능'). 엄격한 시스템 프롬프트가 필요합니다
  • 에이전트 스택에서 툴 호출 신뢰성 문제: 툴 출력이 챗 스레드에 그대로 쏟아지고, OpenAI/Anthropic 모델보다 스캐폴딩이 더 필요하다는 개발자 보고가 있습니다
  • high thinking 레벨에서 느립니다: 출력 속도는 약 130 tok/s인데도 AI Studio에서 첫 토큰까지 약 30-60초가 측정되었습니다
  • 퇴역: 2026년 3월 9일에 Gemini API와 AI Studio에서 종료되었으며, gemini-3-pro-preview는 이제 Gemini 3.1 Pro로 연결됩니다

Claude Sonnet 5

  • Sonnet 4.6 대비 큰 에이전트 성능 향상: Terminal-Bench 2.1 80.4% vs 67.0%, OSWorld-Verified 81.2% vs 78.5%, SWE-bench Pro 63.2% vs 58.1%
  • 지식 업무에서 Opus 4.8과 대등하고(GDPval-AA v2: 1,618 vs 1,615) 툴 사용 Humanity's Last Exam에서도 거의 동률(57.4% vs 57.9%)이면서 가격은 Opus 4.8의 60%(프로모션 기간에는 40%)입니다
  • 1M 토큰 컨텍스트 윈도우와 128K 최대 출력, 2026년 8월 31일까지 1M 토큰당 $2/$10의 프로모션 가격
  • 끈질기게 자체 검증하는 에이전트 동작: 실사용 리뷰에 따르면 Sonnet 4.6과 달리 자기 코드를 직접 테스트하고 어려운 문제를 풀릴 때까지 반복합니다
  • xhigh effort 레벨과 고해상도 비전(2576px 이미지)을 갖춘 최초의 Sonnet이며, 적응형 사고가 기본 활성화되어 있습니다
  • Sonnet 4.6보다 높은 코드 리뷰 정밀도(38-40% vs 29%)로 오탐 지적이 더 적습니다
  • 새 토크나이저가 같은 텍스트에서 토큰 수를 약 30% 부풀립니다(Anthropic 기준 1.0-1.35x, Simon Willison 측정 영어 약 1.4x, Python 약 1.28x). 표시 가격은 그대로지만 실질 비용이 올라갑니다
  • 장황하고 토큰을 많이 소모합니다: 독립 테스트에서 작업당 약 $2.29로 Sonnet 4.6의 약 $1.20 대비 높았고(비용 효율 161개 모델 중 101위), high effort에서는 작업당 비용이 Opus 4.8을 넘을 수 있습니다
  • 작은 일상적 수정에서 Sonnet 4.6보다 눈에 띄게 느리고, 단순한 작업을 과도하게 설계하는 경향이 있습니다(CodeRabbit 실사용 리뷰)
  • 샘플링 파라미터(temperature, top_p, top_k)가 제거되었습니다. 기본값이 아닌 값은 400 오류를 반환해 기존 파이프라인이 깨집니다
  • HN/Reddit의 출시 반응은 엇갈렸습니다: '5'라는 이름이 과장이라는 평이 있었고, 강화된 사이버 보안 안전장치가 무해한 보안 관련 작업을 거부할 수 있습니다

평결을 내리세요

검투사 한 명당 툴별 추천 한 번. 모두가 보는 대중 점수가 바뀝니다.

Gemini 3 Pro$12/1M out (prompts ≤200K)
57%대중 점수 · 3
Claude Sonnet 5$15/1M out ($10 intro until 2026-08-31)
57%대중 점수 · 3

Gemini 3 Pro에 대한 아레나의 평결

2025년 말 Google을 다시 정상에 올려놓은 기념비적인 릴리스로, Gemini 2.5 Pro 대비 거대한 추론 도약과 세대 최고의 멀티모달 점수를 보였습니다. 그러나 2026년 중반 기준으로 선택할 이유가 없습니다: Google이 2026년 3월 9일에 API에서 종료했고, Gemini 3.1 Pro가 정확히 같은 가격에 ARC-AGI-2 성능을 두 배 이상(77.1% vs 31.1%)으로 끌어올렸습니다. 레거시 배포를 쓰는 팀은 3.1 Pro로 이전해야 하며, 어차피 기존 모델 ID도 이제 그쪽을 가리킵니다. 리뷰어들이 반복해서 지적한 약점인 만큼, 그라운딩 없이는 환각에 민감한 워크로드에 피하십시오.

Claude Sonnet 5에 대한 아레나의 평결

코딩, 터미널, 컴퓨터 사용 에이전트를 운영하면서 Sonnet 가격에 Opus 4.8에 근접한 품질을 원한다면 Sonnet 5를 선택하십시오. 특히 $2/$10 프로모션 기간에 유리하며, low와 medium effort에서는 Sonnet 4.6의 완전한 상위 호환입니다. 다만 새 토크나이저와 장황함을 예산에 반영하십시오: 실제 작업당 비용이 Sonnet 4.6을 크게 웃돌고, 최고 effort 레벨에서는 해결한 작업당 비용 기준으로 Opus 4.8이 더 나은 선택일 수 있습니다. 지연 시간에 민감한 소규모 수정이나 temperature와 top_p에 의존하는 파이프라인에는 피하십시오, 이제 오류가 발생합니다. 소규모 diff를 대량으로 처리하는 워크로드에는 Sonnet 4.6이 여전히 실용적인 선택입니다.

대중의 목소리

Gemini 3 Pro에 대해

공포의 판관

Confidently wrong is its worst mode. On AA-Omniscience it gave a wrong answer 88% of the time instead of declining. Add the sycophancy and you need a tight system prompt to trust it.

바이브의 챔피언

ARC-AGI-2 at 31% was about 6x Gemini 2.5 Pro and nearly double GPT-5.1 at the time. For visual-heavy work (81 MMMU-Pro) nothing else came close.

글로리우스 막시무스

1501 Elo on LMArena at launch was deserved. Multimodal is where it kills, I feed it lecture videos and dense PDFs and it just gets it. 1M context helps.

Claude Sonnet 5에 대해

이탈왕 캡틴

Cheap per token, pricey per task. Independent tests had it near $2.29 a task vs $1.20 on 4.6, and at high effort it can out-cost Opus 4.8. It will not stop talking.

황금 엄지쿠스

Terminal-Bench going 67 to 80 over Sonnet 4.6 matches what I see. My CI-fix agent went from constant babysitting to mostly hands-off overnight.

성 디플로이우스

Matches Opus 4.8 on knowledge work at 60% of the price, and the intro $2/$10 window makes it silly value. My research agent runs on Sonnet 5 now, zero regrets.

자주 묻는 질문

Gemini 3 Pro가 Claude Sonnet 5보다 나은가요?

정답은 용도에 따라 다릅니다. 이 페이지의 항목별 비교에서 가격, 핵심 스펙, 아레나 평점을 자세히 다룹니다.

Gemini 3 Pro와 Claude Sonnet 5 중 어느 쪽이 더 저렴한가요?

Gemini 3 Pro가 더 저렴합니다: $12/1M out (prompts ≤200K)부터 시작하는 반면, Claude Sonnet 5는 $15/1M out ($10 intro until 2026-08-31)부터입니다.

Gemini 3 Pro와 Claude Sonnet 5의 1M 토큰당 비용은 얼마인가요?

Gemini 3 Pro: 입력 토큰 1M당 $2/1M in (prompts ≤200K), 출력 토큰 1M당 $12/1M out (prompts ≤200K). Claude Sonnet 5: 입력 토큰 1M당 $3/1M in ($2 intro until 2026-08-31), 출력 토큰 1M당 $15/1M out ($10 intro until 2026-08-31).