Head-to-head
Gemini 3 Pro vs Claude Sonnet 5: model AI mana yang menang di 2026?
Gemini 3 Pro ($12/1M out (prompts ≤200K)) dan Claude Sonnet 5 ($15/1M out ($10 intro until 2026-08-31)) adalah dua model AI yang paling banyak dipakai di 2026. Dari 6 suara komunitas, Gemini 3 Pro memimpin dengan persetujuan 57%.
Vonis singkat
Soal Penalaran, Gemini 3 Pro dan Claude Sonnet 5 imbang di 4.5/5. Soal budget, Gemini 3 Pro menang: harganya mulai dari $12/1M out (prompts ≤200K) berbanding $15/1M out ($10 intro until 2026-08-31) untuk Claude Sonnet 5.
Perbandingan baris demi baris
Kekuatan dan kelemahan
Gemini 3 Pro
- Memuncaki LMArena saat peluncuran dengan rekor 1501 Elo dan mencetak 91.9% di GPQA Diamond, state of the art saat rilis
- ARC-AGI-2 di 31.1%, kira-kira 6x Gemini 2.5 Pro (4.9%) dan hampir dua kali lipat GPT-5.1 (17.6%) pada masanya
- Pemahaman multimodal terbaik di kelasnya: 81% MMMU-Pro, 87.6% Video-MMMU, dengan context window 1M token
- Coding agentik kuat: 76.2% SWE-bench Verified, 54.2% Terminal-Bench 2.0, 1487 Elo di WebDev Arena
- Memotong harga pesaing di $2/$12 per 1M tokens, di bawah harga kelas Claude Sonnet ($3/$15)
- thinking_level yang bisa dikonfigurasi (low/medium/high) memungkinkan developer menukar kedalaman penalaran dengan latensi dan biaya
- Halusinasi yang terlalu percaya diri: di AA-Omniscience ia memberi jawaban salah 88% dari waktu alih-alih menolak menjawab, vs 48% untuk Claude Sonnet 4.5 (the-decoder)
- Sifat menjilat yang banyak dilaporkan reviewer (Zvi Mowshowitz: 'kecerdasan luas tanpa tulang punggung'); butuh system prompt yang ketat
- Masalah keandalan tool-calling di stack agen: developer melaporkan output tool tumpah ke utas chat dan butuh lebih banyak scaffolding dibanding model OpenAI/Anthropic
- Lambat pada thinking level tinggi: time to first token terukur sekitar 30-60s di AI Studio meski kecepatan output sekitar 130 tok/s
- Sudah dipensiunkan: dimatikan di Gemini API dan AI Studio pada 9 Maret 2026, dengan gemini-3-pro-preview kini dialiaskan ke Gemini 3.1 Pro
Claude Sonnet 5
- Lonjakan agentik besar dibanding Sonnet 4.6: Terminal-Bench 2.1 80.4% vs 67.0%, OSWorld-Verified 81.2% vs 78.5%, SWE-bench Pro 63.2% vs 58.1%
- Menyamai Opus 4.8 pada pekerjaan pengetahuan (GDPval-AA v2: 1,618 vs 1,615) dan nyaris seri di Humanity's Last Exam dengan tools (57.4% vs 57.9%) pada 60% harga Opus 4.8 (40% selama masa perkenalan)
- Context window 1M token dan output maksimum 128K; harga perkenalan $2/$10 per 1M tokens hingga 31 Agu 2026
- Perilaku agen yang gigih memverifikasi diri: ulasan langsung mencatat ia menguji kodenya sendiri dan terus beriterasi pada masalah sulit sampai terpecahkan, tidak seperti Sonnet 4.6
- Sonnet pertama dengan level effort xhigh dan vision resolusi tinggi (gambar 2576px); adaptive thinking aktif secara default
- Presisi code review lebih tinggi dari Sonnet 4.6 (38-40% vs 29%), menghasilkan lebih sedikit temuan false positive
- Tokenizer baru menggelembungkan jumlah token sekitar 30% untuk teks yang sama (1.0-1.35x menurut Anthropic; sekitar 1.4x untuk bahasa Inggris, sekitar 1.28x untuk Python menurut pengukuran Simon Willison), menaikkan biaya efektif meski harga resminya tetap
- Bertele-tele dan rakus token: sekitar $2.29 per tugas vs sekitar $1.20 untuk Sonnet 4.6 dalam uji independen (peringkat 101 dari 161 untuk efisiensi biaya); pada effort tinggi biaya per tugas bisa melampaui Opus 4.8
- Terukur lebih lambat dari Sonnet 4.6 pada penyuntingan kecil rutin dan cenderung over-engineering pada tugas sederhana (ulasan langsung CodeRabbit)
- Parameter sampling (temperature, top_p, top_k) dihapus; nilai non-default mengembalikan error 400, merusak pipeline yang sudah ada
- Sentimen peluncuran di HN/Reddit beragam: label '5' dinilai terlalu menjanjikan, dan pengaman keamanan siber yang lebih ketat bisa menolak pekerjaan bernuansa keamanan yang sebenarnya tidak berbahaya
Jatuhkan vonis Anda
Satu rekomendasi per tool per gladiator. Suara Anda mengubah skor penonton yang dilihat semua orang.
Vonis arena atas Gemini 3 Pro
Rilis bersejarah yang mengembalikan Google ke puncak pada akhir 2025, dengan lompatan penalaran besar dari Gemini 2.5 Pro dan skor multimodal terbaik di generasinya. Per pertengahan 2026 tidak ada alasan memilihnya: Google mematikannya di API pada 9 Maret 2026, dan Gemini 3.1 Pro berharga persis sama sambil melipatgandakan lebih dari dua kali performa ARC-AGI-2 (77.1% vs 31.1%). Tim dengan deployment legacy sebaiknya bermigrasi ke 3.1 Pro, yang toh kini menjadi tujuan alias ID model lamanya. Hindari untuk beban kerja yang sensitif halusinasi kecuali Anda menambahkan grounding, kelemahan yang berulang kali ditandai reviewer.
Vonis arena atas Claude Sonnet 5
Pilih Sonnet 5 jika Anda menjalankan agen coding, terminal, atau computer-use dan menginginkan kualitas mendekati Opus 4.8 dengan harga kelas Sonnet, terutama selama masa perkenalan $2/$10; ini upgrade mutlak dari Sonnet 4.6 pada effort rendah dan medium. Anggarkan untuk tokenizer baru dan sifatnya yang bertele-tele: biaya riil per tugas jauh di atas Sonnet 4.6, dan pada level effort tertinggi Opus 4.8 bisa jadi lebih menguntungkan per tugas yang terselesaikan. Hindari untuk penyuntingan kecil yang sensitif latensi atau pipeline yang bergantung pada temperature dan top_p, yang kini menghasilkan error. Sonnet 4.6 tetap pilihan pragmatis untuk beban kerja diff kecil bervolume tinggi.
Kata penonton
Tentang Gemini 3 Pro
“Confidently wrong is its worst mode. On AA-Omniscience it gave a wrong answer 88% of the time instead of declining. Add the sycophancy and you need a tight system prompt to trust it.”
“ARC-AGI-2 at 31% was about 6x Gemini 2.5 Pro and nearly double GPT-5.1 at the time. For visual-heavy work (81 MMMU-Pro) nothing else came close.”
“1501 Elo on LMArena at launch was deserved. Multimodal is where it kills, I feed it lecture videos and dense PDFs and it just gets it. 1M context helps.”
Tentang Claude Sonnet 5
“Cheap per token, pricey per task. Independent tests had it near $2.29 a task vs $1.20 on 4.6, and at high effort it can out-cost Opus 4.8. It will not stop talking.”
“Terminal-Bench going 67 to 80 over Sonnet 4.6 matches what I see. My CI-fix agent went from constant babysitting to mostly hands-off overnight.”
“Matches Opus 4.8 on knowledge work at 60% of the price, and the intro $2/$10 window makes it silly value. My research agent runs on Sonnet 5 now, zero regrets.”
Lanjut membandingkan
Pertanyaan yang sering diajukan
Apakah Gemini 3 Pro lebih baik daripada Claude Sonnet 5?
Pilihan yang tepat tergantung kebutuhan Anda. Perbandingan baris demi baris di halaman ini mengupas harga, spesifikasi utama, dan penilaian arena.
Mana yang lebih murah, Gemini 3 Pro atau Claude Sonnet 5?
Gemini 3 Pro lebih murah: harganya mulai dari $12/1M out (prompts ≤200K), sementara Claude Sonnet 5 mulai dari $15/1M out ($10 intro until 2026-08-31).
Berapa biaya Gemini 3 Pro dan Claude Sonnet 5 per 1M token?
Gemini 3 Pro: $2/1M in (prompts ≤200K) per 1M token input, $12/1M out (prompts ≤200K) per 1M token output. Claude Sonnet 5: $3/1M in ($2 intro until 2026-08-31) per 1M token input, $15/1M out ($10 intro until 2026-08-31) per 1M token output.