Head-to-head

Logo Kimi K3vsLogo Gemini 3 Pro

Kimi K3 vs Gemini 3 Pro: model AI mana yang menang di 2026?

Kimi K3 ($15/1M out) dan Gemini 3 Pro ($12/1M out (prompts ≤200K)) adalah dua model AI yang paling banyak dipakai di 2026. Dari 6 suara komunitas, Kimi K3 memimpin dengan persetujuan 57%.

Vonis singkat

Soal Penalaran, Kimi K3 dan Gemini 3 Pro imbang di 4.5/5. Soal budget, Gemini 3 Pro menang: harganya mulai dari $12/1M out (prompts ≤200K) berbanding $15/1M out untuk Kimi K3.

Perbandingan baris demi baris

Mulai
$15/1M outHarga resmi API Moonshot untuk kimi-k3: $3/1M input (cache miss), $0.30/1M saat cache hit, $15/1M output termasuk reasoning trace, tarif rata di seluruh konteks 1M (tanpa tier berdasarkan panjang). Harga yang sama, $3/$15, berlaku di OpenRouter (harga cache tidak dipublikasikan di sana). Merupakan kenaikan 3x dari harga Kimi K2.6 sebesar $0.95/$4. Diverifikasi terhadap platform.kimi.ai/docs/pricing/chat-k3, 2026-07.
$12/1M out (prompts ≤200K)Tarif standar: $2/$12 per 1M tokens untuk prompt ≤200K, $4/$18 di atas 200K; batch diskon 50%. Dipensiunkan 9 Maret 2026, penerusnya Gemini 3.1 Pro mempertahankan harga identik.
Penyedia
Moonshot AI
Google (DeepMind)
Context window
1M tokens
1M tokens (64K output)
Harga input
$3/1M in
$2/1M in (prompts ≤200K)
Harga output
$15/1M out
$12/1M out (prompts ≤200K)
Modalitas
text, vision, video input
text, image, audio, video in; text out
Open weights
Tidak
Tidak
Skor penonton
57%(3)
57%(3)
Penilaian arena (1-5)
Penalaran
4.5
4.5
Coding
4.5
4.5
Menulis
4.0
3.5
Kecepatan
2.0
3.5
Nilai
3.5
4.0

Kekuatan dan kelemahan

Kimi K3

  • Peringkat #3 pada Artificial Analysis Intelligence Index (57) saat peluncuran, setara dengan Claude Opus 4.8 dan GPT-5.5: pencapaian terdekat sebuah lab asal China terhadap frontier tertutup asal AS
  • 93.4% pada SWE-bench Verified dalam harness independen Vals AI (GPT-5.6 Sol: 96.2%, Claude Fable 5: 95.0%) dan peringkat #1 pada Frontend Code Arena milik Arena.ai dengan 1679 poin, mengungguli Fable 5
  • 93.5% pada GPQA Diamond (di antara 92.6% milik Fable 5 dan 94.1% milik GPT-5.6), 96.1% pada AIME 2025, dan Elo 1668 pada pekerjaan agentic GDPval-AA v2, hanya kalah dari Fable 5
  • Profil agentic yang kuat: peringkat #1 pada AutomationBench-AA untuk workflow SaaS (53%), navigasi terminal dan repo jangka panjang lewat Kimi Code, serta output token sekitar 21% lebih sedikit dibandingkan K2 untuk tingkat kecerdasan yang lebih tinggi
  • $3/$15 per 1M token (input turun menjadi $0.30 saat cache hit), tarif rata di seluruh konteks 1M: tetap jauh di bawah harga frontier tertutup asal AS, dengan API yang kompatibel dengan OpenAI dan tersedia di OpenRouter
  • Input multimodal native (teks, gambar, video) dan open weight yang diumumkan akan rilis pada 2026-07-27 dengan lisensi bergaya Modified-MIT yang diperkirakan, memposisikannya sebagai model frontier open weight kelas 3T pertama
  • Lonjakan harga 3x dibandingkan Kimi K2.6 (dari $0.95/$4 menjadi $3/$15) menjadikannya model asal China termahal yang pernah dirilis, setara harga resmi Claude Sonnet 5: era '10x lebih murah dari model AS' sudah berakhir (Simon Willison mendokumentasikan kenaikan ini)
  • Lambat: 33 output token/detik, berada di peringkat #145 dari 190 model pada Artificial Analysis, kurang cocok untuk penggunaan interaktif
  • Tingkat halusinasi naik dari 39% (K2.6) menjadi 51% pada AA-Omniscience karena model kini mencoba menjawab pertanyaan yang sebelumnya ditolak (Fable 5 berada pada level sebanding, 54.9%)
  • Sensor politik pada topik sensitif dalam bahasa Mandarin (mengelak saat membahas Xi, CCP, Tiananmen) dan yurisdiksi Beijing untuk data API, menjadi penghambat kepatuhan bagi banyak deployment di Uni Eropa dan enterprise; UK AISI/CAISI juga menemukan guardrail keamanan siber model ini gagal memblokir upaya pengembangan exploit selama pengujian
  • 'Open weight' masih bersifat teoretis bagi kebanyakan pengguna: sekitar 594 GB dalam format native MXFP4 yang membutuhkan datacenter multi-GPU untuk self-host, dan bobot model (beserta lisensi finalnya) masih belum dipublikasikan pada saat peninjauan

Gemini 3 Pro

  • Memuncaki LMArena saat peluncuran dengan rekor 1501 Elo dan mencetak 91.9% di GPQA Diamond, state of the art saat rilis
  • ARC-AGI-2 di 31.1%, kira-kira 6x Gemini 2.5 Pro (4.9%) dan hampir dua kali lipat GPT-5.1 (17.6%) pada masanya
  • Pemahaman multimodal terbaik di kelasnya: 81% MMMU-Pro, 87.6% Video-MMMU, dengan context window 1M token
  • Coding agentik kuat: 76.2% SWE-bench Verified, 54.2% Terminal-Bench 2.0, 1487 Elo di WebDev Arena
  • Memotong harga pesaing di $2/$12 per 1M tokens, di bawah harga kelas Claude Sonnet ($3/$15)
  • thinking_level yang bisa dikonfigurasi (low/medium/high) memungkinkan developer menukar kedalaman penalaran dengan latensi dan biaya
  • Halusinasi yang terlalu percaya diri: di AA-Omniscience ia memberi jawaban salah 88% dari waktu alih-alih menolak menjawab, vs 48% untuk Claude Sonnet 4.5 (the-decoder)
  • Sifat menjilat yang banyak dilaporkan reviewer (Zvi Mowshowitz: 'kecerdasan luas tanpa tulang punggung'); butuh system prompt yang ketat
  • Masalah keandalan tool-calling di stack agen: developer melaporkan output tool tumpah ke utas chat dan butuh lebih banyak scaffolding dibanding model OpenAI/Anthropic
  • Lambat pada thinking level tinggi: time to first token terukur sekitar 30-60s di AI Studio meski kecepatan output sekitar 130 tok/s
  • Sudah dipensiunkan: dimatikan di Gemini API dan AI Studio pada 9 Maret 2026, dengan gemini-3-pro-preview kini dialiaskan ke Gemini 3.1 Pro

Jatuhkan vonis Anda

Satu rekomendasi per tool per gladiator. Suara Anda mengubah skor penonton yang dilihat semua orang.

Kimi K3$15/1M out
57%skor penonton · 3
Gemini 3 Pro$12/1M out (prompts ≤200K)
57%skor penonton · 3

Vonis arena atas Kimi K3

Kimi K3 adalah bukti terkuat sejauh ini bahwa frontier tidak lagi eksklusif milik AS: peringkat #3 pada Artificial Analysis, skor GPQA dan SWE-bench Verified papan atas, serta peringkat frontend-code arena terbaik di industri, dengan harga sekitar setengah hingga sepertiga dari harga frontier tertutup asal AS. Model ini layak dipilih untuk agentic coding, pekerjaan frontend, dan otomasi SaaS, area tempat benchmarknya paling kuat, atau jika roadmap bergantung pada self-hosting model kelas frontier begitu bobotnya dirilis. Sebaiknya dihindari untuk produk interaktif (33 token/detik tergolong lambat), untuk apa pun yang menyentuh konten sensitif secara politik atau persyaratan residensi data Uni Eropa yang ketat (sensor bahasa Mandarin, yurisdiksi Beijing), serta untuk retrieval berakurasi tinggi karena tingkat halusinasi 51% pada AA-Omniscience membutuhkan lapisan verifikasi. Tim yang sangat memperhatikan biaya perlu dicatat bahwa DeepSeek V4 masih memberikan token per dolar yang jauh lebih banyak; daya tarik K3 terletak pada kapabilitas puncak per dolar, bukan token termurah.

Vonis arena atas Gemini 3 Pro

Rilis bersejarah yang mengembalikan Google ke puncak pada akhir 2025, dengan lompatan penalaran besar dari Gemini 2.5 Pro dan skor multimodal terbaik di generasinya. Per pertengahan 2026 tidak ada alasan memilihnya: Google mematikannya di API pada 9 Maret 2026, dan Gemini 3.1 Pro berharga persis sama sambil melipatgandakan lebih dari dua kali performa ARC-AGI-2 (77.1% vs 31.1%). Tim dengan deployment legacy sebaiknya bermigrasi ke 3.1 Pro, yang toh kini menjadi tujuan alias ID model lamanya. Hindari untuk beban kerja yang sensitif halusinasi kecuali Anda menambahkan grounding, kelemahan yang berulang kali ditandai reviewer.

Kata penonton

Tentang Kimi K3

Kapten Churn

Tried it for our knowledge-base assistant and the hallucination rate is real: it confidently invented two API endpoints in one afternoon. 33 tokens per second on top of that. Back to waiting for the open weights to fine-tune.

Jempol Emasicus

Our Zapier-style automation stack runs on it now. Tool orchestration that GPT-5.5 fumbled works reliably, and the cache-hit pricing makes repeated workflows genuinely cheap.

Santo Deployus

The Frontend Arena ranking is deserved. Gave it the same dashboard spec I gave Fable 5 and K3's React came out cleaner, with fewer invented props. At $3/$15 through OpenRouter it was a drop-in swap.

Tentang Gemini 3 Pro

Hakim Bengis

Confidently wrong is its worst mode. On AA-Omniscience it gave a wrong answer 88% of the time instead of declining. Add the sycophancy and you need a tight system prompt to trust it.

Juara Vibes

ARC-AGI-2 at 31% was about 6x Gemini 2.5 Pro and nearly double GPT-5.1 at the time. For visual-heavy work (81 MMMU-Pro) nothing else came close.

Glorius Maximus

1501 Elo on LMArena at launch was deserved. Multimodal is where it kills, I feed it lecture videos and dense PDFs and it just gets it. 1M context helps.

Pertanyaan yang sering diajukan

Apakah Kimi K3 lebih baik daripada Gemini 3 Pro?

Pilihan yang tepat tergantung kebutuhan Anda. Perbandingan baris demi baris di halaman ini mengupas harga, spesifikasi utama, dan penilaian arena.

Mana yang lebih murah, Kimi K3 atau Gemini 3 Pro?

Gemini 3 Pro lebih murah: harganya mulai dari $12/1M out (prompts ≤200K), sementara Kimi K3 mulai dari $15/1M out.

Berapa biaya Kimi K3 dan Gemini 3 Pro per 1M token?

Kimi K3: $3/1M in per 1M token input, $15/1M out per 1M token output. Gemini 3 Pro: $2/1M in (prompts ≤200K) per 1M token input, $12/1M out (prompts ≤200K) per 1M token output.