Head-to-head

Logo Claude Opus 5vsLogo Kimi K3

Claude Opus 5 vs Kimi K3: model AI mana yang menang di 2026?

Claude Opus 5 ($25/1M out) dan Kimi K3 ($15/1M out) adalah dua model AI yang paling banyak dipakai di 2026. Dari 7 suara komunitas, Claude Opus 5 memimpin dengan persetujuan 63%.

Vonis singkat

Soal Penalaran, pilih Claude Opus 5: arena menilainya 5/5 berbanding 4.5/5 untuk Kimi K3. Soal budget, Kimi K3 menang: harganya mulai dari $15/1M out berbanding $25/1M out untuk Claude Opus 5.

Perbandingan baris demi baris

Mulai
$25/1M outHarga resmi API Anthropic untuk claude-opus-5: $5/1M input, $25/1M output, tidak berubah dari Opus 4.8, satu tier tunggal dengan konteks 1M sebagai default sekaligus maksimum, output maksimum 128K, prompt caching mulai dari 512 token. Fast mode tahap research-preview seharga $10/$50 (sekitar 2.5x lebih cepat) hanya tersedia di Claude API. Diverifikasi terhadap platform.claude.com (What's new in Opus 5) pada 2026-07.
$15/1M outHarga resmi API Moonshot untuk kimi-k3: $3/1M input (cache miss), $0.30/1M saat cache hit, $15/1M output termasuk reasoning trace, tarif rata di seluruh konteks 1M (tanpa tier berdasarkan panjang). Harga yang sama, $3/$15, berlaku di OpenRouter (harga cache tidak dipublikasikan di sana). Merupakan kenaikan 3x dari harga Kimi K2.6 sebesar $0.95/$4. Diverifikasi terhadap platform.kimi.ai/docs/pricing/chat-k3, 2026-07.
Penyedia
Anthropic
Moonshot AI
Context window
1M tokens
1M tokens
Harga input
$5/1M in
$3/1M in
Harga output
$25/1M out
$15/1M out
Modalitas
text, vision
text, vision, video input
Open weights
Tidak
Tidak
Skor penonton
63%(4)
57%(3)
Penilaian arena (1-5)
Penalaran
5.0
4.5
Coding
5.0
4.5
Menulis
4.0
4.0
Kecepatan
2.0
2.0
Nilai
4.0
3.5

Kekuatan dan kelemahan

Claude Opus 5

  • Menduduki peringkat #1 dalam kecerdasan komposit di antara 190 model pada Artificial Analysis saat peluncuran, dengan skor 43.3% pada Frontier-Bench v0.1 dibandingkan 34.4% untuk GPT-5.6 Sol dan 33.7% untuk Claude Fable 5
  • 3.9x lebih unggul dibandingkan GPT-5.6 Sol pada penalaran baru ARC-AGI-3 (30.2% vs 7.8%), serta Elo 1861 pada pekerjaan pengetahuan ekonomi GDPval-AA v2, mengungguli Fable 5 (1747)
  • 79.2% pada SWE-bench Pro, hanya berselisih satu poin dari Fable 5 (80.0%) dan 10 poin di atas Opus 4.8 (69.2%), dengan setengah harga Fable; salah satu co-founder Cursor menyebutnya 'kecerdasan mendekati Fable 5 dengan kecepatan dan biaya setara Opus'
  • Harga tetap sama seperti Opus 4.8, yaitu $5/$25, namun dengan jendela konteks lebih besar: 1M konteks kini menjadi tier default sekaligus satu-satunya, dengan output maksimum 128K dan prompt caching mulai dari 512 token
  • Classifier keamanan dual-use terpicu 85% lebih jarang dibandingkan pada Fable 5, dan mode fallback default yang baru mencegah penolakan diam-diam di tengah sesi yang sempat membebani peluncuran Fable
  • Memverifikasi hasil kerjanya sendiri tanpa diminta, menangani perubahan tool di tengah percakapan (beta) tanpa merusak prompt cache, dan tersedia sejak hari pertama di Claude.ai, API, Bedrock, Vertex, dan Microsoft Foundry
  • Tergolong lambat dan sangat verbose: 52.6 output token/detik dan 68 detik hingga token pertama pada Artificial Analysis, serta menghabiskan sekitar 100M output token selama evaluasi mereka, dibandingkan median 63M
  • Verbositas ini menjadi masalah biaya nyata: CodeRabbit mengukur model ini membaca sekitar 50% lebih banyak dan menulis sekitar 65% lebih banyak dibandingkan model frontier acuan per panggilan code review
  • Tidak ada pemotongan harga sesungguhnya meski narasinya 'cost-efficient': sama persis dengan Opus 4.8 ($5/$25), hampir setara harga GPT-5.6 ($5/$30), dan lebih dari 2x tier Gemini atau Grok yang sebanding
  • Para reviewer menggambarkan kepribadiannya sebagai 'brilian tapi menjengkelkan': verifikasi berlebihan, sikap berhati-hati berlebihan, dan sesekali menolak tugas sepele seperti menyelesaikan merge conflict (ulasan lapangan Lenny's Newsletter)
  • Perubahan API yang bersifat breaking bagi pengguna yang bermigrasi dari Opus 4.8: thinking aktif secara default dan tidak dapat dinonaktifkan pada level usaha xhigh atau max (mengembalikan error 400); Fast mode ($10/$50, sekitar 2.5x lebih cepat) hanya tersedia lewat API, tidak di Bedrock atau Vertex

Kimi K3

  • Peringkat #3 pada Artificial Analysis Intelligence Index (57) saat peluncuran, setara dengan Claude Opus 4.8 dan GPT-5.5: pencapaian terdekat sebuah lab asal China terhadap frontier tertutup asal AS
  • 93.4% pada SWE-bench Verified dalam harness independen Vals AI (GPT-5.6 Sol: 96.2%, Claude Fable 5: 95.0%) dan peringkat #1 pada Frontend Code Arena milik Arena.ai dengan 1679 poin, mengungguli Fable 5
  • 93.5% pada GPQA Diamond (di antara 92.6% milik Fable 5 dan 94.1% milik GPT-5.6), 96.1% pada AIME 2025, dan Elo 1668 pada pekerjaan agentic GDPval-AA v2, hanya kalah dari Fable 5
  • Profil agentic yang kuat: peringkat #1 pada AutomationBench-AA untuk workflow SaaS (53%), navigasi terminal dan repo jangka panjang lewat Kimi Code, serta output token sekitar 21% lebih sedikit dibandingkan K2 untuk tingkat kecerdasan yang lebih tinggi
  • $3/$15 per 1M token (input turun menjadi $0.30 saat cache hit), tarif rata di seluruh konteks 1M: tetap jauh di bawah harga frontier tertutup asal AS, dengan API yang kompatibel dengan OpenAI dan tersedia di OpenRouter
  • Input multimodal native (teks, gambar, video) dan open weight yang diumumkan akan rilis pada 2026-07-27 dengan lisensi bergaya Modified-MIT yang diperkirakan, memposisikannya sebagai model frontier open weight kelas 3T pertama
  • Lonjakan harga 3x dibandingkan Kimi K2.6 (dari $0.95/$4 menjadi $3/$15) menjadikannya model asal China termahal yang pernah dirilis, setara harga resmi Claude Sonnet 5: era '10x lebih murah dari model AS' sudah berakhir (Simon Willison mendokumentasikan kenaikan ini)
  • Lambat: 33 output token/detik, berada di peringkat #145 dari 190 model pada Artificial Analysis, kurang cocok untuk penggunaan interaktif
  • Tingkat halusinasi naik dari 39% (K2.6) menjadi 51% pada AA-Omniscience karena model kini mencoba menjawab pertanyaan yang sebelumnya ditolak (Fable 5 berada pada level sebanding, 54.9%)
  • Sensor politik pada topik sensitif dalam bahasa Mandarin (mengelak saat membahas Xi, CCP, Tiananmen) dan yurisdiksi Beijing untuk data API, menjadi penghambat kepatuhan bagi banyak deployment di Uni Eropa dan enterprise; UK AISI/CAISI juga menemukan guardrail keamanan siber model ini gagal memblokir upaya pengembangan exploit selama pengujian
  • 'Open weight' masih bersifat teoretis bagi kebanyakan pengguna: sekitar 594 GB dalam format native MXFP4 yang membutuhkan datacenter multi-GPU untuk self-host, dan bobot model (beserta lisensi finalnya) masih belum dipublikasikan pada saat peninjauan

Jatuhkan vonis Anda

Satu rekomendasi per tool per gladiator. Suara Anda mengubah skor penonton yang dilihat semua orang.

Claude Opus 5$25/1M out
63%skor penonton · 4
Kimi K3$15/1M out
57%skor penonton · 3

Vonis arena atas Claude Opus 5

Claude Opus 5 adalah pilihan default paling masuk akal di jajaran Series 5: sebagian besar kecerdasan Fable 5 (bahkan melampaui Fable pada Frontier-Bench dan GDPval) dengan harga token tepat setengahnya, plus classifier yang terpicu 85% lebih jarang. Jika beban kerja sudah dipindahkan ke Fable 5 demi kapabilitas namun tagihannya terasa berat atau sering kena penolakan false positive, model ini layak dipertimbangkan sebagai pengganti; jika masih memakai Opus 4.8, upgrade ini memberi tambahan 10 poin SWE-bench Pro tanpa biaya tambahan. Dua alasan jujur untuk memilih model lain: latensi dan verbositas. Dengan kecepatan 52.6 token/detik dan 68 detik hingga token pertama, model ini kurang cocok untuk UX interaktif, dan 'nafsu' tokennya diam-diam menggelembungkan biaya riil di atas harga resmi, sehingga pipeline bervolume tinggi yang sensitif terhadap anggaran tetap lebih cocok memakai Sonnet 5, Gemini, atau DeepSeek. Fable 5 baru layak dipertahankan untuk run otonom terpanjang, di mana keunggulan tipisnya pada SWE-bench Pro terasa akumulatif.

Vonis arena atas Kimi K3

Kimi K3 adalah bukti terkuat sejauh ini bahwa frontier tidak lagi eksklusif milik AS: peringkat #3 pada Artificial Analysis, skor GPQA dan SWE-bench Verified papan atas, serta peringkat frontend-code arena terbaik di industri, dengan harga sekitar setengah hingga sepertiga dari harga frontier tertutup asal AS. Model ini layak dipilih untuk agentic coding, pekerjaan frontend, dan otomasi SaaS, area tempat benchmarknya paling kuat, atau jika roadmap bergantung pada self-hosting model kelas frontier begitu bobotnya dirilis. Sebaiknya dihindari untuk produk interaktif (33 token/detik tergolong lambat), untuk apa pun yang menyentuh konten sensitif secara politik atau persyaratan residensi data Uni Eropa yang ketat (sensor bahasa Mandarin, yurisdiksi Beijing), serta untuk retrieval berakurasi tinggi karena tingkat halusinasi 51% pada AA-Omniscience membutuhkan lapisan verifikasi. Tim yang sangat memperhatikan biaya perlu dicatat bahwa DeepSeek V4 masih memberikan token per dolar yang jauh lebih banyak; daya tarik K3 terletak pada kapabilitas puncak per dolar, bukan token termurah.

Kata penonton

Tentang Claude Opus 5

Jempol Bawahicus

The sticker price is unchanged but my invoice is not: it writes essays where Opus 4.8 wrote answers. 68 seconds to first token killed it for our support chat, we went back to Sonnet 5.

Sang Penilai Adil

Fed it a 40-tab financial model with cross-sheet formulas and asked for a scenario deck. It got the edge cases the analysts missed. For document-heavy enterprise work this is the best model I have used.

Tuan Rilis Melulu

We moved off Fable 5 because the bio classifier kept flagging our genomics tooling. Opus 5 does the same work at half the price and I have not seen a single silent reroute since.

Penjaga Repo

Migrated our agents from Opus 4.8 the day it dropped. Same bill, and tasks that used to stall at the planning stage now just finish. The 10-point SWE-bench jump is not marketing, our merge queue feels it.

Tentang Kimi K3

Kapten Churn

Tried it for our knowledge-base assistant and the hallucination rate is real: it confidently invented two API endpoints in one afternoon. 33 tokens per second on top of that. Back to waiting for the open weights to fine-tune.

Jempol Emasicus

Our Zapier-style automation stack runs on it now. Tool orchestration that GPT-5.5 fumbled works reliably, and the cache-hit pricing makes repeated workflows genuinely cheap.

Santo Deployus

The Frontend Arena ranking is deserved. Gave it the same dashboard spec I gave Fable 5 and K3's React came out cleaner, with fewer invented props. At $3/$15 through OpenRouter it was a drop-in swap.

Pertanyaan yang sering diajukan

Apakah Claude Opus 5 lebih baik daripada Kimi K3?

Saat ini penonton berpihak pada Claude Opus 5: 63% merekomendasikannya, berbanding 57% untuk Kimi K3 (7 suara). Soal Penalaran, Claude Opus 5 dinilai lebih tinggi (5/5 vs 4.5/5). Pilihan yang tepat tergantung kebutuhan Anda. Perbandingan baris demi baris di halaman ini mengupas harga, spesifikasi utama, dan penilaian arena.

Mana yang lebih murah, Claude Opus 5 atau Kimi K3?

Kimi K3 lebih murah: harganya mulai dari $15/1M out, sementara Claude Opus 5 mulai dari $25/1M out.

Berapa biaya Claude Opus 5 dan Kimi K3 per 1M token?

Claude Opus 5: $5/1M in per 1M token input, $25/1M out per 1M token output. Kimi K3: $3/1M in per 1M token input, $15/1M out per 1M token output.