Arena · Review model AI

Kimi K3

oleh Moonshot AI

MoE 2.8T parameter dari Moonshot yang memicu 'momen DeepSeek jilid baru': skor mendekati frontier dengan harga $3/$15

Skor arena 3.7/557% merekomendasikan · 3 suara
Penalaran4.5
Coding4.5
Menulis4.0
Kecepatan2.0
Nilai3.5
Kunjungi Kimi K3coding dan agent level frontier di luar cloud ASgenerasi frontend (puncak leaderboard Arena.ai)otomasi workflow SaaS dan orkestrasi tooltim yang berencana self-host open weight kelas 3T
Harga

$15/1M out

Harga resmi API Moonshot untuk kimi-k3: $3/1M input (cache miss), $0.30/1M saat cache hit, $15/1M output termasuk reasoning trace, tarif rata di seluruh konteks 1M (tanpa tier berdasarkan panjang). Harga yang sama, $3/$15, berlaku di OpenRouter (harga cache tidak dipublikasikan di sana). Merupakan kenaikan 3x dari harga Kimi K2.6 sebesar $0.95/$4. Diverifikasi terhadap platform.kimi.ai/docs/pricing/chat-k3, 2026-07.

Penyedia

Moonshot AI

Context window

1M tokens

Harga input

$3/1M in

Harga output

$15/1M out

Modalitas

text, vision, video input

Open weights

Tidak

Apa itu Kimi K3?

Dirilis pada 2026-07-16 oleh Moonshot AI yang berbasis di Beijing dan diperkenalkan di World AI Conference, Shanghai. Kimi K3 adalah model Mixture-of-Experts dengan 2.8 triliun parameter (896 expert, 16 aktif per token), jendela konteks 1M token, serta input native berupa teks, gambar, dan video. ID API kimi-k3 dihargai $3/1M input ($0.30 saat cache hit) dan $15/1M output, tarif rata di seluruh jendela konteks, juga tersedia di OpenRouter. Model ini menempati peringkat #3 pada Artificial Analysis Intelligence Index saat peluncuran, setara dengan Claude Opus 4.8 dan GPT-5.5, memicu headline 'momen DeepSeek jilid baru' dan aksi jual di sektor semikonduktor. Open weight (sekitar 594 GB, MXFP4) diumumkan akan dirilis pada 2026-07-27; belum dipublikasikan pada saat fiche ini dibuat, dengan lisensi bergaya Modified-MIT yang diperkirakan namun belum dikonfirmasi.

Kelebihan & kekurangan Kimi K3

Kelebihan

  • Peringkat #3 pada Artificial Analysis Intelligence Index (57) saat peluncuran, setara dengan Claude Opus 4.8 dan GPT-5.5: pencapaian terdekat sebuah lab asal China terhadap frontier tertutup asal AS
  • 93.4% pada SWE-bench Verified dalam harness independen Vals AI (GPT-5.6 Sol: 96.2%, Claude Fable 5: 95.0%) dan peringkat #1 pada Frontend Code Arena milik Arena.ai dengan 1679 poin, mengungguli Fable 5
  • 93.5% pada GPQA Diamond (di antara 92.6% milik Fable 5 dan 94.1% milik GPT-5.6), 96.1% pada AIME 2025, dan Elo 1668 pada pekerjaan agentic GDPval-AA v2, hanya kalah dari Fable 5
  • Profil agentic yang kuat: peringkat #1 pada AutomationBench-AA untuk workflow SaaS (53%), navigasi terminal dan repo jangka panjang lewat Kimi Code, serta output token sekitar 21% lebih sedikit dibandingkan K2 untuk tingkat kecerdasan yang lebih tinggi
  • $3/$15 per 1M token (input turun menjadi $0.30 saat cache hit), tarif rata di seluruh konteks 1M: tetap jauh di bawah harga frontier tertutup asal AS, dengan API yang kompatibel dengan OpenAI dan tersedia di OpenRouter
  • Input multimodal native (teks, gambar, video) dan open weight yang diumumkan akan rilis pada 2026-07-27 dengan lisensi bergaya Modified-MIT yang diperkirakan, memposisikannya sebagai model frontier open weight kelas 3T pertama

Kekurangan

  • Lonjakan harga 3x dibandingkan Kimi K2.6 (dari $0.95/$4 menjadi $3/$15) menjadikannya model asal China termahal yang pernah dirilis, setara harga resmi Claude Sonnet 5: era '10x lebih murah dari model AS' sudah berakhir (Simon Willison mendokumentasikan kenaikan ini)
  • Lambat: 33 output token/detik, berada di peringkat #145 dari 190 model pada Artificial Analysis, kurang cocok untuk penggunaan interaktif
  • Tingkat halusinasi naik dari 39% (K2.6) menjadi 51% pada AA-Omniscience karena model kini mencoba menjawab pertanyaan yang sebelumnya ditolak (Fable 5 berada pada level sebanding, 54.9%)
  • Sensor politik pada topik sensitif dalam bahasa Mandarin (mengelak saat membahas Xi, CCP, Tiananmen) dan yurisdiksi Beijing untuk data API, menjadi penghambat kepatuhan bagi banyak deployment di Uni Eropa dan enterprise; UK AISI/CAISI juga menemukan guardrail keamanan siber model ini gagal memblokir upaya pengembangan exploit selama pengujian
  • 'Open weight' masih bersifat teoretis bagi kebanyakan pengguna: sekitar 594 GB dalam format native MXFP4 yang membutuhkan datacenter multi-GPU untuk self-host, dan bobot model (beserta lisensi finalnya) masih belum dipublikasikan pada saat peninjauan

Vonis arena

Kimi K3 adalah bukti terkuat sejauh ini bahwa frontier tidak lagi eksklusif milik AS: peringkat #3 pada Artificial Analysis, skor GPQA dan SWE-bench Verified papan atas, serta peringkat frontend-code arena terbaik di industri, dengan harga sekitar setengah hingga sepertiga dari harga frontier tertutup asal AS. Model ini layak dipilih untuk agentic coding, pekerjaan frontend, dan otomasi SaaS, area tempat benchmarknya paling kuat, atau jika roadmap bergantung pada self-hosting model kelas frontier begitu bobotnya dirilis. Sebaiknya dihindari untuk produk interaktif (33 token/detik tergolong lambat), untuk apa pun yang menyentuh konten sensitif secara politik atau persyaratan residensi data Uni Eropa yang ketat (sensor bahasa Mandarin, yurisdiksi Beijing), serta untuk retrieval berakurasi tinggi karena tingkat halusinasi 51% pada AA-Omniscience membutuhkan lapisan verifikasi. Tim yang sangat memperhatikan biaya perlu dicatat bahwa DeepSeek V4 masih memberikan token per dolar yang jauh lebih banyak; daya tarik K3 terletak pada kapabilitas puncak per dolar, bukan token termurah.

Jempol ke atas atau ke bawah

Jatuhkan vonis Anda

Apakah Anda akan merekomendasikan Kimi K3, atau memperingatkan penonton agar menjauh?

57%skor penonton · 3

Alternatif Kimi K3 terbaik

Semua alternatif
1
Claude Haiku 4.5

Model tercepat Anthropic: sekitar 90% kemampuan coding Sonnet 4.5 seharga $1/$5 per 1M tokens, context 200K.

$5/1M out67%(2)
Visit
2
Claude Opus 5

Pembaruan Opus dari Anthropic pada Juli 2026: kecerdasan mendekati Fable 5 dengan setengah harga, tetap $5/$25 seperti Opus 4.8

$25/1M out63%(4)
Visit
3
Claude Fable 5

Flagship kelas Mythos dari Anthropic edisi Juni 2026: 80.3% di SWE-bench Pro, unggul 11 poin dari semua model frontier lainnya

$50/1M out63%(4)
Visit

Bandingkan Kimi K3 head-to-head

Kata penonton

Kapten Churn

Tried it for our knowledge-base assistant and the hallucination rate is real: it confidently invented two API endpoints in one afternoon. 33 tokens per second on top of that. Back to waiting for the open weights to fine-tune.

Jempol Emasicus

Our Zapier-style automation stack runs on it now. Tool orchestration that GPT-5.5 fumbled works reliably, and the cache-hit pricing makes repeated workflows genuinely cheap.

Santo Deployus

The Frontend Arena ranking is deserved. Gave it the same dashboard spec I gave Fable 5 and K3's React came out cleaner, with fewer invented props. At $3/$15 through OpenRouter it was a drop-in swap.

Kimi K3: pertanyaan yang sering diajukan

Berapa biaya Kimi K3 per 1M token?

Kimi K3 berbiaya $3/1M in per 1M token input dan $15/1M out per 1M token output. Harga resmi API Moonshot untuk kimi-k3: $3/1M input (cache miss), $0.30/1M saat cache hit, $15/1M output termasuk reasoning trace, tarif rata di seluruh konteks 1M (tanpa tier berdasarkan panjang). Harga yang sama, $3/$15, berlaku di OpenRouter (harga cache tidak dipublikasikan di sana). Merupakan kenaikan 3x dari harga Kimi K2.6 sebesar $0.95/$4. Diverifikasi terhadap platform.kimi.ai/docs/pricing/chat-k3, 2026-07.