Arena · recenzja: model AI

Kimi K3

od Moonshot AI

MoE od Moonshot z 2,8 biliona parametrów, które wywołało 'nowy moment DeepSeek': wyniki bliskie granicy możliwości za $3/$15

Wynik areny 3.7/557% rekomendacji · 3 głosy
Rozumowanie4.5
Kodowanie4.5
Pisanie4.0
Szybkość2.0
Stosunek jakości do ceny3.5
Odwiedź Kimi K3kodowania i agentów klasy frontier poza chmurami amerykańskimigenerowania frontendu (szczyt rankingu Arena.ai)automatyzacji przepływów SaaS i orkiestracji narzędzizespołów planujących samodzielny hosting otwartych wag klasy 3T
Cena

$15/1M out

Oficjalna cena katalogowa API Moonshot dla kimi-k3: $3/1M tokenów wejściowych (brak trafienia w cache), $0,30/1M przy trafieniu w cache, $15/1M tokenów wyjściowych łącznie ze śladem rozumowania, stała w całym oknie kontekstu 1M (bez progów zależnych od długości). Ta sama cena $3/$15 obowiązuje na OpenRouter (bez ujawnionego cennika cache). To trzykrotny wzrost względem $0,95/$4 dla Kimi K2.6. Zweryfikowano na podstawie platform.kimi.ai/docs/pricing/chat-k3, lipiec 2026.

Dostawca

Moonshot AI

Okno kontekstu

1M tokens

Cena wejścia

$3/1M in

Cena wyjścia

$15/1M out

Modalności

text, vision, video input

Open weights

Nie

Czym jest Kimi K3?

Wydany 16.07.2026 przez pekińską firmę Moonshot AI i zaprezentowany podczas World AI Conference w Szanghaju. Kimi K3 to model Mixture-of-Experts o 2,8 biliona parametrów (896 ekspertów, 16 aktywnych na token), z oknem kontekstu 1M tokenów oraz natywną obsługą wejścia tekstowego, obrazowego i wideo. ID API to kimi-k3, w cenie $3/1M tokenów wejściowych ($0,30 przy trafieniu w cache) i $15/1M tokenów wyjściowych, stałej niezależnie od długości kontekstu, dostępnej także przez OpenRouter. W dniu premiery model zajął 3. miejsce w Artificial Analysis Intelligence Index, porównywalne z Claude Opus 4.8 i GPT-5.5, co wywołało nagłówki o 'nowym momencie DeepSeek' i wyprzedaż na rynku półprzewodników. Otwarte wagi (około 594 GB, format MXFP4) zapowiedziano na 27.07.2026; w chwili tworzenia tej karty nie zostały jeszcze opublikowane, a licencja w stylu Modified-MIT jest spodziewana, lecz niepotwierdzona.

Kimi K3: plusy i minusy

Plusy

  • 3. miejsce w Artificial Analysis Intelligence Index (57 punktów) w dniu premiery, wynik porównywalny z Claude Opus 4.8 i GPT-5.5: najbliższe dotąd podejście chińskiego laboratorium do zamkniętej amerykańskiej granicy możliwości
  • 93,4 % w SWE-bench Verified w niezależnym środowisku testowym Vals AI (GPT-5.6 Sol: 96,2 %, Claude Fable 5: 95,0 %) oraz 1. miejsce w Frontend Code Arena serwisu Arena.ai z wynikiem 1679 punktów, przed Fable 5
  • 93,5 % w GPQA Diamond (między 92,6 % Fable 5 a 94,1 % GPT-5.6), 96,1 % w AIME 2025 oraz Elo 1668 w pracy agentowej GDPval-AA v2, ustępując tylko Fable 5
  • Silny profil agentowy: 1. miejsce w AutomationBench-AA dla przepływów SaaS (53 %), nawigacja po terminalu i repozytoriach w długim horyzoncie czasowym za pośrednictwem Kimi Code oraz około 21 % mniej tokenów wyjściowych niż K2 przy wyższej inteligencji
  • $3/$15 za 1M tokenów (cena wejściowa spada do $0,30 przy trafieniu w cache), stała w całym oknie kontekstu 1M: wciąż wyraźnie poniżej cen amerykańskich modeli zamkniętej granicy możliwości, z API kompatybilnym z OpenAI i dostępnością przez OpenRouter
  • Natywna obsługa wejścia multimodalnego (tekst, obraz, wideo) oraz zapowiedziane na 27.07.2026 otwarte wagi na spodziewanej licencji w stylu Modified-MIT, co czyni go pierwszym modelem klasy frontier o otwartych wagach w skali 3 bilionów parametrów

Minusy

  • Trzykrotny wzrost ceny względem Kimi K2.6 (z $0,95/$4 do $3/$15) czyni go najdroższym chińskim modelem, jaki dotąd trafił na rynek, w cenie katalogowej zbliżonej do Claude Sonnet 5: era 'dziesięciokrotnie tańszych niż modele amerykańskie' się skończyła (podwyżkę udokumentował Simon Willison)
  • Wolny: 33 tokeny wyjściowe na sekundę, 145. miejsce na 190 modeli w Artificial Analysis, słabe dopasowanie do zastosowań interaktywnych
  • Odsetek halucynacji wzrósł z 39 % (K2.6) do 51 % w teście AA-Omniscience, ponieważ model obecnie próbuje odpowiadać na pytania, na które wcześniej odmawiał odpowiedzi (Fable 5 osiąga porównywalny wynik 54,9 %)
  • Cenzura polityczna tematów wrażliwych w języku mandaryńskim (unikanie odpowiedzi w sprawach Xi, KPCh, Tiananmen) oraz jurysdykcja pekińska dla danych API stanowią barierę zgodności dla wielu wdrożeń w UE i firmach; brytyjskie AISI/CAISI wykazały też, że zabezpieczenia cybernetyczne modelu nie zablokowały podczas testów prób opracowania exploitów
  • 'Otwarte wagi' są na razie teoretyczne dla większości: około 594 GB w natywnym formacie MXFP4 wymaga centrum danych z wieloma GPU do samodzielnego hostowania, a same wagi (wraz z ostateczną licencją) w momencie tej recenzji wciąż nie zostały opublikowane

Werdykt areny

Kimi K3 to jak dotąd najmocniejszy dowód, że granica możliwości nie jest już wyłącznie amerykańska: 3. miejsce w Artificial Analysis, czołowe wyniki w GPQA i SWE-bench Verified oraz najlepsza pozycja w rankingu kodu frontendowego w branży, przy cenie stanowiącej mniej więcej połowę do jednej trzeciej cen amerykańskich modeli zamkniętej granicy możliwości. Warto po niego sięgnąć do kodowania agentowego, pracy nad frontendem i automatyzacji SaaS, gdzie jego wyniki są najmocniejsze, a także jeśli plany zakładają samodzielny hosting modelu klasy frontier po publikacji wag. Lepiej go unikać w produktach interaktywnych (33 tokeny na sekundę to wolno), przy wszystkim, co dotyka treści politycznie wrażliwych lub wymaga ścisłej rezydencji danych w UE (cenzura w języku mandaryńskim, jurysdykcja pekińska), a także tam, gdzie liczy się wysoka dokładność wyszukiwania, bo 51 % halucynacji w AA-Omniscience wymaga dodatkowej warstwy weryfikacji. Zespoły skupione na kosztach powinny pamiętać, że DeepSeek V4 wciąż oferuje znacznie więcej tokenów za dolara; przewaga K3 to szczytowe możliwości za dolara, a nie najtańsze tokeny.

Kciuk w górę czy kciuk w dół

Wydaj swój werdykt

Polecasz Kimi K3, czy ostrzegasz przed nim tłum?

57%wynik tłumu · 3

Najlepsze alternatywy dla Kimi K3

Wszystkie alternatywy
1
Claude Haiku 4.5

Najszybszy model Anthropic: około 90% umiejętności kodowania Sonnet 4.5 za $1/$5 za 1M tokenów, 200K kontekstu.

$5/1M out67%(2)
Visit
2
Claude Opus 5

Odświeżenie Opus od Anthropic z lipca 2026: inteligencja bliska Fable 5 za połowę ceny, wciąż $5/$25 jak w Opus 4.8

$25/1M out63%(4)
Visit
3
Claude Fable 5

Flagowiec Anthropic klasy Mythos z czerwca 2026: 80.3% na SWE-bench Pro, 11 punktów przewagi nad każdym innym modelem frontierowym

$50/1M out63%(4)
Visit

Porównaj Kimi K3 w pojedynku

Co mówi tłum

Kapitan Churn

Tried it for our knowledge-base assistant and the hallucination rate is real: it confidently invented two API endpoints in one afternoon. 33 tokens per second on top of that. Back to waiting for the open weights to fine-tune.

Złoty Kciukus

Our Zapier-style automation stack runs on it now. Tool orchestration that GPT-5.5 fumbled works reliably, and the cache-hit pricing makes repeated workflows genuinely cheap.

Święty Deployus

The Frontend Arena ranking is deserved. Gave it the same dashboard spec I gave Fable 5 and K3's React came out cleaner, with fewer invented props. At $3/$15 through OpenRouter it was a drop-in swap.

Kimi K3: najczęstsze pytania

Ile kosztuje Kimi K3 za 1M tokenów?

Kimi K3 kosztuje $3/1M in za 1M tokenów wejściowych i $15/1M out za 1M tokenów wyjściowych. Oficjalna cena katalogowa API Moonshot dla kimi-k3: $3/1M tokenów wejściowych (brak trafienia w cache), $0,30/1M przy trafieniu w cache, $15/1M tokenów wyjściowych łącznie ze śladem rozumowania, stała w całym oknie kontekstu 1M (bez progów zależnych od długości). Ta sama cena $3/$15 obowiązuje na OpenRouter (bez ujawnionego cennika cache). To trzykrotny wzrost względem $0,95/$4 dla Kimi K2.6. Zweryfikowano na podstawie platform.kimi.ai/docs/pricing/chat-k3, lipiec 2026.