Arena · recenzja: model AI
Kimi K3
od Moonshot AI
MoE od Moonshot z 2,8 biliona parametrów, które wywołało 'nowy moment DeepSeek': wyniki bliskie granicy możliwości za $3/$15
$15/1M out
Oficjalna cena katalogowa API Moonshot dla kimi-k3: $3/1M tokenów wejściowych (brak trafienia w cache), $0,30/1M przy trafieniu w cache, $15/1M tokenów wyjściowych łącznie ze śladem rozumowania, stała w całym oknie kontekstu 1M (bez progów zależnych od długości). Ta sama cena $3/$15 obowiązuje na OpenRouter (bez ujawnionego cennika cache). To trzykrotny wzrost względem $0,95/$4 dla Kimi K2.6. Zweryfikowano na podstawie platform.kimi.ai/docs/pricing/chat-k3, lipiec 2026.
Moonshot AI
1M tokens
$3/1M in
$15/1M out
text, vision, video input
Nie
Czym jest Kimi K3?
Wydany 16.07.2026 przez pekińską firmę Moonshot AI i zaprezentowany podczas World AI Conference w Szanghaju. Kimi K3 to model Mixture-of-Experts o 2,8 biliona parametrów (896 ekspertów, 16 aktywnych na token), z oknem kontekstu 1M tokenów oraz natywną obsługą wejścia tekstowego, obrazowego i wideo. ID API to kimi-k3, w cenie $3/1M tokenów wejściowych ($0,30 przy trafieniu w cache) i $15/1M tokenów wyjściowych, stałej niezależnie od długości kontekstu, dostępnej także przez OpenRouter. W dniu premiery model zajął 3. miejsce w Artificial Analysis Intelligence Index, porównywalne z Claude Opus 4.8 i GPT-5.5, co wywołało nagłówki o 'nowym momencie DeepSeek' i wyprzedaż na rynku półprzewodników. Otwarte wagi (około 594 GB, format MXFP4) zapowiedziano na 27.07.2026; w chwili tworzenia tej karty nie zostały jeszcze opublikowane, a licencja w stylu Modified-MIT jest spodziewana, lecz niepotwierdzona.
Kimi K3: plusy i minusy
Plusy
- 3. miejsce w Artificial Analysis Intelligence Index (57 punktów) w dniu premiery, wynik porównywalny z Claude Opus 4.8 i GPT-5.5: najbliższe dotąd podejście chińskiego laboratorium do zamkniętej amerykańskiej granicy możliwości
- 93,4 % w SWE-bench Verified w niezależnym środowisku testowym Vals AI (GPT-5.6 Sol: 96,2 %, Claude Fable 5: 95,0 %) oraz 1. miejsce w Frontend Code Arena serwisu Arena.ai z wynikiem 1679 punktów, przed Fable 5
- 93,5 % w GPQA Diamond (między 92,6 % Fable 5 a 94,1 % GPT-5.6), 96,1 % w AIME 2025 oraz Elo 1668 w pracy agentowej GDPval-AA v2, ustępując tylko Fable 5
- Silny profil agentowy: 1. miejsce w AutomationBench-AA dla przepływów SaaS (53 %), nawigacja po terminalu i repozytoriach w długim horyzoncie czasowym za pośrednictwem Kimi Code oraz około 21 % mniej tokenów wyjściowych niż K2 przy wyższej inteligencji
- $3/$15 za 1M tokenów (cena wejściowa spada do $0,30 przy trafieniu w cache), stała w całym oknie kontekstu 1M: wciąż wyraźnie poniżej cen amerykańskich modeli zamkniętej granicy możliwości, z API kompatybilnym z OpenAI i dostępnością przez OpenRouter
- Natywna obsługa wejścia multimodalnego (tekst, obraz, wideo) oraz zapowiedziane na 27.07.2026 otwarte wagi na spodziewanej licencji w stylu Modified-MIT, co czyni go pierwszym modelem klasy frontier o otwartych wagach w skali 3 bilionów parametrów
Minusy
- Trzykrotny wzrost ceny względem Kimi K2.6 (z $0,95/$4 do $3/$15) czyni go najdroższym chińskim modelem, jaki dotąd trafił na rynek, w cenie katalogowej zbliżonej do Claude Sonnet 5: era 'dziesięciokrotnie tańszych niż modele amerykańskie' się skończyła (podwyżkę udokumentował Simon Willison)
- Wolny: 33 tokeny wyjściowe na sekundę, 145. miejsce na 190 modeli w Artificial Analysis, słabe dopasowanie do zastosowań interaktywnych
- Odsetek halucynacji wzrósł z 39 % (K2.6) do 51 % w teście AA-Omniscience, ponieważ model obecnie próbuje odpowiadać na pytania, na które wcześniej odmawiał odpowiedzi (Fable 5 osiąga porównywalny wynik 54,9 %)
- Cenzura polityczna tematów wrażliwych w języku mandaryńskim (unikanie odpowiedzi w sprawach Xi, KPCh, Tiananmen) oraz jurysdykcja pekińska dla danych API stanowią barierę zgodności dla wielu wdrożeń w UE i firmach; brytyjskie AISI/CAISI wykazały też, że zabezpieczenia cybernetyczne modelu nie zablokowały podczas testów prób opracowania exploitów
- 'Otwarte wagi' są na razie teoretyczne dla większości: około 594 GB w natywnym formacie MXFP4 wymaga centrum danych z wieloma GPU do samodzielnego hostowania, a same wagi (wraz z ostateczną licencją) w momencie tej recenzji wciąż nie zostały opublikowane
Werdykt areny
Kimi K3 to jak dotąd najmocniejszy dowód, że granica możliwości nie jest już wyłącznie amerykańska: 3. miejsce w Artificial Analysis, czołowe wyniki w GPQA i SWE-bench Verified oraz najlepsza pozycja w rankingu kodu frontendowego w branży, przy cenie stanowiącej mniej więcej połowę do jednej trzeciej cen amerykańskich modeli zamkniętej granicy możliwości. Warto po niego sięgnąć do kodowania agentowego, pracy nad frontendem i automatyzacji SaaS, gdzie jego wyniki są najmocniejsze, a także jeśli plany zakładają samodzielny hosting modelu klasy frontier po publikacji wag. Lepiej go unikać w produktach interaktywnych (33 tokeny na sekundę to wolno), przy wszystkim, co dotyka treści politycznie wrażliwych lub wymaga ścisłej rezydencji danych w UE (cenzura w języku mandaryńskim, jurysdykcja pekińska), a także tam, gdzie liczy się wysoka dokładność wyszukiwania, bo 51 % halucynacji w AA-Omniscience wymaga dodatkowej warstwy weryfikacji. Zespoły skupione na kosztach powinny pamiętać, że DeepSeek V4 wciąż oferuje znacznie więcej tokenów za dolara; przewaga K3 to szczytowe możliwości za dolara, a nie najtańsze tokeny.
Kciuk w górę czy kciuk w dół
Wydaj swój werdykt
Polecasz Kimi K3, czy ostrzegasz przed nim tłum?
Najlepsze alternatywy dla Kimi K3
Wszystkie alternatywyNajszybszy model Anthropic: około 90% umiejętności kodowania Sonnet 4.5 za $1/$5 za 1M tokenów, 200K kontekstu.
Odświeżenie Opus od Anthropic z lipca 2026: inteligencja bliska Fable 5 za połowę ceny, wciąż $5/$25 jak w Opus 4.8
Flagowiec Anthropic klasy Mythos z czerwca 2026: 80.3% na SWE-bench Pro, 11 punktów przewagi nad każdym innym modelem frontierowym
Porównaj Kimi K3 w pojedynku
Co mówi tłum
“Tried it for our knowledge-base assistant and the hallucination rate is real: it confidently invented two API endpoints in one afternoon. 33 tokens per second on top of that. Back to waiting for the open weights to fine-tune.”
“Our Zapier-style automation stack runs on it now. Tool orchestration that GPT-5.5 fumbled works reliably, and the cache-hit pricing makes repeated workflows genuinely cheap.”
“The Frontend Arena ranking is deserved. Gave it the same dashboard spec I gave Fable 5 and K3's React came out cleaner, with fewer invented props. At $3/$15 through OpenRouter it was a drop-in swap.”
Kimi K3: najczęstsze pytania
Ile kosztuje Kimi K3 za 1M tokenów?
Kimi K3 kosztuje $3/1M in za 1M tokenów wejściowych i $15/1M out za 1M tokenów wyjściowych. Oficjalna cena katalogowa API Moonshot dla kimi-k3: $3/1M tokenów wejściowych (brak trafienia w cache), $0,30/1M przy trafieniu w cache, $15/1M tokenów wyjściowych łącznie ze śladem rozumowania, stała w całym oknie kontekstu 1M (bez progów zależnych od długości). Ta sama cena $3/$15 obowiązuje na OpenRouter (bez ujawnionego cennika cache). To trzykrotny wzrost względem $0,95/$4 dla Kimi K2.6. Zweryfikowano na podstawie platform.kimi.ai/docs/pricing/chat-k3, lipiec 2026.