Direktvergleich
DeepSeek-V4 vs Kimi K3: Wer gewinnt das KI-Modell-Duell 2026?
DeepSeek-V4 ($0.87/1M out) und Kimi K3 ($15/1M out) sind 2026 zwei der meistgenutzten KI-Modelle. Bei 6 Stimmen der Community führt DeepSeek-V4 mit 57% Zustimmung.
Schnelles Urteil
Bei Reasoning liegen DeepSeek-V4 und Kimi K3 gleichauf bei 4.5/5. Beim Budget gewinnt DeepSeek-V4: Es startet bei $0.87/1M out gegenüber $15/1M out für Kimi K3.
Vergleich Zeile für Zeile
Stärken und Schwächen
DeepSeek-V4
- 1M-Token-Kontextfenster (8x die 128K von V3.2) mit bis zu 384K Output-Tokens, Standard auf der offiziellen API
- Aggressive Preise: $0.435/$0.87 pro 1M Tokens (V4-Pro), pro Output-Token rund 28.7x günstiger als Claude Opus 4.8; Input mit Cache-Treffer fällt auf $0.003625/1M (über 99% Rabatt)
- MIT-lizenzierte offene Gewichte für V4-Pro und V4-Flash auf Hugging Face: kommerzielle Nutzung, Fine-Tuning und Weiterverbreitung erlaubt
- Open-Source-SOTA beim agentischen Coding: 80.6 auf SWE-bench Verified (Konfiguration Think Max), gleichauf mit Gemini 3.1 Pro, dazu Codeforces-Rating 3206 (~Rang 23 gegenüber Menschen)
- Platz #3 von 93 im Artificial Analysis Intelligence Index (Score 44), deutlich über dem Durchschnitt von 25
- Der Sparse-Attention-Stack senkt die 1M-Kontext-Inferenz auf 27% der FLOPs von V3.2 und 10% von dessen KV-Cache
- Zeitweise fehlerhafte Tool-Calls: Funktionsaufrufe landen manchmal als Klartext im Content statt im tool_calls-Feld (GitHub-Issue deepseek-ai #1244)
- Der Thinking-Modus bricht lange Multi-Turn-Tool-Call-Ketten in Agent-Frameworks mit 400-Fehlern ab (OpenClaw-Issue #72044, Fix noch unvollständig)
- Entwickler berichten, dass es in eigenen Codebasen nicht existierende APIs erfindet und in Agent-Schleifen auf halluzinierte Nutzereingaben reagiert
- Sehr wortreich (180M Eval-Output-Tokens gegenüber 95M im Median) und Mittelfeld-Tempo mit 54.6 Tokens/s (#39/93), was den niedrigen Preis pro Token in der Praxis aufzehrt
- Nur Text (keine Vision, kein Audio) und weiterhin eine Preview: Das für Mitte Juli 2026 geplante offizielle Release bringt Stoßzeiten-Preise, die die gelisteten API-Tarife während der Pekinger Geschäftszeiten verdoppeln
Kimi K3
- Beim Launch Platz 3 im Artificial Analysis Intelligence Index (57), vergleichbar mit Claude Opus 4.8 und GPT-5.5: das bislang engste Heranreichen eines chinesischen Labors an die geschlossene US-Frontier
- 93,4 % auf SWE-bench Verified im unabhängigen Testrahmen von Vals AI (GPT-5.6 Sol: 96,2 %, Claude Fable 5: 95,0 %) und Platz 1 auf der Frontend Code Arena von Arena.ai mit 1679 Punkten, vor Fable 5
- 93,5 % auf GPQA Diamond (zwischen Fable 5 mit 92,6 % und GPT-5.6 mit 94,1 %), 96,1 % auf AIME 2025 und Elo 1668 auf GDPval-AA v2 für agentische Arbeit, nur hinter Fable 5
- Starkes agentisches Profil: Platz 1 bei den SaaS-Workflows von AutomationBench-AA (53 %), Long-Horizon-Terminal- und Repo-Navigation über Kimi Code sowie rund 21 % weniger Ausgabe-Tokens als K2 bei höherer Intelligenz
- $3/$15 pro 1M Tokens (Eingabe sinkt auf $0,30 bei Cache-Treffer), flach über das gesamte 1M-Kontextfenster: weiterhin deutlich unter den Preisen der geschlossenen US-Frontier, mit einer OpenAI-kompatiblen API und Verfügbarkeit auf OpenRouter
- Native multimodale Eingabe (Text, Bild, Video) und offene Gewichte für den 27.07.2026 angekündigt, voraussichtlich unter einer Lizenz nach Modified-MIT-Vorbild, was es zum ersten Frontier-Modell der 3-Billionen-Parameter-Klasse mit offenen Gewichten macht
- Preissprung um das Dreifache gegenüber Kimi K2.6 ($0,95/$4 auf $3/$15), damit das teuerste je veröffentlichte chinesische Modell, auf Listenpreisniveau von Claude Sonnet 5: die Ära '10-mal günstiger als US-Modelle' ist vorbei (Simon Willison dokumentierte den Anstieg)
- Langsam: 33 Ausgabe-Tokens/s, Platz 145 von 190 Modellen bei Artificial Analysis, schlecht geeignet für interaktive Nutzung
- Halluzinationsrate stieg von 39 % (K2.6) auf 51 % bei AA-Omniscience, da das Modell nun Antworten versucht, die es zuvor verweigert hätte (Fable 5 liegt mit 54,9 % in vergleichbarem Bereich)
- Politische Zensur bei heiklen Themen auf Mandarin (weicht bei Xi, KP Chinas, Tiananmen aus) und Datenverarbeitung der API unter Pekinger Jurisdiktion, ein Compliance-Hindernis für viele EU- und Unternehmenseinsätze; auch UK AISI/CAISI stellte fest, dass die Cyber-Schutzmechanismen Versuche zur Exploit-Entwicklung im Test nicht blockierten
- 'Offene Gewichte' bleiben für die meisten theoretisch: rund 594 GB im nativen MXFP4-Format erfordern ein Multi-GPU-Rechenzentrum für den Eigenbetrieb, und die Gewichte (samt endgültiger Lizenz) waren zum Zeitpunkt der Bewertung noch nicht veröffentlicht
Fällen Sie Ihr Urteil
Eine Empfehlung pro Tool und Gladiator. Sie verändert den Crowd-Score, den alle sehen.
Das Urteil der Arena zu DeepSeek-V4
Wählen Sie DeepSeek-V4, wenn Sie Reasoning und agentisches Coding fast auf Frontier-Niveau zum 3-fach bis knapp 30-fach niedrigeren Preis als Claude Opus oder GPT-5.5 wollen, oder wenn Ihnen MIT-lizenzierte Gewichte für Self-Hosting und Fine-Tuning wichtig sind. Es ist ein entschiedenes Upgrade gegenüber V3.2: 8x längerer Kontext, deutlich günstigere Long-Context-Inferenz und stärkeres Coding, und die alten deepseek-chat/reasoner-Endpunkte werden ohnehin am 24. Juli 2026 abgeschaltet. Meiden Sie es für Produktions-Agents, die auf absolut zuverlässiges Multi-Turn-Tool-Calling angewiesen sind, wo Nutzer weiterhin fehlerhafte Tool-Calls und erfundene APIs melden, sowie für jede Vision- oder Audio-Arbeit, da es reiner Text ist. Latenzsensible Apps sollten zuerst testen, denn seine Wortfülle und das Mittelfeld-Tempo von 54.6 Tokens/s fressen einen Teil des Kostenvorteils auf, und kalkulieren Sie die Verdopplung der Preise zu Stoßzeiten ein, die mit dem offiziellen Release Mitte Juli kommt.
Das Urteil der Arena zu Kimi K3
Kimi K3 ist bislang das stärkste Argument dafür, dass die Frontier nicht mehr ausschließlich amerikanisch ist: Platz 3 bei Artificial Analysis, Spitzenwerte bei GPQA und SWE-bench Verified und das beste Frontend-Code-Arena-Ranking der Branche, zu etwa der Hälfte bis einem Drittel der Preise der geschlossenen US-Frontier. Geeignet für agentisches Coding, Frontend-Arbeit und SaaS-Automatisierung, wo die Benchmarks am stärksten sind, oder wenn die Roadmap den Eigenbetrieb eines Frontier-Modells vorsieht, sobald die Gewichte verfügbar sind. Nicht geeignet für interaktive Produkte (33 Tokens/s sind langsam), für alles mit politisch heiklen Inhalten oder strengen EU-Anforderungen an die Datenresidenz (Zensur auf Mandarin, Pekinger Jurisdiktion) sowie für hochpräzise Suche, wo die Halluzinationsrate von 51 % bei AA-Omniscience eine Verifizierungsebene erfordert. Kostenbewusste Teams sollten beachten, dass DeepSeek V4 weiterhin deutlich mehr Tokens pro Dollar liefert; K3 punktet mit maximaler Fähigkeit pro Dollar, nicht mit den günstigsten Tokens.
Was die Menge sagt
Zu DeepSeek-V4
“Tool calling is flaky. Function calls sometimes land as plain text instead of the tool_calls field, and thinking mode 400s on long multi-turn chains. Not agent-ready yet.”
“MIT license on both Pro and Flash weights is the real story. Fine-tune, redistribute, ship commercially, no lawyer needed. Plus 384K output tokens for long-doc generation.”
“MIT weights, 1M context, and output tokens roughly 29x cheaper than Opus 4.8. Cache hits make input basically free. Moved my bulk pipelines over and the bill collapsed.”
Zu Kimi K3
“Tried it for our knowledge-base assistant and the hallucination rate is real: it confidently invented two API endpoints in one afternoon. 33 tokens per second on top of that. Back to waiting for the open weights to fine-tune.”
“Our Zapier-style automation stack runs on it now. Tool orchestration that GPT-5.5 fumbled works reliably, and the cache-hit pricing makes repeated workflows genuinely cheap.”
“The Frontend Arena ranking is deserved. Gave it the same dashboard spec I gave Fable 5 and K3's React came out cleaner, with fewer invented props. At $3/$15 through OpenRouter it was a drop-in swap.”
Weiter vergleichen
Häufige Fragen
Ist DeepSeek-V4 besser als Kimi K3?
Die richtige Wahl hängt von Ihrem Einsatzzweck ab. Der Vergleich Zeile für Zeile auf dieser Seite schlüsselt Preise, Kerndaten und Arena-Bewertungen auf.
Was ist günstiger, DeepSeek-V4 oder Kimi K3?
DeepSeek-V4 ist günstiger: Es startet bei $0.87/1M out, während Kimi K3 bei $15/1M out startet.
Was kosten DeepSeek-V4 und Kimi K3 pro 1M Tokens?
DeepSeek-V4: $0.435/1M in (cache hit $0.003625) pro 1M Input-Tokens, $0.87/1M out pro 1M Output-Tokens. Kimi K3: $3/1M in pro 1M Input-Tokens, $15/1M out pro 1M Output-Tokens.