Face-à-face

Logo de Kimi K3vsLogo de Claude Opus 5

Kimi K3 vs Claude Opus 5 : quel modèle IA l'emporte en 2026 ?

Kimi K3 ($15/1M out) et Claude Opus 5 ($25/1M out) comptent parmi les modèles IA les plus utilisés en 2026. Sur 7 votes de la communauté, Claude Opus 5 arrive en tête avec 63 % d'approbation.

Verdict rapide

Sur le critère Raisonnement, choisissez Claude Opus 5 : l'arène le note 5/5, contre 4.5/5 pour Kimi K3. Côté budget, Kimi K3 l'emporte : il démarre à $15/1M out, contre $25/1M out pour Claude Opus 5.

Comparaison ligne par ligne

À partir de
$15/1M outPrix officiel de la liste API Moonshot pour kimi-k3 : 3 $ par million de tokens en entrée (cache miss), 0,30 $ par million en cas de cache hit, 15 $ par million en sortie trace de raisonnement incluse, tarif fixe sur toute la fenêtre de 1M de tokens (aucun palier selon la longueur). Même tarif de 3 $/15 $ sur OpenRouter (le tarif de cache n'y est pas indiqué). Une hausse de 3 fois par rapport aux 0,95 $/4 $ de Kimi K2.6. Vérifié sur platform.kimi.ai/docs/pricing/chat-k3 en juillet 2026.
$25/1M outPrix officiel de la liste API Anthropic pour claude-opus-5 : 5 $ par million de tokens en entrée, 25 $ par million en sortie, inchangé depuis Opus 4.8, un seul palier avec un contexte de 1M de tokens à la fois par défaut et au maximum, 128K tokens de sortie maximum, mise en cache des prompts dès 512 tokens. Le mode rapide en avant-première de recherche, à 10 $/50 $ (environ 2,5 fois plus rapide), n'est disponible que sur l'API Claude. Vérifié sur platform.claude.com (What's new in Opus 5) en juillet 2026.
Éditeur
Moonshot AI
Anthropic
Fenêtre de contexte
1M tokens
1M tokens
Prix en entrée
$3/1M in
$5/1M in
Prix en sortie
$15/1M out
$25/1M out
Modalités
text, vision, video input
text, vision
Poids ouverts
Non
Non
Score de la foule
57%(3)
63%(4)
Notes de l'arène (1-5)
Raisonnement
4.5
5.0
Code
4.5
5.0
Écriture
4.0
4.0
Vitesse
2.0
2.0
Rapport qualité-prix
3.5
4.0

Forces et faiblesses

Kimi K3

  • 3e place de l'Artificial Analysis Intelligence Index (57) au lancement, comparable à Claude Opus 4.8 et GPT-5.5 : le laboratoire chinois qui s'est le plus rapproché de la frontière fermée américaine
  • 93,4 % sur SWE-bench Verified dans le harnais indépendant de Vals AI (GPT-5.6 Sol : 96,2 %, Claude Fable 5 : 95,0 %) et 1re place du Frontend Code Arena d'Arena.ai avec 1679 points, devant Fable 5
  • 93,5 % sur GPQA Diamond (entre les 92,6 % de Fable 5 et les 94,1 % de GPT-5.6), 96,1 % sur AIME 2025, et un Elo de 1668 sur le travail agentique de GDPval-AA v2, juste derrière Fable 5
  • Profil agentique solide : 1re place sur les workflows SaaS d'AutomationBench-AA (53 %), navigation autonome à long horizon dans un terminal et un dépôt via Kimi Code, et environ 21 % de tokens de sortie en moins que K2 pour plus d'intelligence
  • 3 $/15 $ par million de tokens (l'entrée tombe à 0,30 $ en cas de cache hit), tarif fixe sur toute la fenêtre de 1M de tokens : encore bien en dessous des tarifs de la frontière fermée américaine, avec une API compatible OpenAI et une disponibilité sur OpenRouter
  • Entrée multimodale native (texte, image, vidéo) et poids ouverts annoncés pour le 27/07/2026 sous une licence attendue de type Modified-MIT, ce qui en fait potentiellement le premier modèle de frontière à poids ouverts de classe 3 billions de paramètres
  • Un bond de prix multiplié par 3 par rapport à Kimi K2.6 (de 0,95 $/4 $ à 3 $/15 $), ce qui en fait le modèle chinois le plus cher jamais lancé, au tarif de Claude Sonnet 5 : l'époque des modèles « 10 fois moins chers que les modèles américains » est révolue (hausse documentée par Simon Willison)
  • Lent : 33 tokens de sortie par seconde, classé 145e sur 190 modèles sur Artificial Analysis, peu adapté aux usages interactifs
  • Le taux d'hallucination est passé de 39 % (K2.6) à 51 % sur AA-Omniscience, le modèle tentant désormais de répondre là où il aurait refusé auparavant (Fable 5 se situe à un niveau comparable de 54,9 %)
  • Censure politique sur les sujets sensibles en mandarin (élude les questions sur Xi, le PCC, Tiananmen) et juridiction de Pékin pour les données de l'API, un frein à la conformité pour de nombreux déploiements en entreprise et dans l'UE ; l'UK AISI/CAISI a également constaté que ses garde-fous en cybersécurité ne bloquaient pas les tentatives de développement d'exploits lors des tests
  • Des « poids ouverts » théoriques pour la plupart des utilisateurs : environ 594 Go en MXFP4 natif nécessitant un datacenter multi-GPU pour un hébergement autonome, les poids (et la licence finale) n'étant toujours pas publiés au moment de la revue

Claude Opus 5

  • Classé numéro 1 en intelligence composite parmi 190 modèles sur Artificial Analysis au lancement, avec 43,3 % sur Frontier-Bench v0.1 contre 34,4 % pour GPT-5.6 Sol et 33,7 % pour Claude Fable 5
  • 3,9 fois meilleur que GPT-5.6 Sol en raisonnement inédit sur ARC-AGI-3 (30,2 % contre 7,8 %), et un Elo de 1861 sur GDPval-AA v2 (travail de connaissance économique), devant Fable 5 (1747)
  • 79,2 % sur SWE-bench Pro, à un point de Fable 5 (80,0 %) et 10 points au-dessus d'Opus 4.8 (69,2 %), pour moitié prix de Fable 5 ; selon le cofondateur de Cursor, il offre « une intelligence proche de Fable 5, à la vitesse et au coût d'Opus »
  • Le même tarif de 5 $/25 $ qu'Opus 4.8, avec une fenêtre plus large : le contexte de 1M de tokens devient le seul et unique palier par défaut, avec 128K tokens de sortie maximum et une mise en cache des prompts dès 512 tokens
  • Les classificateurs de sécurité à double usage se déclenchent 85 % moins souvent que sur Fable 5, et le nouveau mode de repli par défaut évite les refus silencieux en cours de session qui avaient plombé le lancement de Fable 5
  • Il autovérifie son travail sans qu'on le lui demande, gère les changements d'outils en cours de conversation (bêta) sans casser le cache de prompt, et est disponible dès le premier jour sur Claude.ai, l'API, Bedrock, Vertex et Microsoft Foundry
  • Notablement lent et très verbeux : 52,6 tokens de sortie par seconde et 68 secondes avant le premier token sur Artificial Analysis, ayant consommé environ 100 millions de tokens de sortie lors de leur évaluation contre une médiane de 63 millions
  • Cette verbosité pose un vrai problème de coût réel : CodeRabbit a mesuré qu'il lit environ 50 % de texte en plus et en écrit environ 65 % de plus que les modèles de référence à chaque revue de code
  • Aucune vraie baisse de prix malgré le discours « rentable » : identique à Opus 4.8 (5 $/25 $), presque au tarif de GPT-5.6 (5 $/30 $), et plus de 2 fois les tarifs comparables de Gemini ou Grok
  • Les testeurs décrivent une personnalité « brillante mais agaçante » : sur-vérification, prudence excessive et refus occasionnels de tâches banales comme résoudre un conflit de fusion (revue de terrain de Lenny's Newsletter)
  • Un changement d'API qui casse la compatibilité pour les migrants d'Opus 4.8 : le mode réflexion est activé par défaut et ne peut pas être désactivé aux niveaux d'effort xhigh ou max (renvoie une erreur 400) ; le mode rapide (10 $/50 $, environ 2,5 fois plus rapide) n'est disponible que via l'API, pas sur Bedrock ni Vertex

Rendez votre verdict

Une recommandation par outil et par gladiateur. Elle façonne le score de foule que tout le monde voit.

Kimi K3$15/1M out
57%score de la foule · 3
Claude Opus 5$25/1M out
63%score de la foule · 4

Le verdict de l'arène sur Kimi K3

Kimi K3 est l'argument le plus solide à ce jour montrant que la frontière n'est plus exclusivement américaine : 3e place sur Artificial Analysis, des scores de haut niveau sur GPQA et SWE-bench Verified, et le meilleur classement du secteur sur l'arène de code frontend, le tout à environ la moitié voire le tiers des tarifs de la frontière fermée américaine. À privilégier pour le codage agentique, le travail frontend et l'automatisation SaaS, là où ses résultats sont les plus solides, ou si la feuille de route prévoit d'auto-héberger un modèle de classe frontière une fois les poids publiés. À éviter pour les produits interactifs (33 tokens par seconde, c'est lent), pour tout ce qui touche à des contenus politiquement sensibles ou à des exigences strictes de résidence des données dans l'UE (censure en langue mandarine, juridiction de Pékin), et pour la recherche d'information à haute précision, où son taux d'hallucination de 51 % sur AA-Omniscience impose une couche de vérification. Les équipes obsédées par le coût noteront que DeepSeek V4 offre toujours bien plus de tokens par dollar : l'argument de K3, c'est le pic de capacité par dollar, pas le token le moins cher.

Le verdict de l'arène sur Claude Opus 5

Claude Opus 5 est le choix par défaut raisonnable de la gamme Series 5 : la majeure partie de l'intelligence de Fable 5 (et même davantage sur Frontier-Bench et GDPval) pour exactement moitié prix en tokens, avec des classificateurs qui se déclenchent 85 % moins souvent. Si des charges de travail ont migré vers Fable 5 pour ses capacités mais que la facture ou les faux refus posent problème, il est temps de les déplacer ici ; pour ceux encore sur Opus 4.8, la mise à niveau apporte 10 points de SWE-bench Pro gratuitement. Deux raisons honnêtes de regarder ailleurs : la latence et la verbosité. À 52,6 tokens par seconde avec 68 secondes avant le premier token, il convient mal aux expériences interactives, et son appétit en tokens gonfle discrètement les coûts réels au-delà du prix affiché ; les pipelines à fort volume sensibles au budget restent donc mieux servis par Sonnet 5, Gemini ou DeepSeek. Fable 5 ne mérite d'être conservé que pour les sessions autonomes les plus longues, où son léger avantage sur SWE-bench Pro finit par compter.

Ce qu'en dit la foule

À propos de Kimi K3

Capitaine Churn

Tried it for our knowledge-base assistant and the hallucination rate is real: it confidently invented two API endpoints in one afternoon. 33 tokens per second on top of that. Back to waiting for the open weights to fine-tune.

Pouce d'Or Maximus

Our Zapier-style automation stack runs on it now. Tool orchestration that GPT-5.5 fumbled works reliably, and the cache-hit pricing makes repeated workflows genuinely cheap.

Saint Deployus

The Frontend Arena ranking is deserved. Gave it the same dashboard spec I gave Fable 5 and K3's React came out cleaner, with fewer invented props. At $3/$15 through OpenRouter it was a drop-in swap.

À propos de Claude Opus 5

Pouce en Bassicus

The sticker price is unchanged but my invoice is not: it writes essays where Opus 4.8 wrote answers. 68 seconds to first token killed it for our support chat, we went back to Sonnet 5.

Le Juge Bienveillant

Fed it a 40-tab financial model with cross-sheet formulas and asked for a scenario deck. It got the edge cases the analysts missed. For document-heavy enterprise work this is the best model I have used.

Sire Ship-Beaucoup

We moved off Fable 5 because the bio classifier kept flagging our genomics tooling. Opus 5 does the same work at half the price and I have not seen a single silent reroute since.

Gardien du Repo

Migrated our agents from Opus 4.8 the day it dropped. Same bill, and tasks that used to stall at the planning stage now just finish. The 10-point SWE-bench jump is not marketing, our merge queue feels it.

Questions fréquentes

Kimi K3 est-il meilleur que Claude Opus 5 ?

La foule penche aujourd'hui pour Claude Opus 5 : 63 % le recommandent, contre 57 % pour Kimi K3 (7 votes). Sur le critère Raisonnement, Claude Opus 5 obtient la meilleure note (5/5 contre 4.5/5). Le bon choix dépend de votre usage. La comparaison ligne par ligne de cette page passe en revue les prix, les caractéristiques clés et les notes de l'arène.

Lequel est le moins cher, Kimi K3 ou Claude Opus 5 ?

Kimi K3 est le moins cher : il démarre à $15/1M out, tandis que Claude Opus 5 démarre à $25/1M out.

Combien coûtent Kimi K3 et Claude Opus 5 par million de tokens ?

Kimi K3 : $3/1M in par million de tokens en entrée, $15/1M out par million de tokens en sortie. Claude Opus 5 : $5/1M in par million de tokens en entrée, $25/1M out par million de tokens en sortie.