Face-à-face

Logo de Claude Opus 4.8vsLogo de Kimi K3

Claude Opus 4.8 vs Kimi K3 : quel modèle IA l'emporte en 2026 ?

Claude Opus 4.8 ($25/1M out) et Kimi K3 ($15/1M out) comptent parmi les modèles IA les plus utilisés en 2026. Sur 6 votes de la communauté, Claude Opus 4.8 arrive en tête avec 57 % d'approbation.

Verdict rapide

Sur le critère Raisonnement, Claude Opus 4.8 et Kimi K3 sont à égalité à 4.5/5. Côté budget, Kimi K3 l'emporte : il démarre à $15/1M out, contre $25/1M out pour Claude Opus 4.8.

Comparaison ligne par ligne

À partir de
$25/1M outPalier standard à $5/$25 par million de tokens (inchangé depuis Opus 4.7) ; mode rapide en préversion de recherche à $10/$50 (contre $30/$150 pour le palier rapide déprécié d'Opus 4.7) ; API batch à -50 % soit $2.50/$12.50 ; pas de supplément long contexte jusqu'à 1M de tokens ; lectures du cache de prompts à $0.50/1M.
$15/1M outPrix officiel de la liste API Moonshot pour kimi-k3 : 3 $ par million de tokens en entrée (cache miss), 0,30 $ par million en cas de cache hit, 15 $ par million en sortie trace de raisonnement incluse, tarif fixe sur toute la fenêtre de 1M de tokens (aucun palier selon la longueur). Même tarif de 3 $/15 $ sur OpenRouter (le tarif de cache n'y est pas indiqué). Une hausse de 3 fois par rapport aux 0,95 $/4 $ de Kimi K2.6. Vérifié sur platform.kimi.ai/docs/pricing/chat-k3 en juillet 2026.
Éditeur
Anthropic
Moonshot AI
Fenêtre de contexte
1M tokens (128K max output)
1M tokens
Prix en entrée
$5/1M in
$3/1M in
Prix en sortie
$25/1M out
$15/1M out
Modalités
text, vision (image input up to 2576px, text output)
text, vision, video input
Poids ouverts
Non
Non
Score de la foule
57%(3)
57%(3)
Notes de l'arène (1-5)
Raisonnement
4.5
4.5
Code
5.0
4.5
Écriture
5.0
4.0
Vitesse
3.0
2.0
Rapport qualité-prix
3.5
3.5

Forces et faiblesses

Claude Opus 4.8

  • SWE-Bench Pro à 69,2 % (contre 64,3 % pour Opus 4.7) et bat les Opus précédents sur CursorBench à tous les niveaux d'effort ; excellents retours de terrain sur les grosses refactorisations et les chasses aux bugs multi-fichiers
  • Environ 4x moins susceptible qu'Opus 4.7 de laisser passer sans signalement des défauts dans son propre code généré ; grand bond en raisonnement mathématique (USAMO 2026 : 96,7 % contre 69,3 %)
  • Contexte de 1M de tokens et sortie de 128K au prix inchangé de $5/$25, sans supplément long contexte ; API batch à -50 % ($2.50/$12.50)
  • Le mode rapide (préversion de recherche) offre jusqu'à 2,5x la vitesse de sortie à $10/$50, 3x moins cher que le palier rapide d'Opus 4.7 ($30/$150)
  • Fonctions API uniques pour les agents : messages système en cours de conversation qui préservent le cache de prompts, et Dynamic Workflows lançant des sous-agents parallèles dans Claude Code
  • 84 % sur l'automatisation de navigateur Online-Mind2Web et score record au Legal Agent Benchmark (premier modèle au-dessus de 10 % all-pass) ; solide en travail de connaissance en entreprise (Box rapporte 87 % contre 77 % en interne)
  • Régressions signalées tour par tour : consignes évidentes manquées dans des documents de planification, réponses limitées à une tranche étroite de l'objectif, et génération d'UI simple en un coup moins bonne que 4.7
  • Style d'écriture critiqué par les gros utilisateurs : précautions excessives, édition trop prudente qui « coupe tout ce qui est audacieux ou drôle » (Steve Yegge), et boucles de contestation même face à des thèses bien étayées
  • Bizarrerie de mélange de langues : des utilisateurs signalent des insertions aléatoires de chinois, de cyrillique ou de grec dans de longs fils de recherche
  • Dégradation visible de la qualité au-delà de ~200K tokens à l'usage, malgré la fenêtre de 1M annoncée
  • Régression sur Vending-Bench : tombe dans les pièges de fournisseurs frauduleux environ 30x plus que 4.7 et négocie moins bien (effet secondaire d'un alignement d'honnêteté plus strict)

Kimi K3

  • 3e place de l'Artificial Analysis Intelligence Index (57) au lancement, comparable à Claude Opus 4.8 et GPT-5.5 : le laboratoire chinois qui s'est le plus rapproché de la frontière fermée américaine
  • 93,4 % sur SWE-bench Verified dans le harnais indépendant de Vals AI (GPT-5.6 Sol : 96,2 %, Claude Fable 5 : 95,0 %) et 1re place du Frontend Code Arena d'Arena.ai avec 1679 points, devant Fable 5
  • 93,5 % sur GPQA Diamond (entre les 92,6 % de Fable 5 et les 94,1 % de GPT-5.6), 96,1 % sur AIME 2025, et un Elo de 1668 sur le travail agentique de GDPval-AA v2, juste derrière Fable 5
  • Profil agentique solide : 1re place sur les workflows SaaS d'AutomationBench-AA (53 %), navigation autonome à long horizon dans un terminal et un dépôt via Kimi Code, et environ 21 % de tokens de sortie en moins que K2 pour plus d'intelligence
  • 3 $/15 $ par million de tokens (l'entrée tombe à 0,30 $ en cas de cache hit), tarif fixe sur toute la fenêtre de 1M de tokens : encore bien en dessous des tarifs de la frontière fermée américaine, avec une API compatible OpenAI et une disponibilité sur OpenRouter
  • Entrée multimodale native (texte, image, vidéo) et poids ouverts annoncés pour le 27/07/2026 sous une licence attendue de type Modified-MIT, ce qui en fait potentiellement le premier modèle de frontière à poids ouverts de classe 3 billions de paramètres
  • Un bond de prix multiplié par 3 par rapport à Kimi K2.6 (de 0,95 $/4 $ à 3 $/15 $), ce qui en fait le modèle chinois le plus cher jamais lancé, au tarif de Claude Sonnet 5 : l'époque des modèles « 10 fois moins chers que les modèles américains » est révolue (hausse documentée par Simon Willison)
  • Lent : 33 tokens de sortie par seconde, classé 145e sur 190 modèles sur Artificial Analysis, peu adapté aux usages interactifs
  • Le taux d'hallucination est passé de 39 % (K2.6) à 51 % sur AA-Omniscience, le modèle tentant désormais de répondre là où il aurait refusé auparavant (Fable 5 se situe à un niveau comparable de 54,9 %)
  • Censure politique sur les sujets sensibles en mandarin (élude les questions sur Xi, le PCC, Tiananmen) et juridiction de Pékin pour les données de l'API, un frein à la conformité pour de nombreux déploiements en entreprise et dans l'UE ; l'UK AISI/CAISI a également constaté que ses garde-fous en cybersécurité ne bloquaient pas les tentatives de développement d'exploits lors des tests
  • Des « poids ouverts » théoriques pour la plupart des utilisateurs : environ 594 Go en MXFP4 natif nécessitant un datacenter multi-GPU pour un hébergement autonome, les poids (et la licence finale) n'étant toujours pas publiés au moment de la revue

Rendez votre verdict

Une recommandation par outil et par gladiateur. Elle façonne le score de foule que tout le monde voit.

Claude Opus 4.8$25/1M out
57%score de la foule · 3
Kimi K3$15/1M out
57%score de la foule · 3

Le verdict de l'arène sur Claude Opus 4.8

Une mise à niveau directe pour les utilisateurs d'Opus 4.7 : surface API identique et prix de $5/$25, avec de vrais gains sur le codage agentique de longue haleine, la revue de code et l'analyse en entreprise. Choisissez-le si vous utilisez Claude Code, des migrations multi-fichiers, des audits de sécurité ou des pipelines d'agents qui inspectent, agissent et vérifient sur de nombreuses étapes. Passez votre chemin pour les petits snippets d'UI en un coup ou les prompts finement réglés sur le comportement de 4.7, où des régressions sont signalées, et prenez Sonnet 5 ($3/$15, tarif de lancement $2/$10 jusqu'en août 2026) si le coût compte plus que la capacité maximale. Les rédacteurs sensibles aux précautions excessives et à l'édition trop prudente pourront trouver son style frustrant.

Le verdict de l'arène sur Kimi K3

Kimi K3 est l'argument le plus solide à ce jour montrant que la frontière n'est plus exclusivement américaine : 3e place sur Artificial Analysis, des scores de haut niveau sur GPQA et SWE-bench Verified, et le meilleur classement du secteur sur l'arène de code frontend, le tout à environ la moitié voire le tiers des tarifs de la frontière fermée américaine. À privilégier pour le codage agentique, le travail frontend et l'automatisation SaaS, là où ses résultats sont les plus solides, ou si la feuille de route prévoit d'auto-héberger un modèle de classe frontière une fois les poids publiés. À éviter pour les produits interactifs (33 tokens par seconde, c'est lent), pour tout ce qui touche à des contenus politiquement sensibles ou à des exigences strictes de résidence des données dans l'UE (censure en langue mandarine, juridiction de Pékin), et pour la recherche d'information à haute précision, où son taux d'hallucination de 51 % sur AA-Omniscience impose une couche de vérification. Les équipes obsédées par le coût noteront que DeepSeek V4 offre toujours bien plus de tokens par dollar : l'argument de K3, c'est le pic de capacité par dollar, pas le token le moins cher.

Ce qu'en dit la foule

À propos de Claude Opus 4.8

Juge Redoutable

Writing took a hit. It hedges everything and edits any bold or funny line out of my drafts. Also caught it answering a narrow slice of my planning doc and calling it done.

Champion des Vibes

Threw USAMO-level math at it for a lark and it just grinds through. 96.7 vs 69 for 4.7 tracks with what I see. Same $5/$25, 1M context, no excuse not to switch.

Glorius Maximus

Upgraded from 4.7 for a monorepo refactor and the difference is real. It actually flags its own sketchy code instead of shipping it. Multi-file bug hunts feel way less babysat.

À propos de Kimi K3

Capitaine Churn

Tried it for our knowledge-base assistant and the hallucination rate is real: it confidently invented two API endpoints in one afternoon. 33 tokens per second on top of that. Back to waiting for the open weights to fine-tune.

Pouce d'Or Maximus

Our Zapier-style automation stack runs on it now. Tool orchestration that GPT-5.5 fumbled works reliably, and the cache-hit pricing makes repeated workflows genuinely cheap.

Saint Deployus

The Frontend Arena ranking is deserved. Gave it the same dashboard spec I gave Fable 5 and K3's React came out cleaner, with fewer invented props. At $3/$15 through OpenRouter it was a drop-in swap.

Questions fréquentes

Claude Opus 4.8 est-il meilleur que Kimi K3 ?

Le bon choix dépend de votre usage. La comparaison ligne par ligne de cette page passe en revue les prix, les caractéristiques clés et les notes de l'arène.

Lequel est le moins cher, Claude Opus 4.8 ou Kimi K3 ?

Kimi K3 est le moins cher : il démarre à $15/1M out, tandis que Claude Opus 4.8 démarre à $25/1M out.

Combien coûtent Claude Opus 4.8 et Kimi K3 par million de tokens ?

Claude Opus 4.8 : $5/1M in par million de tokens en entrée, $25/1M out par million de tokens en sortie. Kimi K3 : $3/1M in par million de tokens en entrée, $15/1M out par million de tokens en sortie.