一騎打ち

Kimi K3 のロゴvsClaude Opus 5 のロゴ

Kimi K3 vs Claude Opus 5:2026年に勝つAIモデルはどっち?

Kimi K3($15/1M out)と Claude Opus 5($25/1M out)は、2026年に最も使われているAIモデルのひとつです。 7件のコミュニティ票のうち、Claude Opus 5 が支持率63%でリードしています。

即断の評決

推論で選ぶなら Claude Opus 5:アリーナの評価は5/5、対する Kimi K3 は4.5/5です。 予算重視なら Kimi K3 の勝ち:$15/1M outから始められるのに対し、Claude Opus 5 は$25/1M outからです。

項目別比較

最低価格
$15/1M outkimi-k3のMoonshot公式API定価は、入力100万トークンあたり3ドル(キャッシュミス時)、キャッシュヒット時は0.30ドル、出力100万トークンあたり15ドル(推論トレース込み)で、1Mトークンのコンテキスト全体で均一料金です(長さによる階層はありません)。OpenRouterでも同じ3ドル/15ドルですが、そちらではキャッシュ料金は公開されていません。これはKimi K2.6の0.95ドル/4ドルから3倍の値上げです。platform.kimi.ai/docs/pricing/chat-k3を基準に2026年7月時点で確認済みです。
$25/1M outclaude-opus-5のアンソロピック公式API定価は、入力100万トークンあたり5ドル、出力100万トークンあたり25ドルで、Opus 4.8から変更はありません。コンテキストは1Mトークンの単一階層でデフォルトかつ最大値、最大出力は128K、プロンプトキャッシュは512トークンから利用可能です。リサーチプレビュー版のFastモード(10ドル/50ドル、約2.5倍高速)はClaude API限定です。platform.claude.com(Opus 5の新機能ページ)にて2026年7月時点で確認済みです。
プロバイダー
Moonshot AI
Anthropic
コンテキストウィンドウ
1M tokens
1M tokens
入力料金
$3/1M in
$5/1M in
出力料金
$15/1M out
$25/1M out
モダリティ
text, vision, video input
text, vision
オープンウェイト
なし
なし
観客スコア
57%(3)
63%(4)
アリーナ評価(1-5)
推論
4.5
5.0
コーディング
4.5
5.0
ライティング
4.0
4.0
速度
2.0
2.0
コスパ
3.5
4.0

強みと弱み

Kimi K3

  • 発売時点でArtificial Analysis Intelligence Indexの第3位(スコア57)を獲得し、Claude Opus 4.8やGPT-5.5に匹敵する水準です。これは中国の研究機関が米国のクローズドなフロンティアモデルに最も近づいた事例といえます。
  • Vals AIの独立評価環境によるSWE-bench Verifiedで93.4%を記録し(GPT-5.6 Solは96.2%、Claude Fable 5は95.0%)、Arena.aiのFrontend Code Arenaでは1679ポイントでFable 5を上回り第1位を獲得しました。
  • GPQA Diamondでは93.5%を記録し(Fable 5の92.6%とGPT-5.6の94.1%の間)、AIME 2025では96.1%、GDPval-AA v2のエージェント作業評価ではEloレーティング1668でFable 5に次ぐ第2位となりました。
  • エージェント性能に優れており、AutomationBench-AAのSaaSワークフロー評価で53%を記録し第1位となりました。Kimi Codeを通じた長時間のターミナル操作やリポジトリ探索にも対応し、K2と比べて出力トークン数が約21%少ないにもかかわらず知能は向上しています。
  • 価格は100万トークンあたり3ドル/15ドルで(キャッシュヒット時の入力は0.30ドルまで下がります)、1Mトークンのコンテキスト全体で均一です。米国のクローズドなフロンティアモデルの価格よりも依然として大幅に安く、OpenAI互換APIを備え、OpenRouterでも利用できます。
  • テキスト、画像、動画のネイティブなマルチモーダル入力に対応し、2026年7月27日にはModified MIT形式(想定)のライセンスでオープンウェイトの公開が予定されており、初の3兆パラメータ級オープンウェイト・フロンティアモデルとなる見込みです。
  • Kimi K2.6(0.95ドル/4ドル)から3ドル/15ドルへと価格が3倍に上昇し、これまでにリリースされた中国製モデルの中で最も高価となり、Claude Sonnet 5の定価水準に達しています。「米国モデルより10倍安い」という時代は終わったといえ、Simon Willisonがこの値上げを詳しく記録しています。
  • 速度は遅く、出力は秒間33トークンで、Artificial Analysisの190モデル中145位にとどまり、対話的な用途には不向きです。
  • AA-Omniscienceにおける幻覚率はK2.6の39%から51%に上昇しました。これは以前なら回答を拒否していたであろう質問にも今回は答えを試みるようになったためです(Fable 5も同水準の54.9%です)。
  • 中国語での機微な話題(習近平、中国共産党、天安門事件など)に対する政治的検閲が存在し、APIデータの管轄も北京にあるため、多くのEU企業や規制対応が必要な導入先ではコンプライアンス上の障壁となります。さらに英国のAISI/CAISIによるテストでは、サイバーセキュリティのガードレールがエクスプロイト開発の試みを阻止できなかったことも確認されています。
  • 「オープンウェイト」とはいっても大半のユーザーにとっては理論上のものにすぎません。ネイティブMXFP4形式で約594GBあり、自前でホストするには複数GPUを備えたデータセンターが必要です。また本レビュー時点では、ウェイト本体と最終的なライセンスもまだ公開されていません。

Claude Opus 5

  • 発売時点でArtificial Analysisの190モデル中、複合知能スコアで第1位を獲得し、Frontier-Bench v0.1では43.3%を記録しました(GPT-5.6 Solは34.4%、Claude Fable 5は33.7%)。
  • ARC-AGI-3の新規推論タスクではGPT-5.6 Solの3.9倍のスコア(30.2%対7.8%)を記録し、GDPval-AA v2の経済知識労働タスクではEloレーティング1861でFable 5(1747)を上回りました。
  • SWE-bench Proでは79.2%を記録し、Fable 5(80.0%)にわずか1ポイント差まで迫るとともにOpus 4.8(69.2%)を10ポイント上回りました。価格はFable 5の半分で、Cursorの共同創業者は「Opusの速度とコストでFable 5に近い知能」と評しています。
  • 価格はOpus 4.8と同じ5ドル/25ドルのまま、コンテキスト幅は拡大しています。1Mトークンが唯一かつデフォルトの階層となり、最大出力は128K、プロンプトキャッシュは512トークンから利用できます。
  • デュアルユース安全性分類器の誤作動はFable 5より85%少なく、新しいデフォルトのフォールバックモードにより、Fable 5の発売時に問題となっていたセッション中の無言の拒否も回避されます。
  • 指示せずとも自らの作業内容を自己検証し、会話途中のツール変更(ベータ版)にもプロンプトキャッシュを壊さずに対応します。発売初日からClaude.ai、API、Bedrock、Vertex、Microsoft Foundryで利用可能です。
  • 際立って低速かつ非常に冗長です。Artificial Analysisの計測では出力速度が秒間52.6トークン、最初のトークンまで68秒かかり、評価中に消費した出力トークン数は約1億で、中央値の6300万を大きく上回りました。
  • この冗長さは実運用上のコスト増につながります。CodeRabbitの計測では、コードレビュー1回あたりの読み込み量が基準となるフロンティアモデルより約50%多く、書き込み量も約65%多いという結果が出ています。
  • 「コスト効率が良い」と謳われていますが、実際の値下げはありません。価格はOpus 4.8と同一(5ドル/25ドル)で、GPT-5.6(5ドル/30ドル)にほぼ匹敵し、同等クラスのGeminiやGrokの2倍以上です。
  • レビュアーからは「優秀だが煩わしい」性格だと評されています。過剰な検証、言い回しの保険的表現、そしてマージコンフリクトの解消のような日常的タスクを時折拒否する挙動が見られます(Lenny's Newsletterの実地レビューより)。
  • Opus 4.8から移行するユーザーにとっては破壊的なAPI変更があります。思考機能はデフォルトでオンになっており、xhighまたはmaxの努力量では無効化できず(400エラーが返されます)、Fastモード(10ドル/50ドル、約2.5倍高速)はAPI限定でBedrockやVertexでは利用できません。

あなたの審判を下す

1人につき各ツール1票。あなたの推薦が、みんなの見る観客スコアを動かします。

Kimi K3$15/1M out
57%観客スコア · 3
Claude Opus 5$25/1M out
63%観客スコア · 4

Kimi K3 へのアリーナの評決

Kimi K3は、フロンティアがもはや米国だけのものではないことを示す最も強力な証拠です。Artificial Analysisで第3位、GPQAとSWE-bench Verifiedでもトップクラスのスコアを記録し、フロントエンドコード分野のアリーナ評価では業界最高位を獲得しながら、価格は米国のクローズドなフロンティアモデルのおよそ2分の1から3分の1にとどまります。ベンチマークが特に強いエージェント型コーディング、フロントエンド作業、SaaS自動化には向いており、ウェイト公開後にフロンティア級モデルを自前でホストする計画があるチームにも適しています。一方、対話型プロダクト(秒間33トークンは遅い)、政治的に機微な内容やEUの厳格なデータ所在地要件が絡む用途(中国語での検閲、北京の管轄)、そしてAA-Omniscienceでの幻覚率51%が検証レイヤーを必要とする高精度な検索用途には向きません。コストを最優先するチームは、DeepSeek V4が依然としてドルあたりのトークン量で圧倒的に優れている点に注意すべきです。K3が訴求するのはドルあたりの最安値ではなく、ドルあたりのピーク性能です。

Claude Opus 5 へのアリーナの評決

Claude Opus 5はSeries 5ラインナップの中で最も無難な既定選択肢です。Fable 5の知能をほぼそのまま(しかもFrontier-BenchとGDPvalではFable 5を上回りつつ)トークン価格はちょうど半分で、分類器の誤作動も85%少なくなっています。能力を求めてFable 5にワークロードを移行したものの、料金や誤検知による拒否に不満があるなら、こちらに移行する価値があります。まだOpus 4.8を使っているなら、SWE-bench Proで10ポイントのアップグレードを追加コストなしで得られます。他の選択肢を検討すべき正直な理由は2つあります。レイテンシと冗長さです。秒間52.6トークン、最初のトークンまで68秒という速度は対話的なUXには不向きで、トークン消費量の多さが表示価格以上に実質コストを押し上げるため、予算を重視する大量処理パイプラインには依然としてSonnet 5、Gemini、DeepSeekが適しています。Fable 5を使い続ける価値があるのは、SWE-bench Proでのわずかな優位が積み重なる、最も長時間の自律実行タスクに限られます。

観客の声

Kimi K3 について

解約隊長

Tried it for our knowledge-base assistant and the hallucination rate is real: it confidently invented two API endpoints in one afternoon. 33 tokens per second on top of that. Back to waiting for the open weights to fine-tune.

黄金の親指クス

Our Zapier-style automation stack runs on it now. Tool orchestration that GPT-5.5 fumbled works reliably, and the cache-hit pricing makes repeated workflows genuinely cheap.

聖デプロイウス

The Frontend Arena ranking is deserved. Gave it the same dashboard spec I gave Fable 5 and K3's React came out cleaner, with fewer invented props. At $3/$15 through OpenRouter it was a drop-in swap.

Claude Opus 5 について

親指下げリクス

The sticker price is unchanged but my invoice is not: it writes essays where Opus 4.8 wrote answers. 68 seconds to first token killed it for our support chat, we went back to Sonnet 5.

公正なる審判者

Fed it a 40-tab financial model with cross-sheet formulas and asked for a scenario deck. It got the edge cases the analysts missed. For document-heavy enterprise work this is the best model I have used.

リリース卿

We moved off Fable 5 because the bio classifier kept flagging our genomics tooling. Opus 5 does the same work at half the price and I have not seen a single silent reroute since.

リポジトリの守護者

Migrated our agents from Opus 4.8 the day it dropped. Same bill, and tasks that used to stall at the planning stage now just finish. The 10-point SWE-bench jump is not marketing, our merge queue feels it.

よくある質問

Kimi K3 は Claude Opus 5 より優れていますか?

現在、観客は Claude Opus 5 を支持しています:推薦率63%、対する Kimi K3 は57%です(7票)。 推論では Claude Opus 5 が上回っています(5/5 vs 4.5/5)。 最適な選択は用途次第です。このページの項目別比較で、料金、主要スペック、アリーナ評価を分解しています。

Kimi K3 と Claude Opus 5、安いのはどちらですか?

Kimi K3 の方が安く、$15/1M outから始められます。Claude Opus 5 は$25/1M outからです。

Kimi K3 と Claude Opus 5 の100万トークンあたりの料金は?

Kimi K3:入力100万トークンあたり$3/1M in、出力100万トークンあたり$15/1M out。Claude Opus 5:入力100万トークンあたり$5/1M in、出力100万トークンあたり$25/1M out。