一騎打ち
Claude Opus 4.8 vs Kimi K3:2026年に勝つAIモデルはどっち?
Claude Opus 4.8($25/1M out)と Kimi K3($15/1M out)は、2026年に最も使われているAIモデルのひとつです。 6件のコミュニティ票のうち、Claude Opus 4.8 が支持率57%でリードしています。
即断の評決
推論では、Claude Opus 4.8 と Kimi K3 は4.5/5で互角です。 予算重視なら Kimi K3 の勝ち:$15/1M outから始められるのに対し、Claude Opus 4.8 は$25/1M outからです。
項目別比較
強みと弱み
Claude Opus 4.8
- SWE-Bench Pro 69.2%(Opus 4.7は64.3%)、CursorBenchでは全エフォートレベルで歴代Opusを上回ります。大規模リファクタや複数ファイルにまたがるバグ調査での実地報告も好評です
- 自身が生成したコードの欠陥を指摘せずに見逃す確率がOpus 4.7の約4分の1。数学推論も大幅向上(USAMO 2026:96.7% vs 69.3%)です
- 1M tokensコンテキストと128K出力を据え置きの$5/$25で提供、長文コンテキスト割増なし。バッチAPIは50%オフ($2.50/$12.50)です
- fastモード(リサーチプレビュー)は最大2.5倍の出力速度を$10/$50で提供し、Opus 4.7のfastティア($30/$150)より3倍安価です
- エージェント向けの独自API機能:プロンプトキャッシュを保持する会話途中のシステムメッセージと、Claude Codeで並列サブエージェントを起動するDynamic Workflows
- ブラウザ自動化のOnline-Mind2Webで84%、Legal Agent Benchmarkで記録的スコア(all-passで10%を超えた初のモデル)。エンタープライズのナレッジワークも強力です(Boxの社内比較で87% vs 77%)
- ターン単位の後退報告:計画ドキュメント内の明白な指示の見落とし、目標の一部だけへの回答、単純なUIの一発生成では4.7より劣るとの声があります
- ヘビーユーザーから文体への批判:過剰なヘッジ、「大胆さやユーモアを削ってしまう」慎重すぎる編集(Steve Yegge)、十分な根拠のある主張にまで反論を繰り返すループ
- 言語混入の癖:長いリサーチスレッドで中国語、キリル文字、ギリシャ文字がランダムに混じるとの報告があります
- 公称1Mウィンドウにもかかわらず、実使用では約200K tokensを超えると品質低下が目に見えます
- Vending-Benchの後退:詐欺サプライヤーに引っかかる頻度が4.7の約30倍で、交渉も下手になりました(より厳格な正直さアライメントの副作用)
Kimi K3
- 発売時点でArtificial Analysis Intelligence Indexの第3位(スコア57)を獲得し、Claude Opus 4.8やGPT-5.5に匹敵する水準です。これは中国の研究機関が米国のクローズドなフロンティアモデルに最も近づいた事例といえます。
- Vals AIの独立評価環境によるSWE-bench Verifiedで93.4%を記録し(GPT-5.6 Solは96.2%、Claude Fable 5は95.0%)、Arena.aiのFrontend Code Arenaでは1679ポイントでFable 5を上回り第1位を獲得しました。
- GPQA Diamondでは93.5%を記録し(Fable 5の92.6%とGPT-5.6の94.1%の間)、AIME 2025では96.1%、GDPval-AA v2のエージェント作業評価ではEloレーティング1668でFable 5に次ぐ第2位となりました。
- エージェント性能に優れており、AutomationBench-AAのSaaSワークフロー評価で53%を記録し第1位となりました。Kimi Codeを通じた長時間のターミナル操作やリポジトリ探索にも対応し、K2と比べて出力トークン数が約21%少ないにもかかわらず知能は向上しています。
- 価格は100万トークンあたり3ドル/15ドルで(キャッシュヒット時の入力は0.30ドルまで下がります)、1Mトークンのコンテキスト全体で均一です。米国のクローズドなフロンティアモデルの価格よりも依然として大幅に安く、OpenAI互換APIを備え、OpenRouterでも利用できます。
- テキスト、画像、動画のネイティブなマルチモーダル入力に対応し、2026年7月27日にはModified MIT形式(想定)のライセンスでオープンウェイトの公開が予定されており、初の3兆パラメータ級オープンウェイト・フロンティアモデルとなる見込みです。
- Kimi K2.6(0.95ドル/4ドル)から3ドル/15ドルへと価格が3倍に上昇し、これまでにリリースされた中国製モデルの中で最も高価となり、Claude Sonnet 5の定価水準に達しています。「米国モデルより10倍安い」という時代は終わったといえ、Simon Willisonがこの値上げを詳しく記録しています。
- 速度は遅く、出力は秒間33トークンで、Artificial Analysisの190モデル中145位にとどまり、対話的な用途には不向きです。
- AA-Omniscienceにおける幻覚率はK2.6の39%から51%に上昇しました。これは以前なら回答を拒否していたであろう質問にも今回は答えを試みるようになったためです(Fable 5も同水準の54.9%です)。
- 中国語での機微な話題(習近平、中国共産党、天安門事件など)に対する政治的検閲が存在し、APIデータの管轄も北京にあるため、多くのEU企業や規制対応が必要な導入先ではコンプライアンス上の障壁となります。さらに英国のAISI/CAISIによるテストでは、サイバーセキュリティのガードレールがエクスプロイト開発の試みを阻止できなかったことも確認されています。
- 「オープンウェイト」とはいっても大半のユーザーにとっては理論上のものにすぎません。ネイティブMXFP4形式で約594GBあり、自前でホストするには複数GPUを備えたデータセンターが必要です。また本レビュー時点では、ウェイト本体と最終的なライセンスもまだ公開されていません。
あなたの審判を下す
1人につき各ツール1票。あなたの推薦が、みんなの見る観客スコアを動かします。
Claude Opus 4.8 へのアリーナの評決
Opus 4.7ユーザーにとってそのまま差し替えられるアップグレードです。API仕様と$5/$25の価格は同一のまま、長期のエージェント型コーディング、コードレビュー、エンタープライズ分析で実質的な向上が得られます。Claude Code、複数ファイルの移行、セキュリティ監査、多段階で検査・実行・検証するエージェントパイプラインを運用しているなら選んでください。一発のUIスニペット生成や4.7の挙動に厳密にチューニングされたプロンプトではユーザーが後退を報告しているため見送り、上限性能よりコストが重要ならSonnet 5($3/$15、2026年8月まで導入価格$2/$10)を選びましょう。ヘッジや慎重すぎる編集が気になるライターには、その文体がストレスになるかもしれません。
Kimi K3 へのアリーナの評決
Kimi K3は、フロンティアがもはや米国だけのものではないことを示す最も強力な証拠です。Artificial Analysisで第3位、GPQAとSWE-bench Verifiedでもトップクラスのスコアを記録し、フロントエンドコード分野のアリーナ評価では業界最高位を獲得しながら、価格は米国のクローズドなフロンティアモデルのおよそ2分の1から3分の1にとどまります。ベンチマークが特に強いエージェント型コーディング、フロントエンド作業、SaaS自動化には向いており、ウェイト公開後にフロンティア級モデルを自前でホストする計画があるチームにも適しています。一方、対話型プロダクト(秒間33トークンは遅い)、政治的に機微な内容やEUの厳格なデータ所在地要件が絡む用途(中国語での検閲、北京の管轄)、そしてAA-Omniscienceでの幻覚率51%が検証レイヤーを必要とする高精度な検索用途には向きません。コストを最優先するチームは、DeepSeek V4が依然としてドルあたりのトークン量で圧倒的に優れている点に注意すべきです。K3が訴求するのはドルあたりの最安値ではなく、ドルあたりのピーク性能です。
観客の声
Claude Opus 4.8 について
“Writing took a hit. It hedges everything and edits any bold or funny line out of my drafts. Also caught it answering a narrow slice of my planning doc and calling it done.”
“Threw USAMO-level math at it for a lark and it just grinds through. 96.7 vs 69 for 4.7 tracks with what I see. Same $5/$25, 1M context, no excuse not to switch.”
“Upgraded from 4.7 for a monorepo refactor and the difference is real. It actually flags its own sketchy code instead of shipping it. Multi-file bug hunts feel way less babysat.”
Kimi K3 について
“Tried it for our knowledge-base assistant and the hallucination rate is real: it confidently invented two API endpoints in one afternoon. 33 tokens per second on top of that. Back to waiting for the open weights to fine-tune.”
“Our Zapier-style automation stack runs on it now. Tool orchestration that GPT-5.5 fumbled works reliably, and the cache-hit pricing makes repeated workflows genuinely cheap.”
“The Frontend Arena ranking is deserved. Gave it the same dashboard spec I gave Fable 5 and K3's React came out cleaner, with fewer invented props. At $3/$15 through OpenRouter it was a drop-in swap.”
比較を続ける
よくある質問
Claude Opus 4.8 は Kimi K3 より優れていますか?
最適な選択は用途次第です。このページの項目別比較で、料金、主要スペック、アリーナ評価を分解しています。
Claude Opus 4.8 と Kimi K3、安いのはどちらですか?
Kimi K3 の方が安く、$15/1M outから始められます。Claude Opus 4.8 は$25/1M outからです。
Claude Opus 4.8 と Kimi K3 の100万トークンあたりの料金は?
Claude Opus 4.8:入力100万トークンあたり$5/1M in、出力100万トークンあたり$25/1M out。Kimi K3:入力100万トークンあたり$3/1M in、出力100万トークンあたり$15/1M out。