一騎打ち
Kimi K3 vs Claude Opus 4.7:2026年に勝つAIモデルはどっち?
Kimi K3($15/1M out)と Claude Opus 4.7($25/1M out)は、2026年に最も使われているAIモデルのひとつです。 6件のコミュニティ票のうち、Kimi K3 が支持率57%でリードしています。
即断の評決
推論では、Kimi K3 と Claude Opus 4.7 は4.5/5で互角です。 予算重視なら Kimi K3 の勝ち:$15/1M outから始められるのに対し、Claude Opus 4.7 は$25/1M outからです。
項目別比較
強みと弱み
Kimi K3
- 発売時点でArtificial Analysis Intelligence Indexの第3位(スコア57)を獲得し、Claude Opus 4.8やGPT-5.5に匹敵する水準です。これは中国の研究機関が米国のクローズドなフロンティアモデルに最も近づいた事例といえます。
- Vals AIの独立評価環境によるSWE-bench Verifiedで93.4%を記録し(GPT-5.6 Solは96.2%、Claude Fable 5は95.0%)、Arena.aiのFrontend Code Arenaでは1679ポイントでFable 5を上回り第1位を獲得しました。
- GPQA Diamondでは93.5%を記録し(Fable 5の92.6%とGPT-5.6の94.1%の間)、AIME 2025では96.1%、GDPval-AA v2のエージェント作業評価ではEloレーティング1668でFable 5に次ぐ第2位となりました。
- エージェント性能に優れており、AutomationBench-AAのSaaSワークフロー評価で53%を記録し第1位となりました。Kimi Codeを通じた長時間のターミナル操作やリポジトリ探索にも対応し、K2と比べて出力トークン数が約21%少ないにもかかわらず知能は向上しています。
- 価格は100万トークンあたり3ドル/15ドルで(キャッシュヒット時の入力は0.30ドルまで下がります)、1Mトークンのコンテキスト全体で均一です。米国のクローズドなフロンティアモデルの価格よりも依然として大幅に安く、OpenAI互換APIを備え、OpenRouterでも利用できます。
- テキスト、画像、動画のネイティブなマルチモーダル入力に対応し、2026年7月27日にはModified MIT形式(想定)のライセンスでオープンウェイトの公開が予定されており、初の3兆パラメータ級オープンウェイト・フロンティアモデルとなる見込みです。
- Kimi K2.6(0.95ドル/4ドル)から3ドル/15ドルへと価格が3倍に上昇し、これまでにリリースされた中国製モデルの中で最も高価となり、Claude Sonnet 5の定価水準に達しています。「米国モデルより10倍安い」という時代は終わったといえ、Simon Willisonがこの値上げを詳しく記録しています。
- 速度は遅く、出力は秒間33トークンで、Artificial Analysisの190モデル中145位にとどまり、対話的な用途には不向きです。
- AA-Omniscienceにおける幻覚率はK2.6の39%から51%に上昇しました。これは以前なら回答を拒否していたであろう質問にも今回は答えを試みるようになったためです(Fable 5も同水準の54.9%です)。
- 中国語での機微な話題(習近平、中国共産党、天安門事件など)に対する政治的検閲が存在し、APIデータの管轄も北京にあるため、多くのEU企業や規制対応が必要な導入先ではコンプライアンス上の障壁となります。さらに英国のAISI/CAISIによるテストでは、サイバーセキュリティのガードレールがエクスプロイト開発の試みを阻止できなかったことも確認されています。
- 「オープンウェイト」とはいっても大半のユーザーにとっては理論上のものにすぎません。ネイティブMXFP4形式で約594GBあり、自前でホストするには複数GPUを備えたデータセンターが必要です。また本レビュー時点では、ウェイト本体と最終的なライセンスもまだ公開されていません。
Claude Opus 4.7
- 発売時にSWE-bench Verified 87.6%(Opus 4.6の80.8%から向上)とSWE-bench Pro 64.3%を記録し、GPT-5.4(57.7%)とGemini 3.1 Pro(54.2%)をリードしました
- 1M tokensのコンテキストウィンドウと128Kの最大出力を、長文コンテキスト割増なしの一律$5/$25で提供(Batch APIベータ経由で300K出力)
- 高解像度ビジョンを備えた初のClaude:長辺2576pxまでの画像をピクセル精度の座標で受け付け、従来比約3倍の精細さです
- コードレビューが傑出:独立テストでライバルより強力なファイル横断推論で実在バグを多く発見し、ドキュメント推論エラーはOpus 4.6比21%減です
- 新しいxhighエフォートレベルとTask Budgets(ベータ)による細かなコスト制御:低エフォートの4.7は中エフォートの4.6の出力品質にほぼ匹敵します
- 知識が新しい:リリース時点でどのClaudeモデルよりも新しい、2026年1月の確実なカットオフです
- 新トークナイザーにより同じテキストのトークン数が4.7以前のモデル比で約30%増加し(Anthropic自身のドキュメントによる)、表示価格は据え置きでも実質的なリクエスト単価が上がります
- エージェント用途では非常に冗長:あるベンチマークでは同等のコーディングタスクでGPT-5.5の出力tokensが72%少なく、レビュアーはそのナレーションを過剰と評しています
- 移行者を悩ませる破壊的なAPI変更:temperature/top_p/top_kとthinkingのbudget_tokensは400エラーを返すようになり、思考テキストはデフォルトで非表示です
- レイテンシは中程度で、高エフォートでは1ターンに数分かかることも。fastモードはプレミアムなリサーチプレビューで、4.7では既に非推奨です
- 約3か月で同じ$5/$25のOpus 4.8に抜かれ、リアルタイムのサイバーセキュリティ保護機能が正当なセキュリティ業務に誤検知することがあります
あなたの審判を下す
1人につき各ツール1票。あなたの推薦が、みんなの見る観客スコアを動かします。
Kimi K3 へのアリーナの評決
Kimi K3は、フロンティアがもはや米国だけのものではないことを示す最も強力な証拠です。Artificial Analysisで第3位、GPQAとSWE-bench Verifiedでもトップクラスのスコアを記録し、フロントエンドコード分野のアリーナ評価では業界最高位を獲得しながら、価格は米国のクローズドなフロンティアモデルのおよそ2分の1から3分の1にとどまります。ベンチマークが特に強いエージェント型コーディング、フロントエンド作業、SaaS自動化には向いており、ウェイト公開後にフロンティア級モデルを自前でホストする計画があるチームにも適しています。一方、対話型プロダクト(秒間33トークンは遅い)、政治的に機微な内容やEUの厳格なデータ所在地要件が絡む用途(中国語での検閲、北京の管轄)、そしてAA-Omniscienceでの幻覚率51%が検証レイヤーを必要とする高精度な検索用途には向きません。コストを最優先するチームは、DeepSeek V4が依然としてドルあたりのトークン量で圧倒的に優れている点に注意すべきです。K3が訴求するのはドルあたりの最安値ではなく、ドルあたりのピーク性能です。
Claude Opus 4.7 へのアリーナの評決
Opus 4.7を選ぶべきなのは、再現性のために既にこのモデルに固定している場合だけです。Opus 4.8は同じ$5/$25でAPI仕様も同一のまま性能で上回るため、新規プロジェクトのデフォルトとしてはそちらが適切です。エージェント型コーディング、コードレビュー、1Mコンテキストのドキュメント作業では依然として非常に強力で、Opus 4.6からは明確なアップグレードです。4.6から移行するチームは、破壊的なAPI変更と、プロンプトあたり約30%多くのトークンを生むトークナイザーを予算に織り込んでください。コスト重視のユーザーは、Opusに迫る品質を$3/$15(2026年8月31日まで導入価格$2/$10)で提供するSonnet 5を検討すべきです。
観客の声
Kimi K3 について
“Tried it for our knowledge-base assistant and the hallucination rate is real: it confidently invented two API endpoints in one afternoon. 33 tokens per second on top of that. Back to waiting for the open weights to fine-tune.”
“Our Zapier-style automation stack runs on it now. Tool orchestration that GPT-5.5 fumbled works reliably, and the cache-hit pricing makes repeated workflows genuinely cheap.”
“The Frontend Arena ranking is deserved. Gave it the same dashboard spec I gave Fable 5 and K3's React came out cleaner, with fewer invented props. At $3/$15 through OpenRouter it was a drop-in swap.”
Claude Opus 4.7 について
“Watch your invoices. New tokenizer counts ~30% more tokens for the same text, and it narrates every tiny step. Sticker price unchanged, effective cost definitely not.”
“Came from 4.6 and stopped chunking repos entirely. 1M context, 128K output, flat $5/$25 with no long-context premium. That pricing decision alone won me over.”
“87.6 SWE-bench Verified is not just marketing, it closes tickets GPT-5.4 fumbles. And the hi-res vision with pixel-accurate coords finally makes screenshot debugging useful.”
比較を続ける
よくある質問
Kimi K3 は Claude Opus 4.7 より優れていますか?
最適な選択は用途次第です。このページの項目別比較で、料金、主要スペック、アリーナ評価を分解しています。
Kimi K3 と Claude Opus 4.7、安いのはどちらですか?
Kimi K3 の方が安く、$15/1M outから始められます。Claude Opus 4.7 は$25/1M outからです。
Kimi K3 と Claude Opus 4.7 の100万トークンあたりの料金は?
Kimi K3:入力100万トークンあたり$3/1M in、出力100万トークンあたり$15/1M out。Claude Opus 4.7:入力100万トークンあたり$5/1M in、出力100万トークンあたり$25/1M out。