業界ニュース

DeepSeek V4 vs Claude Opus 4.8:$0.87のモデルはエージェントコーディングで競争できるか?

DeepSeek V4はClaude Opus 4.8より出力トークンあたり28.7倍安い。両者とも57%の支持率。本当のトレードオフ:tool-callの信頼性 vs 価格。データが示すもの。

7 min readBy The Arena Editor
#deepseek#claude#エージェントコーディング#llm比較#ai価格
エージェントコーディング向けの2つのAI言語モデルの抽象的比較

Some links are partner links: if you subscribe through them, we may earn a commission, at no extra cost to you. The crowd verdicts stay independent.

DeepSeek V4 vs Claude Opus 4.8は、今日のエージェントコーディング空間で最も明確な価格対信頼性のトレードオフを表している。DeepSeekのオープンウェイトモデルは100万出力トークンあたり$0.87を請求し、Anthropicのフラッグシップは$25を請求する。この28.7倍の差は単純な疑問を投げかける:より安いモデルは実際にエージェントで機能するのか?

短い答え

DeepSeek V4はcrowdの支持でOpus 4.8と同等(両者57%)で、SWE-bench Verified(80.6% vs 69.2%)では上回るが、持続的なtool-callバグが本番エージェントにはリスクとなる。予算制約のあるコーディングタスクにはDeepSeekを選択し、ミッションクリティカルなマルチターンパイプラインにはOpusを選択する。

直接対決:重要な数字

両モデルは同じユースケースをターゲットにしている:大規模コードベースで計画、編集、テスト、反復を行う自律型コーディングエージェント。GLAD-AI-TORのcrowdは両者を同一に評価(57%が推奨)。ベンチマークは分岐する。

指標DeepSeek V4Claude Opus 4.8
出力価格$0.87/1Mトークン$25/1Mトークン
入力価格$0.435/1M(キャッシュ$0.003625)$5/1M(キャッシュ$0.50)
crowdスコア57%推奨57%推奨
SWE-bench Verified80.6%69.2%(SWE-Bench Pro)
コンテキストウィンドウ1Mトークン1Mトークン
最大出力384Kトークン128Kトークン
オープンウェイトMITライセンスなし
モダリティテキストのみテキスト + 画像

DeepSeekは価格、コンテキスト、ベンチマークで勝利。Opusは画像サポートとエコシステムの洗練で勝利。しかし、本当の差別化要因は信頼性である。

DeepSeek V4が壊れる場所

DeepSeekのtool-call実装には、エージェントにとって重要な文書化されたバグがある:

  1. 不正なtool-call:関数呼び出しがtool_callsフィールドではなくcontentフィールドにプレーンテキストとして表示されることがある(GitHub issue deepseek-ai #1244)。構造化レスポンスを期待するエージェントフレームワークは静かに失敗する。

  2. thinkingモード + 長いチェーン:thinkingモードを有効にすると、400エラーでマルチターンtool-callチェーンが壊れる(OpenClaw issue #72044)。修正は未完成のまま。

  3. 幻覚API:開発者はDeepSeekがカスタムコードベースに存在しないメソッドを作り上げ、エージェントループで幻覚のユーザー入力に基づいて行動すると報告している。

これらはエッジケースではない。複数のtool-callを持つ本番エージェントを実行する人なら誰でも遭遇する。80.6%のSWE-benchスコアは制御されたベンチマークからのものであり、実際のエージェント信頼性は低い。

DeepSeek-V4

Open-weights 1.6T MoE with 1M-token context and near-frontier agentic coding at $0.87 per 1M output tokens

$1/mo57%(3)

Partner link. The crowd verdicts stay independent.

Claude Opus 4.8がプレミアムを正当化する場所

Opus 4.8は明示的に長期エージェントをターゲットにしている。Anthropicのリリースノートは以下を強調:

  • 4倍少ないフラグなしエラー:モデルは自身の生成コードの欠陥をOpus 4.7よりはるかに頻繁に検出する。
  • 会話中のシステムメッセージ:プロンプトキャッシュを壊さずにシステムプロンプトを注入するAPIサポート。エージェントは実行中に動作を再調整できる。
  • Dynamic Workflows:Claude Codeは並列サブエージェントをスポーンできる。大規模リファクタリングでは、これにより実時間が大幅に短縮される。

トレードオフ:Opusは出力トークンあたり28.7倍高い。大量ワークロード(1日数百万トークン)では、この差は急速に積み上がる。バッチAPI価格($2.50/$12.50)は助けになるが、DeepSeekのベースレートはまだOpusバッチの10分の1。

Opusにも回帰がある。ユーザーは計画文書での指示の見落とし、4.7より悪いワンショットUI生成、「過度に慎重」で「躊躇する」と表現される文体を報告している。言語混在(ランダムな中国語やキリル文字の挿入)は長い研究スレッドに現れる。広告された1Mウィンドウにもかかわらず、コンテキスト品質は200Kトークンを超えると劣化する。

Claude Opus 4.8

Anthropic's flagship Opus-tier model for long-horizon agentic coding; 1M context at $5/$25 per 1M tokens.

$25/mo57%(3)

Partner link. The crowd verdicts stay independent.

コストモデリング:DeepSeekが合理的な場合

タスクごとに500K入力トークンを処理し50K出力トークンを生成するコーディングエージェントを想定。

モデル入力コスト出力コストタスクあたり合計
DeepSeek V4$0.22$0.04$0.26
DeepSeek V4(キャッシュ)$0.002$0.04$0.04
Claude Opus 4.8$2.50$1.25$3.75
Claude Opus 4.8(バッチ)$1.25$0.63$1.88

DeepSeekはベースレートで14倍安く、キャッシュヒットで47倍安い。1日数百タスクを実行するチームにとって、節約額はエンジニアの給与全額を賄う。

落とし穴:tool-call失敗が時間の5%でも人間の介入を必要とする場合、労働コストがモデルの節約を消し去る。コミットする前に実際の失敗率を計算すること。

セルフホスティングが計算を変える

DeepSeek V4のMITライセンスはセルフホスティング、ファインチューニング、再配布を許可する。1.6T MoEアーキテクチャはハイエンドマルチGPUセットアップで動作する。既存インフラを持つ組織にとって、これはハードウェア投資後のトークンあたりコストを完全に排除する。

Claude Opusにはオープンウェイトオプションがない。API依存は永続的。

これが重要な場合:

  • データ居住要件のある企業(トークンがネットワークを離れない)
  • ドメイン固有コードベース用のカスタムファインチューンが必要なチーム
  • モデル動作を反復する研究グループ

判定

  • DeepSeek V4を選択:予算制約のあるコーディング自動化、セルフホストデプロイメント、時折のtool-call失敗が許容できるワークロード向け。80.6%のSWE-benchスコアと$0.87の出力価格は、粗さを許容できるならエージェントコーディングで最高の価値を提供する。

  • Claude Opus 4.8を選択:コストより信頼性が重要な本番エージェント向け。28.7倍のプレミアムは、よりクリーンなtool-call処理、より良い自己修正、Anthropicのエンタープライズサポートを購入する。

  • 代替案を検討:どちらも合わない場合。Gemini 3 Proは中間を提供。Claude Sonnet 5は$3/$15(2026年8月までイントロ$2/$10)で、Opusの8分の1のコストと引き換えに能力の一部を交換。

crowdは均等に分かれている(両方で57%)。データはなぜかを示唆:各モデルは自身のドメインで決定的に勝利している。

完全ランキング:LLMモデルHall of Fame。詳細比較:DeepSeek V4 vs Claude Opus 4.8

Keep exploring

Every claim above is backed by the arena's live data: crowd votes, verified pricing, honest pros & cons.

More from the arena journal