一騎打ち

Llama 4 (Scout / Maverick) のロゴvsClaude Sonnet 5 のロゴ

Llama 4 (Scout / Maverick) vs Claude Sonnet 5:2026年に勝つAIモデルはどっち?

Llama 4 (Scout / Maverick)($0.60/1M out (Maverick, hosted))と Claude Sonnet 5($15/1M out ($10 intro until 2026-08-31))は、2026年に最も使われているAIモデルのひとつです。 3件のコミュニティ票のうち、Claude Sonnet 5 が支持率57%でリードしています。

即断の評決

推論で選ぶなら Claude Sonnet 5:アリーナの評価は4.5/5、対する Llama 4 (Scout / Maverick) は2.5/5です。 予算重視なら Llama 4 (Scout / Maverick) の勝ち:$0.60/1M out (Maverick, hosted)から始められるのに対し、Claude Sonnet 5 は$15/1M out ($10 intro until 2026-08-31)からです。

項目別比較

最低価格
$0.60/1M out (Maverick, hosted)Meta純正の有料APIはなく、Maverickの一般的なサードパーティホスティング料金を掲載しています(ScoutはDeepInfraで約$0.10/$0.30 per 1Mから、Groqで$0.11/$0.34)。ホスト版Scoutのコンテキストは公称10Mよりはるかに低く制限されています(例:DeepInfraで約320K)。
$15/1M out ($10 intro until 2026-08-31)単一ティア:標準$3/$15 per 1M tokens、2026年8月31日まで導入価格$2/$10。Batch APIは-50%。新トークナイザーはテキストあたり約30%多くのtokensを生成し(Anthropicによると1.0-1.35x)、実質コストが上がります。
プロバイダー
Meta
Anthropic
コンテキストウィンドウ
10M tokens (Scout) / 1M (Maverick)
1M tokens (128K max output)
入力料金
$0.15/1M in (Maverick, hosted)
$3/1M in ($2 intro until 2026-08-31)
出力料金
$0.60/1M out (Maverick, hosted)
$15/1M out ($10 intro until 2026-08-31)
モダリティ
text, vision (image input)
text, vision (image input, text output)
オープンウェイト
あり
なし
観客スコア
50%(0)
57%(3)
アリーナ評価(1-5)
推論
2.5
4.5
コーディング
2.0
4.5
ライティング
2.5
4.5
速度
4.5
4.0
コスパ
3.5
4.5

強みと弱み

Llama 4 (Scout / Maverick)

  • MoEの効率性:トークンあたりアクティブなのは17Bパラメータのみ(Scout 109B/16エキスパート、Maverick 400B/128エキスパート)で、わずかな計算量でGPT-4o級に迫るチャット性能を実現します
  • ホスト型推論が非常に安価:Maverickは入力約$0.15/1M・出力約$0.60/1Mから、ScoutはDeepInfraで約$0.10/$0.30、Groqで$0.11/$0.34からです
  • オープンウェイトモデルでネイティブのearly-fusionマルチモーダリティ(テキストと画像、8枚までテスト済み)を実現しています
  • リリース時点でオープンウェイト最大の公称コンテキスト:Scoutで10M tokens、Maverickで1Mです
  • ScoutはInt4量子化でH100 GPU 1枚に収まり、200言語で事前学習されています
  • 高スループット:アクティブ17Bパラメータで高速プロバイダーなら500+ tokens/sに達します(GroqはScoutを594 TPSと掲載)
  • ベンチマークへの信頼が毀損:Metaは未公開のチャット最適化版MaverickをLMArenaに提出し(ELO 1417)、公開ウェイトのスコアはそれより低いため開発者から誤解を招くと批判されました
  • 長文コンテキストの主張は実際には崩壊:ScoutのFiction.LiveBench 128Kスコアは約15.6%(Gemini 2.5 Proは90.6%)で、ホスティング各社はScoutを10Mよりはるかに低く制限しています(例:DeepInfraで約320K)
  • コーディングはr/LocalLlamaとHNで酷評され、実際の開発タスクでは同価格帯のDeepSeek V3に負けています
  • OSI基準のオープンソースではありません:ライセンスはEU所在企業を除外し、700M MAU超には特別ライセンスを要求し、Llamaブランド表記を義務付けます
  • 総パラメータ109B/400BはコンシューマーGPUには大きすぎ、系譜も停滞:推論特化版は出荷されず、Behemothはリリースされないままです

Claude Sonnet 5

  • Sonnet 4.6からエージェント性能が大幅向上:Terminal-Bench 2.1が80.4% vs 67.0%、OSWorld-Verifiedが81.2% vs 78.5%、SWE-bench Proが63.2% vs 58.1%です
  • ナレッジワークでOpus 4.8と互角(GDPval-AA v2:1,618 vs 1,615)、ツールありのHumanity's Last Examでもほぼ同点(57.4% vs 57.9%)。それをOpus 4.8の60%の価格(導入期間中は40%)で実現します
  • 1M tokensのコンテキストウィンドウと128Kの最大出力。2026年8月31日まで$2/$10 per 1M tokensの導入価格です
  • 粘り強い自己検証型のエージェント挙動:実地レビューでは、Sonnet 4.6と違って自分のコードをテストし、難問を解けるまで反復すると評されています
  • xhighエフォートレベルと高解像度ビジョン(2576px画像)を備えた初のSonnetで、適応思考はデフォルトで有効です
  • コードレビューの精度がSonnet 4.6より高く(38-40% vs 29%)、誤検知の指摘が少なくなっています
  • 新トークナイザーにより同じテキストのトークン数が約30%増加し(Anthropicによると1.0-1.35x、Simon Willisonの計測で英語約1.4x、Python約1.28x)、表示価格は据え置きでも実質コストが上がります
  • 冗長でトークン消費が多い:独立テストではタスクあたり約$2.29(Sonnet 4.6は約$1.20)で、コスト効率は161モデル中101位。高エフォートではタスク単価がOpus 4.8を超えることもあります
  • 小さな定型編集ではSonnet 4.6より明らかに遅く、単純なタスクを過剰設計しがちです(CodeRabbitの実地レビュー)
  • サンプリングパラメータ(temperature、top_p、top_k)が廃止され、デフォルト以外の値は400エラーを返すため、既存パイプラインが壊れます
  • HN/Redditでの発売時の評判は賛否両論:「5」というラベルは誇大と受け止められ、厳格化されたサイバーセキュリティ保護機能が無害なセキュリティ関連作業を拒否することがあります

あなたの審判を下す

1人につき各ツール1票。あなたの推薦が、みんなの見る観客スコアを動かします。

Llama 4 (Scout / Maverick)$0.60/1M out (Maverick, hosted)
50%観客スコア · 0
Claude Sonnet 5$15/1M out ($10 intro until 2026-08-31)
57%観客スコア · 3

Llama 4 (Scout / Maverick) へのアリーナの評決

EU域外で、大量のチャット、抽出、多言語ワークロード向けに安価で高速なセルフホスト可能のマルチモーダルモデルが必要ならLlama 4を選んでください。MaverickはGPT-4o級の品質に約10分の1の価格で迫ります。コーディング、高度な推論、本物の100万トークン検索には避けるべきで、DeepSeek、Qwen 3、Geminiが明確に上回ります。Llama 3.3 70Bと比べればネイティブビジョンと長いウィンドウが加わりましたが、純粋なテキスト品質では旧来の密モデルやQwenの方が信頼できると多くの開発者が感じており、10Mコンテキストはほぼ紙の上の数字です。

Claude Sonnet 5 へのアリーナの評決

コーディング、ターミナル、コンピュータ操作のエージェントを運用していて、Opus 4.8に迫る品質をSonnet価格で求めるならSonnet 5を選んでください。特に$2/$10の導入期間中は狙い目で、低・中エフォートではSonnet 4.6から純粋なアップグレードです。ただし新トークナイザーと冗長さは予算に織り込むこと:実際のタスク単価はSonnet 4.6を大きく上回り、最高エフォートレベルでは解決タスクあたりのコストでOpus 4.8の方が得になることもあります。レイテンシ重視の小さな編集や、temperatureとtop_pに依存するパイプライン(現在はエラーになります)には避けてください。大量の小差分ワークロードには、Sonnet 4.6が依然として実利的な選択です。

観客の声

Llama 4 (Scout / Maverick) について

まだ審判はありません。最初の声を上げてください。

Claude Sonnet 5 について

解約隊長

Cheap per token, pricey per task. Independent tests had it near $2.29 a task vs $1.20 on 4.6, and at high effort it can out-cost Opus 4.8. It will not stop talking.

黄金の親指クス

Terminal-Bench going 67 to 80 over Sonnet 4.6 matches what I see. My CI-fix agent went from constant babysitting to mostly hands-off overnight.

聖デプロイウス

Matches Opus 4.8 on knowledge work at 60% of the price, and the intro $2/$10 window makes it silly value. My research agent runs on Sonnet 5 now, zero regrets.

よくある質問

Llama 4 (Scout / Maverick) は Claude Sonnet 5 より優れていますか?

現在、観客は Claude Sonnet 5 を支持しています:推薦率57%、対する Llama 4 (Scout / Maverick) は50%です(3票)。 推論では Claude Sonnet 5 が上回っています(4.5/5 vs 2.5/5)。 最適な選択は用途次第です。このページの項目別比較で、料金、主要スペック、アリーナ評価を分解しています。

Llama 4 (Scout / Maverick) と Claude Sonnet 5、安いのはどちらですか?

Llama 4 (Scout / Maverick) の方が安く、$0.60/1M out (Maverick, hosted)から始められます。Claude Sonnet 5 は$15/1M out ($10 intro until 2026-08-31)からです。

Llama 4 (Scout / Maverick) と Claude Sonnet 5 の100万トークンあたりの料金は?

Llama 4 (Scout / Maverick):入力100万トークンあたり$0.15/1M in (Maverick, hosted)、出力100万トークンあたり$0.60/1M out (Maverick, hosted)。Claude Sonnet 5:入力100万トークンあたり$3/1M in ($2 intro until 2026-08-31)、出力100万トークンあたり$15/1M out ($10 intro until 2026-08-31)。