一騎打ち
Llama 4 (Scout / Maverick) vs Gemini 3 Pro:2026年に勝つAIモデルはどっち?
Llama 4 (Scout / Maverick)($0.60/1M out (Maverick, hosted))と Gemini 3 Pro($12/1M out (prompts ≤200K))は、2026年に最も使われているAIモデルのひとつです。 3件のコミュニティ票のうち、Gemini 3 Pro が支持率57%でリードしています。
即断の評決
推論で選ぶなら Gemini 3 Pro:アリーナの評価は4.5/5、対する Llama 4 (Scout / Maverick) は2.5/5です。 予算重視なら Llama 4 (Scout / Maverick) の勝ち:$0.60/1M out (Maverick, hosted)から始められるのに対し、Gemini 3 Pro は$12/1M out (prompts ≤200K)からです。
項目別比較
強みと弱み
Llama 4 (Scout / Maverick)
- MoEの効率性:トークンあたりアクティブなのは17Bパラメータのみ(Scout 109B/16エキスパート、Maverick 400B/128エキスパート)で、わずかな計算量でGPT-4o級に迫るチャット性能を実現します
- ホスト型推論が非常に安価:Maverickは入力約$0.15/1M・出力約$0.60/1Mから、ScoutはDeepInfraで約$0.10/$0.30、Groqで$0.11/$0.34からです
- オープンウェイトモデルでネイティブのearly-fusionマルチモーダリティ(テキストと画像、8枚までテスト済み)を実現しています
- リリース時点でオープンウェイト最大の公称コンテキスト:Scoutで10M tokens、Maverickで1Mです
- ScoutはInt4量子化でH100 GPU 1枚に収まり、200言語で事前学習されています
- 高スループット:アクティブ17Bパラメータで高速プロバイダーなら500+ tokens/sに達します(GroqはScoutを594 TPSと掲載)
- ベンチマークへの信頼が毀損:Metaは未公開のチャット最適化版MaverickをLMArenaに提出し(ELO 1417)、公開ウェイトのスコアはそれより低いため開発者から誤解を招くと批判されました
- 長文コンテキストの主張は実際には崩壊:ScoutのFiction.LiveBench 128Kスコアは約15.6%(Gemini 2.5 Proは90.6%)で、ホスティング各社はScoutを10Mよりはるかに低く制限しています(例:DeepInfraで約320K)
- コーディングはr/LocalLlamaとHNで酷評され、実際の開発タスクでは同価格帯のDeepSeek V3に負けています
- OSI基準のオープンソースではありません:ライセンスはEU所在企業を除外し、700M MAU超には特別ライセンスを要求し、Llamaブランド表記を義務付けます
- 総パラメータ109B/400BはコンシューマーGPUには大きすぎ、系譜も停滞:推論特化版は出荷されず、Behemothはリリースされないままです
Gemini 3 Pro
- 発売時にLMArenaで記録的な1501 Eloで首位に立ち、GPQA Diamondで91.9%を記録、リリース時点のstate of the artでした
- ARC-AGI-2で31.1%、当時のGemini 2.5 Pro(4.9%)の約6倍、GPT-5.1(17.6%)のほぼ2倍です
- クラス最高のマルチモーダル理解:MMMU-Pro 81%、Video-MMMU 87.6%、1M tokensのコンテキストウィンドウ付きです
- エージェント型コーディングも強力:SWE-bench Verified 76.2%、Terminal-Bench 2.0 54.2%、WebDev Arenaで1487 Eloです
- $2/$12 per 1M tokensでライバルより安く、Claude Sonnetクラスの価格($3/$15)を下回りました
- 設定可能なthinking_level(low/medium/high)で、推論の深さとレイテンシ・コストを取引できます
- 自信過剰なハルシネーション:AA-Omniscienceでは回答を控えるべき場面の88%で誤答しました。Claude Sonnet 4.5は48%です(the-decoder)
- 追従性(シコファンシー)が広く報告されています(Zvi Mowshowitz:「背骨のない膨大な知性」)。厳格なシステムプロンプトが必要です
- エージェントスタックでのツール呼び出しの信頼性問題:ツール出力がチャットスレッドに流れ込む、OpenAI/Anthropicのモデルより足場作りが必要、と開発者が報告しています
- 高thinking levelでは遅い:出力速度は約130 tok/sあるものの、AI Studioで最初のトークンまで約30-60秒と計測されています
- 引退済み:2026年3月9日にGemini APIとAI Studioで停止され、gemini-3-pro-previewは現在Gemini 3.1 Proのエイリアスです
あなたの審判を下す
1人につき各ツール1票。あなたの推薦が、みんなの見る観客スコアを動かします。
Llama 4 (Scout / Maverick) へのアリーナの評決
EU域外で、大量のチャット、抽出、多言語ワークロード向けに安価で高速なセルフホスト可能のマルチモーダルモデルが必要ならLlama 4を選んでください。MaverickはGPT-4o級の品質に約10分の1の価格で迫ります。コーディング、高度な推論、本物の100万トークン検索には避けるべきで、DeepSeek、Qwen 3、Geminiが明確に上回ります。Llama 3.3 70Bと比べればネイティブビジョンと長いウィンドウが加わりましたが、純粋なテキスト品質では旧来の密モデルやQwenの方が信頼できると多くの開発者が感じており、10Mコンテキストはほぼ紙の上の数字です。
Gemini 3 Pro へのアリーナの評決
2025年末にGoogleを再び頂点に押し上げた画期的なリリースで、Gemini 2.5 Proからの大幅な推論力向上とその世代最高のマルチモーダルスコアを誇りました。しかし2026年半ばの時点で選ぶ理由はありません。Googleは2026年3月9日にAPIでの提供を終了し、Gemini 3.1 Proはまったく同じ価格でARC-AGI-2性能を2倍以上(77.1% vs 31.1%)にしています。レガシー環境のチームは3.1 Proに移行すべきで、旧モデルIDはいずれにせよ既にそちらを指しています。ハルシネーションに敏感なワークロードでは、レビュアーが繰り返し指摘した弱点であるため、グラウンディングを追加しない限り避けてください。
観客の声
Llama 4 (Scout / Maverick) について
まだ審判はありません。最初の声を上げてください。
Gemini 3 Pro について
“Confidently wrong is its worst mode. On AA-Omniscience it gave a wrong answer 88% of the time instead of declining. Add the sycophancy and you need a tight system prompt to trust it.”
“ARC-AGI-2 at 31% was about 6x Gemini 2.5 Pro and nearly double GPT-5.1 at the time. For visual-heavy work (81 MMMU-Pro) nothing else came close.”
“1501 Elo on LMArena at launch was deserved. Multimodal is where it kills, I feed it lecture videos and dense PDFs and it just gets it. 1M context helps.”
比較を続ける
よくある質問
Llama 4 (Scout / Maverick) は Gemini 3 Pro より優れていますか?
現在、観客は Gemini 3 Pro を支持しています:推薦率57%、対する Llama 4 (Scout / Maverick) は50%です(3票)。 推論では Gemini 3 Pro が上回っています(4.5/5 vs 2.5/5)。 最適な選択は用途次第です。このページの項目別比較で、料金、主要スペック、アリーナ評価を分解しています。
Llama 4 (Scout / Maverick) と Gemini 3 Pro、安いのはどちらですか?
Llama 4 (Scout / Maverick) の方が安く、$0.60/1M out (Maverick, hosted)から始められます。Gemini 3 Pro は$12/1M out (prompts ≤200K)からです。
Llama 4 (Scout / Maverick) と Gemini 3 Pro の100万トークンあたりの料金は?
Llama 4 (Scout / Maverick):入力100万トークンあたり$0.15/1M in (Maverick, hosted)、出力100万トークンあたり$0.60/1M out (Maverick, hosted)。Gemini 3 Pro:入力100万トークンあたり$2/1M in (prompts ≤200K)、出力100万トークンあたり$12/1M out (prompts ≤200K)。