一騎打ち
GPT-5.2 vs Gemini 3 Pro:2026年に勝つAIモデルはどっち?
GPT-5.2($14/1M out)と Gemini 3 Pro($12/1M out (prompts ≤200K))は、2026年に最も使われているAIモデルのひとつです。 5件のコミュニティ票のうち、Gemini 3 Pro が支持率57%でリードしています。
即断の評決
推論で選ぶなら Gemini 3 Pro:アリーナの評価は4.5/5、対する GPT-5.2 は4/5です。 予算重視なら Gemini 3 Pro の勝ち:$12/1M out (prompts ≤200K)から始められるのに対し、GPT-5.2 は$14/1M outからです。
項目別比較
強みと弱み
GPT-5.2
- 発売時にSWE-bench Verified 80.0%とSWE-Bench Pro 55.6%を記録、Claude Opus 4.5(80.9%)とほぼ互角です
- GDPval:比較の70.9%で人間のプロフェッショナルと同等以上、GPT-5.1の38.8%のほぼ2倍です
- 科学と数学に強い:GPQA Diamond 92.4%(Thinking、Proは93.2%)とFrontierMath 40.3%で、リリース時点のstate of the artでした
- 400Kコンテキストで、256K tokensまでMRCR v2の長文検索がほぼ完璧です
- GPT-5.1比でハルシネーションが30%減(実際のChatGPTクエリでのエラー率が8.8%から6.2%に低下)
- 後継より安価:$1.75/$14 per 1Mで、GPT-5.4の$2.50/$15、GPT-5.5の$5/$30に対して割安です
- 速度がコミュニティ最大の不満:ChatGPTでの拡張思考は約4 tokens/sまで落ちるとの報告があり、Proは非常に長く考えた末に失敗することもあります
- 看板のベンチマークスコアはxhigh推論エフォートで取得されたもので、デフォルト設定よりはるかに多くのトークンと時間を消費します
- GPT-5.1からの人格の後退が広く批判されました:Redditユーザーは「企業的すぎ、安全すぎ」「チャットとライティングでは一歩後退」と評しています
- コーディングは直接対決のElo比較でAnthropic系に後れます(後のOpus 4.7分析では144 Eloの差)。音声モダリティなし、ファインチューニング不可です
- 2026年半ば時点で既に旧世代:OpenAIはGPT-5.5を推奨し、GPT-5.2はメインのAPI価格ページに載っていません
Gemini 3 Pro
- 発売時にLMArenaで記録的な1501 Eloで首位に立ち、GPQA Diamondで91.9%を記録、リリース時点のstate of the artでした
- ARC-AGI-2で31.1%、当時のGemini 2.5 Pro(4.9%)の約6倍、GPT-5.1(17.6%)のほぼ2倍です
- クラス最高のマルチモーダル理解:MMMU-Pro 81%、Video-MMMU 87.6%、1M tokensのコンテキストウィンドウ付きです
- エージェント型コーディングも強力:SWE-bench Verified 76.2%、Terminal-Bench 2.0 54.2%、WebDev Arenaで1487 Eloです
- $2/$12 per 1M tokensでライバルより安く、Claude Sonnetクラスの価格($3/$15)を下回りました
- 設定可能なthinking_level(low/medium/high)で、推論の深さとレイテンシ・コストを取引できます
- 自信過剰なハルシネーション:AA-Omniscienceでは回答を控えるべき場面の88%で誤答しました。Claude Sonnet 4.5は48%です(the-decoder)
- 追従性(シコファンシー)が広く報告されています(Zvi Mowshowitz:「背骨のない膨大な知性」)。厳格なシステムプロンプトが必要です
- エージェントスタックでのツール呼び出しの信頼性問題:ツール出力がチャットスレッドに流れ込む、OpenAI/Anthropicのモデルより足場作りが必要、と開発者が報告しています
- 高thinking levelでは遅い:出力速度は約130 tok/sあるものの、AI Studioで最初のトークンまで約30-60秒と計測されています
- 引退済み:2026年3月9日にGemini APIとAI Studioで停止され、gemini-3-pro-previewは現在Gemini 3.1 Proのエイリアスです
あなたの審判を下す
1人につき各ツール1票。あなたの推薦が、みんなの見る観客スコアを動かします。
GPT-5.2 へのアリーナの評決
重い推論、長文コンテキスト、エージェント作業ならGPT-5.1よりGPT-5.2を選んでください。GDPvalの勝率はGPT-5.1のほぼ2倍、ハルシネーションは30%減、400Kコンテキストも安定して扱えます。2026年半ばでは主にコスパ狙いの選択肢で、GPT-5.5の$5/$30に対し$1.75/$14でほとんどの業務タスクをこなせます。レイテンシ重視のチャットやクリエイティブライティングには不向きで、ユーザーはGPT-5.1より遅く平板だと感じています。OpenAIの現行フロンティアが欲しいチームは、素直にGPT-5.5に投資すべきです。
Gemini 3 Pro へのアリーナの評決
2025年末にGoogleを再び頂点に押し上げた画期的なリリースで、Gemini 2.5 Proからの大幅な推論力向上とその世代最高のマルチモーダルスコアを誇りました。しかし2026年半ばの時点で選ぶ理由はありません。Googleは2026年3月9日にAPIでの提供を終了し、Gemini 3.1 Proはまったく同じ価格でARC-AGI-2性能を2倍以上(77.1% vs 31.1%)にしています。レガシー環境のチームは3.1 Proに移行すべきで、旧モデルIDはいずれにせよ既にそちらを指しています。ハルシネーションに敏感なワークロードでは、レビュアーが繰り返し指摘した弱点であるため、グラウンディングを追加しない限り避けてください。
観客の声
GPT-5.2 について
“The thinking speed is brutal, I clocked something like 4 tok/s in ChatGPT on extended thinking. Pro will grind for ages and still whiff. Great scores, painful to actually use.”
“GDPval numbers are wild, it ties or beats human pros in 71% of comparisons. For science and math work (92.4 GPQA Diamond) it earned a spot in my stack.”
Gemini 3 Pro について
“Confidently wrong is its worst mode. On AA-Omniscience it gave a wrong answer 88% of the time instead of declining. Add the sycophancy and you need a tight system prompt to trust it.”
“ARC-AGI-2 at 31% was about 6x Gemini 2.5 Pro and nearly double GPT-5.1 at the time. For visual-heavy work (81 MMMU-Pro) nothing else came close.”
“1501 Elo on LMArena at launch was deserved. Multimodal is where it kills, I feed it lecture videos and dense PDFs and it just gets it. 1M context helps.”
比較を続ける
よくある質問
GPT-5.2 は Gemini 3 Pro より優れていますか?
現在、観客は Gemini 3 Pro を支持しています:推薦率57%、対する GPT-5.2 は50%です(5票)。 推論では Gemini 3 Pro が上回っています(4.5/5 vs 4/5)。 最適な選択は用途次第です。このページの項目別比較で、料金、主要スペック、アリーナ評価を分解しています。
GPT-5.2 と Gemini 3 Pro、安いのはどちらですか?
Gemini 3 Pro の方が安く、$12/1M out (prompts ≤200K)から始められます。GPT-5.2 は$14/1M outからです。
GPT-5.2 と Gemini 3 Pro の100万トークンあたりの料金は?
GPT-5.2:入力100万トークンあたり$1.75/1M in、出力100万トークンあたり$14/1M out。Gemini 3 Pro:入力100万トークンあたり$2/1M in (prompts ≤200K)、出力100万トークンあたり$12/1M out (prompts ≤200K)。