一騎打ち

GPT-5.2 のロゴvsGrok 4.3 のロゴ

GPT-5.2 vs Grok 4.3:2026年に勝つAIモデルはどっち?

GPT-5.2($14/1M out)と Grok 4.3($2.50/1M out)は、2026年に最も使われているAIモデルのひとつです。 2件のコミュニティ票のうち、GPT-5.2 が支持率50%でリードしています。

即断の評決

推論では、GPT-5.2 と Grok 4.3 は4/5で互角です。 予算重視なら Grok 4.3 の勝ち:$2.50/1M outから始められるのに対し、GPT-5.2 は$14/1M outからです。

項目別比較

最低価格
$14/1M outベースのgpt-5.2(Thinking)は$1.75/$14 per 1M、gpt-5.2-proティアは$21/$168、キャッシュ済み入力は$0.175(90%割引)です。
$2.50/1M out全推論エフォートティアで一律の入力$1.25 / 出力$2.50、キャッシュ済み入力は$0.20/1M。xAI自身の価格ページに長文コンテキスト割増はありませんが、OpenRouterは合計200K tokens超に段階的な割増料金を掲載しています。
プロバイダー
OpenAI
xAI
コンテキストウィンドウ
400K tokens (128K max output)
1M tokens
入力料金
$1.75/1M in
$1.25/1M in
出力料金
$14/1M out
$2.50/1M out
モダリティ
text, vision (text output only)
text, vision (text output only)
オープンウェイト
なし
なし
観客スコア
50%(2)
50%(0)
アリーナ評価(1-5)
推論
4.0
4.0
コーディング
4.0
3.5
ライティング
3.5
4.5
速度
2.5
3.5
コスパ
3.5
4.5

強みと弱み

GPT-5.2

  • 発売時にSWE-bench Verified 80.0%とSWE-Bench Pro 55.6%を記録、Claude Opus 4.5(80.9%)とほぼ互角です
  • GDPval:比較の70.9%で人間のプロフェッショナルと同等以上、GPT-5.1の38.8%のほぼ2倍です
  • 科学と数学に強い:GPQA Diamond 92.4%(Thinking、Proは93.2%)とFrontierMath 40.3%で、リリース時点のstate of the artでした
  • 400Kコンテキストで、256K tokensまでMRCR v2の長文検索がほぼ完璧です
  • GPT-5.1比でハルシネーションが30%減(実際のChatGPTクエリでのエラー率が8.8%から6.2%に低下)
  • 後継より安価:$1.75/$14 per 1Mで、GPT-5.4の$2.50/$15、GPT-5.5の$5/$30に対して割安です
  • 速度がコミュニティ最大の不満:ChatGPTでの拡張思考は約4 tokens/sまで落ちるとの報告があり、Proは非常に長く考えた末に失敗することもあります
  • 看板のベンチマークスコアはxhigh推論エフォートで取得されたもので、デフォルト設定よりはるかに多くのトークンと時間を消費します
  • GPT-5.1からの人格の後退が広く批判されました:Redditユーザーは「企業的すぎ、安全すぎ」「チャットとライティングでは一歩後退」と評しています
  • コーディングは直接対決のElo比較でAnthropic系に後れます(後のOpus 4.7分析では144 Eloの差)。音声モダリティなし、ファインチューニング不可です
  • 2026年半ば時点で既に旧世代:OpenAIはGPT-5.5を推奨し、GPT-5.2はメインのAPI価格ページに載っていません

Grok 4.3

  • 攻めの価格設定:$1.25/$2.50 per 1M tokensで、Grok 4比で入力58%・出力83%安く、GPT-5.5とGemini 3.1 Proを下回ります
  • エージェント性能の大躍進:GDPval-AAでGrok 4.20比+321 Elo、ツール呼び出しと指示追従も強力です
  • キャッシュ済み入力は$0.20/1M(84%割引)で、繰り返しのエージェントループで大きな節約になります
  • 設定可能な推論エフォート(none/low/medium/high)を1つのモデル・1つの価格で提供、高速版と深思考版の間のルーティングは不要です
  • 自然で簡潔なトーンと、実コストを下げるトークン密度の高い出力がHNで称賛されています
  • スループットは約130出力tokens/秒と堅実です(Artificial Analysis)
  • コーディング推論はHNの開発者から「4月の大型リリース勢とは勝負にならない」と評され、知能のフロンティアはGrok 4からほとんど動いていません
  • AA-Omniscienceの非ハルシネーションスコアがGrok 4.20比で8ポイント低下:精度が命の領域では4.20が依然xAIの安全な選択です
  • 最初のトークンまでの時間が長く(高推論エフォートでArtificial Analysis計測約13秒)、対話型アプリにはつらいところです
  • コンテキストウィンドウはGrok 4.20の2Mから1Mに縮小しました
  • 信頼と安全性への苦情が繰り返されており(有害コンテンツの報告、一貫しない挙動)、コンシューマーアプリにMCP/接続アプリのサポートがありません

あなたの審判を下す

1人につき各ツール1票。あなたの推薦が、みんなの見る観客スコアを動かします。

GPT-5.2$14/1M out
50%観客スコア · 2
Grok 4.3$2.50/1M out
50%観客スコア · 0

GPT-5.2 へのアリーナの評決

重い推論、長文コンテキスト、エージェント作業ならGPT-5.1よりGPT-5.2を選んでください。GDPvalの勝率はGPT-5.1のほぼ2倍、ハルシネーションは30%減、400Kコンテキストも安定して扱えます。2026年半ばでは主にコスパ狙いの選択肢で、GPT-5.5の$5/$30に対し$1.75/$14でほとんどの業務タスクをこなせます。レイテンシ重視のチャットやクリエイティブライティングには不向きで、ユーザーはGPT-5.1より遅く平板だと感じています。OpenAIの現行フロンティアが欲しいチームは、素直にGPT-5.5に投資すべきです。

Grok 4.3 へのアリーナの評決

呼び出し単価が支配的なエージェント型・大量処理パイプラインを運用しているならGrok 4.3を選んでください。GPT-5.5やGemini 3.1 Proのごく一部の価格で、フロンティアに迫る推論とGrok 4.20からのツール呼び出しの大幅な向上が得られます。コーディング精度が最優先なら見送ってください。開発者は依然Claudeと4月の大型リリース勢を上位に置いています。2Mコンテキストや、法務・医療・コンプライアンス業務向けのより高い非ハルシネーションスコアが必要ならGrok 4.20に留まりましょう。レイテンシ重視のアプリは、コミットする前に最初のトークンまで約13秒という点をテストすべきです。

観客の声

GPT-5.2 について

返金なしウス

The thinking speed is brutal, I clocked something like 4 tok/s in ChatGPT on extended thinking. Pro will grind for ages and still whiff. Great scores, painful to actually use.

聖デプロイウス

GDPval numbers are wild, it ties or beats human pros in 71% of comparisons. For science and math work (92.4 GPQA Diamond) it earned a spot in my stack.

Grok 4.3 について

まだ審判はありません。最初の声を上げてください。

よくある質問

GPT-5.2 は Grok 4.3 より優れていますか?

最適な選択は用途次第です。このページの項目別比較で、料金、主要スペック、アリーナ評価を分解しています。

GPT-5.2 と Grok 4.3、安いのはどちらですか?

Grok 4.3 の方が安く、$2.50/1M outから始められます。GPT-5.2 は$14/1M outからです。

GPT-5.2 と Grok 4.3 の100万トークンあたりの料金は?

GPT-5.2:入力100万トークンあたり$1.75/1M in、出力100万トークンあたり$14/1M out。Grok 4.3:入力100万トークンあたり$1.25/1M in、出力100万トークンあたり$2.50/1M out。