Die Arena · KI-Modell im Test

Gemini 3 Pro

von Google

Googles Frontier-Modell vom Nov 2025: 1M Kontext, als erstes über 1500 Elo auf LMArena, ersetzt durch Gemini 3.1 Pro.

Arena-Score 4/557% empfehlen es · 3 Stimmen
Reasoning4.5
Coding4.5
Schreiben3.5
Tempo3.5
Preis-Leistung4.0
Gemini 3 Pro besuchenmultimodale Analyse (Video/Audio/Bild)Long-Context-Reasoningagentisches Codingmathematisches und naturwissenschaftliches Reasoning
Preis

$12/1M out (prompts ≤200K)

Standardtarif: $2/$12 pro 1M Tokens für Prompts ≤200K, $4/$18 darüber; Batch mit 50% Rabatt. Am 9. März 2026 eingestellt, der Nachfolger Gemini 3.1 Pro behält identische Preise.

Anbieter

Google (DeepMind)

Kontextfenster

1M tokens (64K output)

Input-Preis

$2/1M in (prompts ≤200K)

Output-Preis

$12/1M out (prompts ≤200K)

Modalitäten

text, image, audio, video in; text out

Open Weights

Nein

Was ist Gemini 3 Pro?

Frontier-Reasoning-Modell von Google DeepMind, veröffentlicht am 18. November 2025. Erstes Modell über 1500 Elo auf LMArena, mit 1M-Token-Kontextfenster und nativem Verständnis von Text, Bild, Audio und Video. Am 9. März 2026 zugunsten von Gemini 3.1 Pro zum gleichen Preis eingestellt.

Gemini 3 Pro: Vor- und Nachteile

Vorteile

  • Führte LMArena zum Start mit Rekordwert von 1501 Elo an und erreichte 91.9% auf GPQA Diamond, State of the Art zum Release
  • ARC-AGI-2 bei 31.1%, rund 6x Gemini 2.5 Pro (4.9%) und damals fast das Doppelte von GPT-5.1 (17.6%)
  • Klassenbestes multimodales Verständnis: 81% MMMU-Pro, 87.6% Video-MMMU, mit 1M-Token-Kontextfenster
  • Starkes agentisches Coding: 76.2% SWE-bench Verified, 54.2% Terminal-Bench 2.0, 1487 Elo auf WebDev Arena
  • Unterbot die Konkurrenz mit $2/$12 pro 1M Tokens, unterhalb der Claude-Sonnet-Preisklasse ($3/$15)
  • Konfigurierbares thinking_level (low/medium/high) lässt Entwickler Reasoning-Tiefe gegen Latenz und Kosten abwägen

Nachteile

  • Selbstsichere Halluzinationen: Auf AA-Omniscience gab es in 88% der Fälle eine falsche Antwort statt abzulehnen, gegenüber 48% bei Claude Sonnet 4.5 (the-decoder)
  • Vielfach berichtete Anbiederung (Zvi Mowshowitz: 'gewaltige Intelligenz ohne Rückgrat'); braucht strenge System-Prompts
  • Zuverlässigkeitsprobleme beim Tool-Calling in Agent-Stacks: Entwickler meldeten Tool-Outputs, die in den Chat-Thread gekippt wurden, und mehr nötiges Scaffolding als bei OpenAI/Anthropic-Modellen
  • Langsam bei hohem Thinking-Level: Zeit bis zum ersten Token auf AI Studio mit rund 30-60s gemessen, trotz ~130 Tokens/s Output-Tempo
  • Eingestellt: am 9. März 2026 auf der Gemini API und in AI Studio abgeschaltet, gemini-3-pro-preview zeigt jetzt als Alias auf Gemini 3.1 Pro

Das Urteil der Arena

Ein Meilenstein-Release, das Google Ende 2025 zurück an die Spitze brachte, mit einem riesigen Reasoning-Sprung gegenüber Gemini 2.5 Pro und den besten multimodalen Scores seiner Generation. Stand Mitte 2026 gibt es keinen Grund mehr, es zu wählen: Google hat es am 9. März 2026 auf der API abgeschaltet, und Gemini 3.1 Pro kostet exakt dasselbe und mehr als verdoppelt die ARC-AGI-2-Leistung (77.1% vs 31.1%). Teams mit Legacy-Deployments sollten auf 3.1 Pro migrieren, auf das die alte Modell-ID ohnehin schon zeigt. Meiden Sie es für halluzinationssensible Workloads ohne Grounding, eine Schwäche, die Tester wiederholt anmahnten.

Daumen hoch oder Daumen runter

Fällen Sie Ihr Urteil

Würden Sie Gemini 3 Pro empfehlen oder die Menge davor warnen?

57%Crowd-Score · 3

Top-Alternativen zu Gemini 3 Pro

Alle Alternativen
1
Claude Haiku 4.5

Anthropics schnellstes Modell: etwa 90% der Coding-Stärke von Sonnet 4.5 für $1/$5 pro 1M Tokens, 200K Kontext.

$5/1M out67%(2)
Visit
2
Claude Fable 5

Anthropics Mythos-Klasse-Flaggschiff vom Juni 2026: 80.3% auf SWE-bench Pro, 11 Punkte vor jedem anderen Frontier-Modell

$50/1M out63%(4)
Visit
3
Claude Opus 4.7

Anthropics Opus vom April 2026: 87.6% SWE-bench Verified, 1M Kontext, hochauflösende Vision, inzwischen hinter Opus 4.8

$25/1M out57%(3)
Visit

Gemini 3 Pro im direkten Vergleich

Was die Menge sagt

Richter Gnadenlos

Confidently wrong is its worst mode. On AA-Omniscience it gave a wrong answer 88% of the time instead of declining. Add the sycophancy and you need a tight system prompt to trust it.

Champion der Vibes

ARC-AGI-2 at 31% was about 6x Gemini 2.5 Pro and nearly double GPT-5.1 at the time. For visual-heavy work (81 MMMU-Pro) nothing else came close.

Glorius Maximus

1501 Elo on LMArena at launch was deserved. Multimodal is where it kills, I feed it lecture videos and dense PDFs and it just gets it. 1M context helps.

Gemini 3 Pro: häufige Fragen

Was kostet Gemini 3 Pro pro 1M Tokens?

Gemini 3 Pro kostet $2/1M in (prompts ≤200K) pro 1M Input-Tokens und $12/1M out (prompts ≤200K) pro 1M Output-Tokens. Standardtarif: $2/$12 pro 1M Tokens für Prompts ≤200K, $4/$18 darüber; Batch mit 50% Rabatt. Am 9. März 2026 eingestellt, der Nachfolger Gemini 3.1 Pro behält identische Preise.