Direktvergleich

Gemini 3 Pro LogovsClaude Opus 5 Logo

Gemini 3 Pro vs Claude Opus 5: Wer gewinnt das KI-Modell-Duell 2026?

Gemini 3 Pro ($12/1M out (prompts ≤200K)) und Claude Opus 5 ($25/1M out) sind 2026 zwei der meistgenutzten KI-Modelle. Bei 7 Stimmen der Community führt Claude Opus 5 mit 63% Zustimmung.

Schnelles Urteil

Bei Reasoning wählen Sie Claude Opus 5: Die Arena bewertet es mit 5/5 gegenüber 4.5/5 für Gemini 3 Pro. Beim Budget gewinnt Gemini 3 Pro: Es startet bei $12/1M out (prompts ≤200K) gegenüber $25/1M out für Claude Opus 5.

Vergleich Zeile für Zeile

Ab
$12/1M out (prompts ≤200K)Standardtarif: $2/$12 pro 1M Tokens für Prompts ≤200K, $4/$18 darüber; Batch mit 50% Rabatt. Am 9. März 2026 eingestellt, der Nachfolger Gemini 3.1 Pro behält identische Preise.
$25/1M outOffizieller Anthropic-API-Listenpreis für claude-opus-5: $5/1M Eingabe, $25/1M Ausgabe, unverändert gegenüber Opus 4.8, eine einzige Stufe mit 1M Kontext als Standard- und Maximalwert, 128K maximale Ausgabe, Prompt-Caching ab 512 Tokens. Der Research-Preview-Fast-Modus zu $10/$50 (rund 2,5-mal schneller) ist ausschließlich über die Claude-API verfügbar. Geprüft anhand von platform.claude.com (What's new in Opus 5), Stand Juli 2026.
Anbieter
Google (DeepMind)
Anthropic
Kontextfenster
1M tokens (64K output)
1M tokens
Input-Preis
$2/1M in (prompts ≤200K)
$5/1M in
Output-Preis
$12/1M out (prompts ≤200K)
$25/1M out
Modalitäten
text, image, audio, video in; text out
text, vision
Open Weights
Nein
Nein
Crowd-Score
57%(3)
63%(4)
Arena-Bewertungen (1-5)
Reasoning
4.5
5.0
Coding
4.5
5.0
Schreiben
3.5
4.0
Tempo
3.5
2.0
Preis-Leistung
4.0
4.0

Stärken und Schwächen

Gemini 3 Pro

  • Führte LMArena zum Start mit Rekordwert von 1501 Elo an und erreichte 91.9% auf GPQA Diamond, State of the Art zum Release
  • ARC-AGI-2 bei 31.1%, rund 6x Gemini 2.5 Pro (4.9%) und damals fast das Doppelte von GPT-5.1 (17.6%)
  • Klassenbestes multimodales Verständnis: 81% MMMU-Pro, 87.6% Video-MMMU, mit 1M-Token-Kontextfenster
  • Starkes agentisches Coding: 76.2% SWE-bench Verified, 54.2% Terminal-Bench 2.0, 1487 Elo auf WebDev Arena
  • Unterbot die Konkurrenz mit $2/$12 pro 1M Tokens, unterhalb der Claude-Sonnet-Preisklasse ($3/$15)
  • Konfigurierbares thinking_level (low/medium/high) lässt Entwickler Reasoning-Tiefe gegen Latenz und Kosten abwägen
  • Selbstsichere Halluzinationen: Auf AA-Omniscience gab es in 88% der Fälle eine falsche Antwort statt abzulehnen, gegenüber 48% bei Claude Sonnet 4.5 (the-decoder)
  • Vielfach berichtete Anbiederung (Zvi Mowshowitz: 'gewaltige Intelligenz ohne Rückgrat'); braucht strenge System-Prompts
  • Zuverlässigkeitsprobleme beim Tool-Calling in Agent-Stacks: Entwickler meldeten Tool-Outputs, die in den Chat-Thread gekippt wurden, und mehr nötiges Scaffolding als bei OpenAI/Anthropic-Modellen
  • Langsam bei hohem Thinking-Level: Zeit bis zum ersten Token auf AI Studio mit rund 30-60s gemessen, trotz ~130 Tokens/s Output-Tempo
  • Eingestellt: am 9. März 2026 auf der Gemini API und in AI Studio abgeschaltet, gemini-3-pro-preview zeigt jetzt als Alias auf Gemini 3.1 Pro

Claude Opus 5

  • Beim Launch Platz 1 in der Composite-Intelligence-Wertung über 190 Modelle bei Artificial Analysis, mit 43,3 % auf Frontier-Bench v0.1 gegenüber 34,4 % für GPT-5.6 Sol und 33,7 % für Claude Fable 5
  • 3,9-mal besser als GPT-5.6 Sol bei ARC-AGI-3 (neuartiges Schlussfolgern, 30,2 % vs. 7,8 %) und Elo 1861 bei GDPval-AA v2 für wirtschaftliche Wissensarbeit, vor Fable 5 (1747)
  • 79,2 % auf SWE-bench Pro, nur einen Punkt hinter Fable 5 (80,0 %) und 10 Punkte über Opus 4.8 (69,2 %), zum halben Preis von Fable 5; Cursors Mitgründer nennt es 'nahezu die Intelligenz von Fable 5 bei Geschwindigkeit und Kosten von Opus'
  • Gleiches Preismodell wie Opus 4.8 ($5/$25), aber größeres Fenster: 1M Kontext ist jetzt Standard- und einzige Stufe, mit 128K maximaler Ausgabe und Prompt-Caching ab 512 Tokens
  • Dual-Use-Sicherheitsklassifizierer lösen 85 % seltener aus als bei Fable 5, und der neue standardmäßige Fallback-Modus verhindert die stillen Ablehnungen mitten in der Sitzung, die den Start von Fable 5 belasteten
  • Überprüft die eigene Arbeit ohne Aufforderung, verarbeitet Tool-Wechsel mitten im Gespräch (Beta), ohne den Prompt-Cache zu zerstören, und ist ab Tag eins auf Claude.ai, der API, Bedrock, Vertex und Microsoft Foundry verfügbar
  • Auffällig langsam und sehr wortreich: 52,6 Ausgabe-Tokens/s und 68 Sekunden bis zum ersten Token bei Artificial Analysis, dabei verbrauchte das Modell im Test rund 100 Mio. Ausgabe-Tokens gegenüber einem Median von 63 Mio.
  • Die Wortfülle ist ein reales Kostenproblem: CodeRabbit maß rund 50 % mehr Lesevolumen und 65 % mehr Schreibvolumen pro Code-Review-Aufruf im Vergleich zu Referenz-Frontier-Modellen
  • Trotz der 'kosteneffizienten' Erzählung keine echte Preissenkung: identisch mit Opus 4.8 ($5/$25), nahe am Preis von GPT-5.6 ($5/$30) und mehr als doppelt so teuer wie vergleichbare Gemini- oder Grok-Stufen
  • Rezensenten beschreiben eine 'brillante, aber nervige' Persönlichkeit: Übervorsichtigkeit, Zurückhaltung und gelegentliche Ablehnung banaler Aufgaben wie das Lösen eines Merge-Konflikts (Feldtest von Lenny's Newsletter)
  • Breaking API-Änderung für Umsteiger von Opus 4.8: Thinking ist standardmäßig aktiv und lässt sich bei xhigh oder max Effort nicht deaktivieren (liefert einen 400-Fehler); der Fast-Modus ($10/$50, rund 2,5-mal schneller) ist nur über die API verfügbar, nicht auf Bedrock oder Vertex

Fällen Sie Ihr Urteil

Eine Empfehlung pro Tool und Gladiator. Sie verändert den Crowd-Score, den alle sehen.

Gemini 3 Pro$12/1M out (prompts ≤200K)
57%Crowd-Score · 3
Claude Opus 5$25/1M out
63%Crowd-Score · 4

Das Urteil der Arena zu Gemini 3 Pro

Ein Meilenstein-Release, das Google Ende 2025 zurück an die Spitze brachte, mit einem riesigen Reasoning-Sprung gegenüber Gemini 2.5 Pro und den besten multimodalen Scores seiner Generation. Stand Mitte 2026 gibt es keinen Grund mehr, es zu wählen: Google hat es am 9. März 2026 auf der API abgeschaltet, und Gemini 3.1 Pro kostet exakt dasselbe und mehr als verdoppelt die ARC-AGI-2-Leistung (77.1% vs 31.1%). Teams mit Legacy-Deployments sollten auf 3.1 Pro migrieren, auf das die alte Modell-ID ohnehin schon zeigt. Meiden Sie es für halluzinationssensible Workloads ohne Grounding, eine Schwäche, die Tester wiederholt anmahnten.

Das Urteil der Arena zu Claude Opus 5

Claude Opus 5 ist die vernünftige Standardwahl der Series-5-Reihe: fast die gesamte Intelligenz von Fable 5 (bei Frontier-Bench und GDPval sogar mehr) zum exakt halben Token-Preis, mit Klassifizierern, die 85 % seltener auslösen. Wer Workloads wegen der Fähigkeiten zu Fable 5 migriert hat, aber die Rechnung oder die Falsch-Positiv-Ablehnungen stört, sollte sie hierher verlegen; wer noch bei Opus 4.8 ist, bekommt 10 SWE-bench-Pro-Punkte gratis dazu. Zwei ehrliche Gründe sprechen für eine andere Wahl: Latenz und Wortfülle. Mit 52,6 Tokens/s und 68 Sekunden bis zum ersten Token eignet es sich schlecht für interaktive UX, und sein Token-Appetit treibt die realen Kosten still über den Listenpreis hinaus, weshalb budgetsensible Pipelines mit hohem Volumen weiterhin bei Sonnet 5, Gemini oder DeepSeek besser aufgehoben sind. Fable 5 bleibt nur für die längsten autonomen Läufe sinnvoll, bei denen sein leichter Vorsprung bei SWE-bench Pro sich summiert.

Was die Menge sagt

Zu Gemini 3 Pro

Richter Gnadenlos

Confidently wrong is its worst mode. On AA-Omniscience it gave a wrong answer 88% of the time instead of declining. Add the sycophancy and you need a tight system prompt to trust it.

Champion der Vibes

ARC-AGI-2 at 31% was about 6x Gemini 2.5 Pro and nearly double GPT-5.1 at the time. For visual-heavy work (81 MMMU-Pro) nothing else came close.

Glorius Maximus

1501 Elo on LMArena at launch was deserved. Multimodal is where it kills, I feed it lecture videos and dense PDFs and it just gets it. 1M context helps.

Zu Claude Opus 5

Daumen Runtericus

The sticker price is unchanged but my invoice is not: it writes essays where Opus 4.8 wrote answers. 68 seconds to first token killed it for our support chat, we went back to Sonnet 5.

Der Faire Richter

Fed it a 40-tab financial model with cross-sheet formulas and asked for a scenario deck. It got the edge cases the analysts missed. For document-heavy enterprise work this is the best model I have used.

Sir Shipt-Viel

We moved off Fable 5 because the bio classifier kept flagging our genomics tooling. Opus 5 does the same work at half the price and I have not seen a single silent reroute since.

Wächter des Repos

Migrated our agents from Opus 4.8 the day it dropped. Same bill, and tasks that used to stall at the planning stage now just finish. The 10-point SWE-bench jump is not marketing, our merge queue feels it.

Häufige Fragen

Ist Gemini 3 Pro besser als Claude Opus 5?

Die Menge steht aktuell hinter Claude Opus 5: 63% empfehlen es, gegenüber 57% für Gemini 3 Pro (7 Stimmen). Bei Reasoning schneidet Claude Opus 5 besser ab (5/5 vs 4.5/5). Die richtige Wahl hängt von Ihrem Einsatzzweck ab. Der Vergleich Zeile für Zeile auf dieser Seite schlüsselt Preise, Kerndaten und Arena-Bewertungen auf.

Was ist günstiger, Gemini 3 Pro oder Claude Opus 5?

Gemini 3 Pro ist günstiger: Es startet bei $12/1M out (prompts ≤200K), während Claude Opus 5 bei $25/1M out startet.

Was kosten Gemini 3 Pro und Claude Opus 5 pro 1M Tokens?

Gemini 3 Pro: $2/1M in (prompts ≤200K) pro 1M Input-Tokens, $12/1M out (prompts ≤200K) pro 1M Output-Tokens. Claude Opus 5: $5/1M in pro 1M Input-Tokens, $25/1M out pro 1M Output-Tokens.