Die Arena · KI-Modell im Test

GPT-5.5

von OpenAI

OpenAIs agentisches Flaggschiff: 1M Kontext, SOTA auf ARC-AGI-2 und Terminal-Bench 2.0, $5/$30 pro 1M Tokens.

Arena-Score 4/557% empfehlen es · 3 Stimmen
Reasoning5.0
Coding4.5
Schreiben4.0
Tempo3.5
Preis-Leistung3.0
GPT-5.5 besuchenagentisches CodingLong-Context-AnalyseComputer-Use-AgentsTerminal- und CLI-Automatisierung
Preis

$30/1M out

Standardtarif $5/$30 pro 1M Tokens (gecachter Input $0.50), das Doppelte der $2.50/$15 von GPT-5.4; Batch/Flex $2.50/$15; Priority $12.50/$75; GPT-5.5 Pro $30/$180; Prompts über 272K Input-Tokens mit 2x Input / 1.5x Output abgerechnet.

Anbieter

OpenAI

Kontextfenster

1M tokens (1,050,000)

Input-Preis

$5/1M in

Output-Preis

$30/1M out

Modalitäten

text, vision (image input, text output)

Open Weights

Nein

Was ist GPT-5.5?

OpenAIs Flaggschiff-Reasoning-Modell, veröffentlicht am 23. April 2026. Gebaut für agentisches Coding, Computer Use und langlaufende Wissensarbeit, mit einem Kontextfenster von 1,050,000 Tokens und 128K max. Output. Akzeptiert Text- und Bildeingabe, gibt Text aus, mit Function Calling, strukturierten Outputs und gehosteten Agent-Tools über die Responses API.

GPT-5.5: Vor- und Nachteile

Vorteile

  • 1M-Token-Kontextfenster (1,050,000) mit 128K max. Output und Reasoning-Effort von none bis xhigh einstellbar
  • State of the Art auf ARC-AGI-2 mit 85.0% (gegenüber 73.3% bei GPT-5.4) und auf Terminal-Bench 2.0 mit 82.7%
  • Starke agentische Coding-Autonomie: Entwickler berichten, dass es Aufgaben im One-Shot löst, die GPT-5.4 mehrere Anläufe kosteten, und eigene Fehler selbst behebt; +50 Punkte auf Code Arena gegenüber GPT-5.4
  • Aggressive Rabatte: 90% auf gecachten Input ($0.50/1M) und 50% über Batch oder Flex ($2.50/$15)
  • Schnell für einen Frontier-Reasoner: Entwickler nennen es das erste GPT-Modell, das sich auf mittlerem oder niedrigem Thinking-Effort angenehm betreiben lässt

Nachteile

  • Listenpreis gegenüber GPT-5.4 verdoppelt ($5/$30 statt $2.50/$15) bei gleichem 1M-Token-Kontextfenster
  • Zu wörtliche Befolgung von Anweisungen: Entwickler berichten, dass es an offensichtlichen Stellen die Absicht nicht erschließt, wo Claude es schafft
  • Liegt auf SWE-bench Pro hinter Claude Opus 4.8 (58.6% vs 69.2%); HN-Entwickler bevorzugen fürs Coding weiterhin Claude im Verhältnis von etwa 2:1
  • Manchmal zu konservativ bei Code-Änderungen oder überspringt tiefes Reasoning komplett und antwortet bei komplexen Prompts sofort
  • Long-Context-Aufschlag: Prompts über 272K Input-Tokens werden für die gesamte Session mit 2x Input und 1.5x Output abgerechnet

Das Urteil der Arena

Greifen Sie zu GPT-5.5 statt GPT-5.4, wenn Sie stärkere agentische Autonomie, terminal-lastige Workflows oder abstraktes Reasoning auf SOTA-Niveau brauchen, aber wissen Sie: Der Listenpreis hat sich von $2.50/$15 bei GPT-5.4 auf $5/$30 verdoppelt, während der 1M-Token-Kontext gleich blieb. Teams mit dateiübergreifenden High-Stakes-Refactorings dürften weiterhin Claude Opus bevorzugen, das SWE-bench Pro anführt (69.2% vs 58.6%) und Absichten aus vagen Prompts besser erschließt. Budgetbewusste Nutzer sollten den Aufschlag ab 272K Tokens und Berichte über schneller aufgebrauchte Limits im Blick behalten und Caching, Batch oder Flex nutzen, um die Kosten zu halbieren.

Daumen hoch oder Daumen runter

Fällen Sie Ihr Urteil

Würden Sie GPT-5.5 empfehlen oder die Menge davor warnen?

57%Crowd-Score · 3

Top-Alternativen zu GPT-5.5

Alle Alternativen
1
Claude Haiku 4.5

Anthropics schnellstes Modell: etwa 90% der Coding-Stärke von Sonnet 4.5 für $1/$5 pro 1M Tokens, 200K Kontext.

$5/1M out67%(2)
Visit
2
Claude Fable 5

Anthropics Mythos-Klasse-Flaggschiff vom Juni 2026: 80.3% auf SWE-bench Pro, 11 Punkte vor jedem anderen Frontier-Modell

$50/1M out63%(4)
Visit
3
Claude Opus 4.7

Anthropics Opus vom April 2026: 87.6% SWE-bench Verified, 1M Kontext, hochauflösende Vision, inzwischen hinter Opus 4.8

$25/1M out57%(3)
Visit

GPT-5.5 im direkten Vergleich

Was die Menge sagt

Daumen Runtericus

It is painfully literal. Where Claude infers intent in obvious places, 5.5 wants everything spelled out. And the price doubled vs 5.4 for the same 1M context.

Der Faire Richter

85 on ARC-AGI-2 and you can feel it. Stuff that used to stall my agent just resolves now. 1M context with 128K output covers every workflow I have.

Sir Shipt-Viel

5.5 one-shots tasks that took 5.4 three turns, and it fixes its own mistakes mid-run instead of doubling down. The reasoning effort dial from none to xhigh is genuinely useful.

GPT-5.5: häufige Fragen

Was kostet GPT-5.5 pro 1M Tokens?

GPT-5.5 kostet $5/1M in pro 1M Input-Tokens und $30/1M out pro 1M Output-Tokens. Standardtarif $5/$30 pro 1M Tokens (gecachter Input $0.50), das Doppelte der $2.50/$15 von GPT-5.4; Batch/Flex $2.50/$15; Priority $12.50/$75; GPT-5.5 Pro $30/$180; Prompts über 272K Input-Tokens mit 2x Input / 1.5x Output abgerechnet.