Zum Inhalt
Tier C — Spezialist
Läuft in:USErstellt in:United States
OpenAI

gpt-5.5

Tier C — Spezialist

Tokonomix-Redaktionsteam·Geprüft von Mes Kalkan··

GPT-5.5 ist ein großes Sprachmodell, das von OpenAI für allgemeine Textgenerierung und Aufgaben des natürlichen Sprachverständnisses entwickelt wurde. Das Modell stellt eine Iteration in OpenAIs GPT-Reihe dar und ist als Nachfolger früherer Versionen innerhalb dieser Produktlinie positioniert. Es ist darauf ausgelegt, ein breites Anwendungsspektrum abzudecken, darunter Inhaltserstellung, Beantwortung von Fragen, Code-Unterstützung, Analyse und dialogbasierte Interaktionen. Das Modell bietet die für moderne große Sprachmodelle typischen Textgenerierungsfähigkeiten und verarbeitet Texteingaben zu kohärenten schriftlichen Ausgaben in mehreren Domänen und Sprachen. Während die genaue Größe des Kontextfensters nicht öffentlich angegeben wurde, behält GPT-5.5 die zentralen Architekturprinzipien transformerbasierter Modelle bei, die die GPT-Familie geprägt haben. Das System ist darauf ausgelegt, Leistung über Aufgaben des Allgemeinwissens, Reasoning-Fähigkeiten und Instruktionsbefolgung hinweg auszubalancieren. Innerhalb von OpenAIs Modellportfolio ordnet sich GPT-5.5 unter den produktionsreifen Angeboten ein, die über die API und Endkundenprodukte verfügbar sind. Es teilt die grundlegende Designphilosophie früherer GPT-Modelle und integriert dabei Verfeinerungen, die aus OpenAIs laufender Forschung und Einsatzpraxis hervorgegangen sind. Entwickler und Organisationen können das Modell über OpenAIs reguläre Bereitstellungskanäle nutzen, wo es als eine Option unter mehreren Modellen mit unterschiedlichen Leistungsprofilen und rechnerischen Eigenschaften dient.

GPT-5.5 positioniert sich als solider Allrounder in OpenAIs Produktlinie und richtet sich an Teams, die ein verlässliches Sprachmodell für breite Anwendungsfälle benötigen.

Tokonomix Redaktionsanalyse
Abschnitt 01

Geschwindigkeitsanalyse

Latenz über alle Benchmark-Läufe gemessen. P50 (Median) und P95 (95. Perzentil) zeigen ein realistisches Bild der Antwortgeschwindigkeit bei normaler und Spitzenlast.

P50-Latenz (Median)P95-Latenz100 runs
546243943326224811708-1309-07ms
Abschnitt 02

Qualitätswerte

Wie sich dieses Modell je Prompt-Kategorie zum übrigen Feld verhält, aus einem paarweisen Fit über dieselben Prompts. Die rohe Jury-Wertung steht unter jeder Zahl.

69%
Codegenerierung
Jury-Mittel 94
82%
Kreativ
Jury-Mittel 92
74%
Faktisch
Jury-Mittel 90
66%
Mehrsprachig
Jury-Mittel 99
74%
Schlussfolgern
Jury-Mittel 99

Gewinnrate je Kategorie: wie oft dieses Modell ein durchschnittliches Modell bei einem Prompt dieser Kategorie schlägt. 50% ist der Durchschnitt, keine schlechte Note. Es ist kein Prozentsatz richtiger Antworten.

Abschnitt 03

Preisverlauf

Direkte Provider-Tarife pro Million Tokens, plus eine typische Gesprächskostenschätzung.

💰
API-Tarife — gpt-5.5
$5.00 pro 1M Input-Tokens
$30.00 pro 1M Output-Tokens
≈ $0.0090 pro typischem Gespräch (800 Tokens)
Input- vs. Output-Preis (pro 1M Tokens)
pro 1M Input-Tokens$5.00
pro 1M Output-Tokens$30.00

Pricing over time

Input & output per 1M tokens · step-line = price changes

$5.00

input / 1M

— stable

$30.00

output / 1M

— stable

2026-06-072026-08-022026-09-06
Input
Output
Price change
⟳ synced weekly
Abschnitt 04

Tokens pro Sekunde

Durchsatz in Tokens pro Sekunde, abgeleitet aus gemessener P50-Latenz. Höhere Werte sind besser; Schwankungen spiegeln die Provider-seitige Last wider.

Durchsatz (Tokens / s)203 / avg 215
363117

Geschätzt aus P50-Latenz × 200 Output-Tokens — die absolute Zahl hängt von dieser Annahme ab; entscheidend ist der Trend.

Abschnitt 05

Stärken & Schwächen

Basierend auf Benchmark-Ergebnissen und aggregiertem Community-Feedback zu realen Anwendungsfällen.

Stärken

Vielseitige TextgenerierungStabile KonversationsführungMehrsprachige UnterstützungGute InstruktionsbefolgungHilfreich bei Code-AufgabenEinfache API-IntegrationBreites AllgemeinwissenEtabliertes Anbieter-Ökosystem

Schwächen

Kontextfenster nicht öffentlich dokumentiertTier C statt SpitzenklasseMultimodalität nicht spezifiziertWissensstichtag unklar
Abschnitt 06

Fähigkeiten

toolssource: litellmvisionjson modepdf inputreasoningjson schemaparallel toolsprompt cachingmax output tokens: 128000
Abschnitt 07

Häufig gestellte Fragen

Das Modell ist für allgemeine Textverarbeitung, Frage-Antwort-Systeme, Inhaltsproduktion und konversationelle Anwendungen ausgelegt. Es eignet sich gut für Produktivszenarien, in denen ein ausgewogenes Verhältnis aus Qualität und Verfügbarkeit gefragt ist.

Für allgemeine Textaufgaben ist GPT-5.5 eine pragmatische Wahl, auch wenn fehlende öffentliche Spezifikationen eine genaue technische Einordnung erschweren.

Tokonomix Bewertungsfazit
Abschnitt 08

Verfügbarkeit

Verfügbarkeit

Wie oft dieses Modell antwortet, wenn wir es aufrufen — gemessen anhand echter API-Anfragen und Live-Tests der letzten 30 Tage. Dies ist unabhängig von der Qualität: Diese Zahlen zeigen nur, ob das Modell antwortet, nicht wie gut die Antwort ist.

Letzte 7 Tage

Letzte 30 Tage

66.7%

n=3

Mediane Antwortzeit

58,299ms

n=2

Basierend auf 388 Messungen in den letzten 30 Tagen.

Technische Details

Nur echte API-Aufrufe und Live-Test-Anfragen werden gezählt — interne Proben und Benchmark-Läufe sind ausgeschlossen.

Aufrufe mit einem eigenen API-Schlüssel (BYOK) sind ausgeschlossen: Diese Fehler sind schlüsselspezifisch und kein Zeichen für Modellausfälle.

Fehlgeschlagene Aufrufe werden NICHT in Qualitätswerten berücksichtigt — Qualität wird nur für erfolgreiche Antworten gemessen. Verfügbarkeit und Qualität sind unabhängige Signale.

Mediane Antwortzeit (p50) über erfolgreiche Aufrufe mit aufgezeichneter Dauer. Ausreißer beeinflussen den Median weniger als den Durchschnitt.

Gesamte Aufrufe (30d)

3

OK-Antworten (30d)

2

Gesamte Aufrufe (7d)

0

OK-Antworten (7d)

0

Abschnitt 09

Tokonomix-Benchmark-Urteile

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-595/100 · 50 runs
47 correct1 partial2 wrong94% accuracy
2026-09-06

GPT-5.5 adds eight capabilities including reasoning and vision support

GPT-5.5 represents a significant capability expansion for OpenAI's flagship model, introducing eight new features that broaden its functional scope. The most notable additions are native reasoning capabilities and vision support, allowing the model to process images alongside text and engage in more deliberate problem-solving approaches. The update also introduces tool calling functionality with parallel execution support, enabling multi-step workflows and integration with external systems. Developers gain new JSON handling options through both json_mode and json_schema features, providing better structured output control. PDF input support eliminates preprocessing requirements for document analysis tasks. Prompt caching has been added to optimize repeated query patterns and reduce latency for common operations. These additions position GPT-5.5 as a more versatile platform for multimodal applications, complex reasoning tasks, and system integrations. The breadth of new capabilities suggests OpenAI is moving toward a more comprehensive AI platform rather than focusing solely on conversational performance improvements. Users working with visual content, structured data workflows, or applications requiring systematic reasoning will find the most immediate value in this release.

Qualität

Latenz p50

Testläufe

0

Eight new capabilities added Reasoning and vision support Tool calling with parallel execution PDF input and caching enabled
Abschnitt 10

Vollständiges Modellprofil

gpt-5.5 — illustration 1
GPT-5.5: die neueste Generation, mit allen Unbekannten, die das mit sich bringt

Hinweis — zukunftsgerichtetes Profil. Diese Seite beschreibt ein Modell, das sich entweder in einer frühen Preview-Phase befindet, angekündigt aber noch nicht allgemein verfügbar ist, oder auf Basis von Roadmap-Signalen prognostiziert wurde. Spezifikationen und Fähigkeiten können sich vor dem öffentlichen Launch noch ändern. Live-Benchmark-Daten auf dieser Seite spiegeln wider, welchen Endpunkt unser Test-Harness heute erreichen kann.

GPT-5.5 ist der gleitende Slug für OpenAIs neueste Generation in der GPT-5-Familie. Das 5.5-Release verschärft das Reasoning-Verhalten, verfeinert die multimodale Handhabung und bringt die Art von inkrementellen Verbesserungen, die Teams von jedem Generationsschritt erwarten. Was es ebenfalls mitbringt, ist das Unbehagen, neu zu sein — ein Modell, das noch nicht von genügend Teams im Produktivbetrieb stressgetestet wurde, sodass die Fehlermodi noch nicht gut charakterisiert sind.

Das Early-Life-Problem

Jedes Modell durchläuft eine Entdeckungsphase. Die ersten Wochen nach dem Release sind die Zeit, in der die Community die unerwarteten Fehlermodi findet — Prompts, die in der vorherigen Generation funktionierten und in der neuen brechen, Structured-Output-Grenzfälle, die subtil fehlerhaftes JSON produzieren, Ablehnungsmuster, die bei legitimen Anwendungsfällen auslösen, Vision-Encoder-Eigenheiten bei spezifischen Dokumenttypen.

OpenAI behebt diese typischerweise, sobald sie auftauchen, wobei die Patches auf dem gleitenden Slug landen. Teams, die gpt-5.5 auslesen, erhalten die Patches automatisch. Teams, die auf gpt-5.5-2026-04-23 gepinnt sind, erhalten sie nicht, was ein eigener Tradeoff ist, der separat dokumentiert wird.

Für neue Entwicklungen lautet die Frage, ob man 5.5 jetzt übernimmt oder wartet. Die konservative Antwort ist, aggressiv in Pre-Release-Umgebungen zu evaluieren, bevor man Produktivtraffic verschiebt. Die Kosten einer frühen Adoption, die auf einen nicht charakterisierten Fehler trifft, sind höher als die Kosten, die Community zuerst die Bugs finden zu lassen.

Die gegenteilige Antwort ist ebenfalls vertretbar: Wenn Ihre Workload gut charakterisiert ist und Ihre Test-Suite gründlich ist, können die generationellen Verbesserungen, die 5.5 bringt, das Early-Adopter-Risiko wert sein. Führen Sie die Evaluation durch. Treffen Sie die Entscheidung basierend darauf, wie Ihre spezifische Workload aussieht.

Was 5.5 mitbringt

Die Verbesserungen gegenüber 5.4 folgen dem Muster der breiteren 5.x-Linie. Die Halluzinationsrate bei Out-of-Distribution-Fakten ist inkrementell reduziert. Die Einhaltung von Structured Output ist geringfügig straffer. Long-Context-Kohärenz ist etwas besser. Vision-Fähigkeiten wurden bei spezifischen Input-Kategorien verfeinert, bei denen 5.4 uneinheitlich war.

Keine dieser Verbesserungen ist individuell dramatisch. Zusammen setzen sie den Trend fort, dass jede Generation ein ruhiger, nützlicher Schritt nach vorn ist und kein transformativer Sprung.

Die 5.5-Generation bringt auch das breitere Muster von Mini-Tier-Verbesserungen, das die 5.4-Generation interessant gemacht hat. Das Mini-Tier in 5.5 ist signifikant leistungsfähiger als das 5.4-Mini, was die Kosten-Qualitäts-Grenze weiter nach unten verschiebt — Workloads, die Base 5.4 benötigten, passen zunehmend auf 5.5-Mini.

Unter der Haube

GPT-5.5 ist ein Transformer-Decoder, der verschachtelte Text- und Bildeingaben akzeptiert, mit reiner Textausgabe. Die Vision-Fähigkeiten decken die Standardoberfläche ab: Chart-Verständnis, OCR-artige Extraktion, Dokument-Layout-Parsing, Szenenbeschreibung.

OpenAI hat keine Parameteranzahlen, Expert-Routing-Details oder spezifische Architekturänderungen gegenüber früheren Generationen veröffentlicht. Die Tokenisierung verwendet das Standard-GPT-5-BPE-Vokabular. Bildeingaben werden kachelkodiert zu festen Token-Kosten pro Kachel.

Der Training-Cutoff liegt für diese Generation im frühen bis mittleren 2026, was die Grenze dessen verschiebt, was das Modell über aktuelle Ereignisse und Bibliotheksversionen weiß. Das Modell ist vertraut mit Mainline-Sprachstandards und Framework-Versionen, die durch diesen Zeitraum aktuell sind.

Wo es heute steht

Gegen aktuelle Frontier-Tier-Modelle sitzt GPT-5.5 bei den meisten General-Purpose-Workloads in der Spitzengruppe der verfügbaren Optionen. Das Intelligence-Leaderboard verfolgt die vergleichende Position gegenüber Anthropics stärkstem Tier und Googles Äquivalent.

Für Content-Workflows ist das Modell ein glaubwürdiger Standard für neue Entwicklungen. Für Datenextraktion helfen die verfeinerten Vision-Fähigkeiten bei Dokumentkategorien, die den vorherigen Generationen Probleme bereitet haben.

Wo die Unbekannten liegen

Die größte Unbekannte bei einem frisch veröffentlichten Modell ist seine Long-Tail-Fehleroberfläche. Gängige Workloads wurden getestet und funktionieren gut. Grenzfälle, die in der Praxis noch nicht aufgetreten sind, können Überraschungen produzieren. Planen Sie für die ersten Wochen nach der Adoption mit einer höheren Rate an unerwartetem Verhalten, als Sie von einem reiferen Snapshot erwarten würden.

Halluzinationen bei Nischenthemen persistieren. Die Reduktion gegenüber 5.4 ist real, aber inkrementell. Behandeln Sie jede spezifische faktische Behauptung als Hypothese, bis sie verifiziert ist.

Long-Context-Kohärenz hat weiterhin eine Obergrenze. Jenseits von ungefähr dem hohen fünfstelligen Token-Bereich dichter Eingabe beginnen Constraints, die sehr früh im Prompt gesetzt wurden, zu driften. Strukturieren Sie lange Prompts so, dass kritische Constraints nahe dem Generierungspunkt wiederholt werden.

Das Pro-Tier gewinnt weiterhin bei den schwierigsten Reasoning-Tasks. Base 5.5 ist ein starker Standard für die meiste Arbeit, aber nicht das Modell, das Sie wählen, wenn die Workload tiefe mehrstufige Planung unter echter Unsicherheit erfordert.

Wann man 5.5 übernehmen sollte

Die klaren Fälle:

Sie starten neue Entwicklung und möchten gegen die aktuellste Generation bauen. Die Verbesserungen gegenüber 5.4 summieren sich über die Lebensdauer des Produkts.

Ihre aktuelle Workload stößt an die Grenzen von Base 5.4 — Halluzinationsraten, die problematisch sind, Structured-Output-Fehler, die Cleanup-Zeit kosten, Long-Context-Drift, der die Produktionsqualität beeinträchtigt. 5.5 ist bei jedem dieser Punkte inkrementell besser.

Sie haben ein gründliches Evaluations-Harness und können das Verhalten der neuen Generation auf Ihrer spezifischen Workload charakterisieren, bevor Sie Produktivtraffic verschieben. Das Early-Life-Risiko ist viel kleiner, wenn Sie wissen, wonach Sie suchen müssen.

Wann man bei 5.4 bleiben sollte

Überspringen Sie die Migration, wenn Ihre aktuelle Workload gut auf 5.4 läuft und Sie keine Evaluationskapazität haben, um 5.5 sorgfältig zu charakterisieren. Die konservative Antwort für eine stabile Produktiv-Workload ist zu warten, bis sich die Patch-Welle gesetzt hat.

Überspringen Sie es für Workloads, bei denen die Kosten jeder Verhaltensänderung hoch und die Gewinne marginal sind. Pinnen Sie einen 5.4-datierten Snapshot und migrieren Sie, wenn sich die Kalkulation ändert.

Wann man auf den datierten Snapshot warten sollte

Wenn Sie 5.5 übernehmen möchten, aber nicht auf dem gleitenden Slug, ist das natürliche Ziel der datierte gpt-5.5-2026-04-23-Snapshot. Dies gibt Ihnen die neue Generation mit der Reproduzierbarkeit einer gepinnten Version. Der Tradeoff ist, dass die Floating-Slug-Patches, die in den ersten Wochen nach dem Release landen, nicht auf dem datierten Snapshot erscheinen werden.

Alternativen

Für Workloads, die Spitzenqualität über OpenAI-Ökosystem-Fit priorisieren, verdienen die neuesten Angebote von Anthropic und Google einen Head-to-Head-Vergleich auf Ihrer spezifischen Workload. Generationsreleases von verschiedenen Anbietern treffen oft innerhalb von Wochen aufeinander ein, und die Rankings verschieben sich ständig.

Für kostensensitive Workloads erfasst das 5.5-Mini-Tier den größten Teil des Werts der neuen Generation zu einem Bruchteil der Base-Tier-Kosten.

Letzte technische Überprüfung: 2026-05-22 — Tokonomix.ai

gpt-5.5 — illustration 2
Letzter automatisierter Test
7. Sept. 2026 · 08:05 UTC · Geschwindigkeits-Benchmark
P50-Latenz
983 ms
P95-Latenz
1200 ms
Fehler
0 / 6 Läufe
Zuletzt geprüft von Tokonomix-Team·26. Mai 2026