
Hinweis — vorausschauendes Profil. Diese Seite beschreibt ein Modell, das sich entweder in einer frühen Preview-Phase befindet, angekündigt, aber noch nicht allgemein verfügbar ist, oder anhand von Roadmap-Signalen projiziert wurde. Spezifikationen und Fähigkeiten können sich vor dem öffentlichen Launch noch ändern. Die Live-Benchmark-Daten auf dieser Seite spiegeln den Endpunkt wider, den unser Test-Harness heute erreichen kann.
GPT-5.4 ist OpenAIs Konsolidierungs-Release in der Mitte des Zyklus innerhalb der breiteren 5.x-Familie. Es ist kein grundlegender Architekturwechsel, kein dramatischer Fähigkeitssprung — was es ist, ist eine sorgfältige Verfeinerung jener Dinge, die Teams seit den früheren Generationen im Produktivbetrieb gestört haben. Bessere Befolgung von Anweisungen in Grenzfällen. Strafferes Verhalten bei strukturierten Ausgaben. Reduzierte Halluzinationen bei jenen Nischenthemen, die immer wieder in Support-Tickets landen. Ein Release der Sorte, die Ingenieure mehr mögen als Marketing-Leute.
Was 5.4 tatsächlich ändert
Die zentralen Verbesserungen kommen leise daher. Die Halluzinationsrate bei Out-of-Distribution-Fakten ist im Vergleich zu 5.2 und 5.3 gesunken. Die Reduktion ist nicht null, und das Modell wird weiterhin selbstbewusst plausibel klingende Behauptungen zu obskuren Themen fabrizieren. Aber die Rate, mit der dies bei Routineanfragen geschieht, ist spürbar gesunken, was sich in der Produktion in weniger korrekturbedürftigen Support-Fällen niederschlägt.
Strukturierte Ausgaben sind verlässlicher. JSON-Mode-Ausgaben gegen tief verschachtelte Schemata liefern konsistenter gültige Ergebnisse als in den früheren Generationen. Function-Calling mit parallelen Tool-Aufrufen verhält sich vorhersehbarer. Die Art von Grenzfällen, die früher defensives Parsen erforderten — fast gültiges JSON, leicht abweichende Schema-Treue — kommt seltener vor.
Die Kohärenz über lange Kontexte ist inkrementell besser. Das Modell behält Vorgaben, die früh in langen Prompts gesetzt werden, zuverlässiger bei als die Vorgängergeneration. Für Workflows, die umfangreiche Anweisungen in den System-Prompt packen, gehen in langen Läufen weniger Anweisungen verloren.
Keine dieser Verbesserungen ist für sich genommen dramatisch. Zusammen machen sie 5.4 zur richtigen Standardwahl für Teams, die auf „die Version, die das tut, worum wir die vorherige gebeten haben" gewartet haben.
Unter der Haube
GPT-5.4 ist ein Transformer-Decoder, der verschachtelte Text- und Bildeingaben akzeptiert, mit reiner Textausgabe. Die Vision-Fähigkeiten decken die üblichen Aufgabenfelder ab: Verständnis von Diagrammen und Schaubildern, OCR-artige Textextraktion, Parsing von Dokumentlayouts, Szenenbeschreibung. Die Ausgabe bleibt rein textbasiert — keine Bildgenerierung, kein Audio über diesen Endpunkt.
OpenAI hat weder Parameteranzahlen noch Details zum Expert-Routing oder präzise architektonische Änderungen gegenüber 5.2 und 5.3 veröffentlicht. Das Modell akzeptiert längere Kontextfenster als die früheren Generationen der Familie, wobei die praktische Kohärenzobergrenze bei schwierigen Reasoning-Aufgaben unterhalb des nominellen Token-Limits liegt.
Die Tokenisierung verwendet das Standard-BPE-Vokabular von GPT-5. Bildeingaben werden kachelweise mit festen Token-Kosten pro Kachel kodiert. Der Trainings-Cutoff liegt für diese Generation Anfang 2026, was die Grenze dessen, was das Modell über aktuelle Ereignisse und gegenwärtige Bibliotheksversionen weiß, gegenüber den Vorgängergenerationen um mehrere Monate nach vorn verschiebt.
Wo es heute steht
Für allgemeine Arbeit — Chat, strukturierte Ausgaben, vision-gestützte Analyse, Agent-Loops — bewegt sich GPT-5.4 in der obersten Liga der derzeit produktionsreifen Modelle. Das Intelligence-Leaderboard verfolgt die vergleichende Positionierung gegenüber Anthropics stärkster Stufe und dem entsprechenden Google-Angebot. Die Rangfolgen verschieben sich wöchentlich mit neuen Releases, aber 5.4 ist in den meisten Kategorien konkurrenzfähig, ohne in einer einzelnen zu dominieren.
Das Modell ist die richtige Standardwahl für neue Entwicklungsarbeit auf dem OpenAI-Stack, sofern keine spezifischen Gründe vorliegen, einen älteren Snapshot zu pinnen, eine kleinere Stufe aus Kostengründen zu fahren oder für anspruchsvolles Reasoning auf die Pro-Stufe zu eskalieren.
Für Content-Workflows zahlt sich die verbesserte Long-Context-Kohärenz bei Workflows mit umfangreichen Style-Guides aus. Für Datenextraktion reduziert das straffere Verhalten bei strukturierten Ausgaben den nachgelagerten Bereinigungsaufwand.
Wo die Grenzen weiterhin liegen
Halluzinationen sind reduziert, aber nicht eliminiert. Das Modell ist bei Allgemeinwissen gut kalibriert und bei breit dokumentiertem technischen Material zuverlässig selbstsicher. Bei obskuren historischen Ereignissen, jüngeren Nischenpublikationen und kleinen Organisationen wird es weiterhin fabrizieren. Behandeln Sie jede konkrete Faktenbehauptung als Hypothese, bis sie verifiziert ist.
Sprachen mit geringen Ressourcen bleiben schwächer als die großen europäischen und ostasiatischen. Die Lücke hat sich über die Generationen hinweg verringert, ist aber nicht geschlossen. Führen Sie Stichprobenprüfungen in jeder Zielsprache durch, bevor Sie ausrollen.
Die Long-Context-Kohärenz ist gut, aber nicht unbegrenzt. Jenseits von rund 100k Tokens dichter Eingabe beginnen sehr früh im Prompt gesetzte Vorgaben zu driften. Strukturieren Sie lange Prompts so, dass kritische Vorgaben in der Nähe des Generierungspunkts wiederholt werden.
Die Pro-Stufe gewinnt weiterhin bei den schwierigsten Reasoning-Aufgaben. Das Basis-5.4 ist eine hervorragende Standardwahl für die meisten Arbeiten, ist aber nicht das Modell, das man wählt, wenn die Aufgabe tiefe mehrstufige Planung unter echter Unsicherheit erfordert.
Wann 5.4 die richtige Standardwahl ist
Wählen Sie das Basis-5.4 für allgemeine Chats, Content-Generierung, strukturierte Ausgaben, vision-gestützte Analyse und Agent-Loops moderater Komplexität. Es ist die einfachste Single-Endpoint-Wahl für Teams, deren KI-Last überwiegend breit und nicht überwiegend schwer ist.
Wählen Sie es für die Migration von früheren 5.x-Generationen, bei denen die Einschränkungen jener Generationen Reibung verursacht haben. Die Verbesserungen sind real und summieren sich bei hohem Traffic-Volumen.
Für Content-Workflows am Long-Form-Ende des Spektrums ist 5.4 die richtige Standardwahl. Für gemischte Text-und-Vision-Dokumenten-Workflows machen die Vision-Fähigkeit plus die Verlässlichkeit bei strukturierten Ausgaben es zu einer natürlichen Wahl.
Wann etwas anderes besser passt
Für interaktives Autocomplete und kostenoptimierten Batch-Traffic bewältigen die mini- und nano-Stufen innerhalb der 5.4-Familie die Last bei geringeren Kosten und niedrigerer Latenz.
Für anspruchsvolle Reasoning-Lasten — Agent-Loops mit tiefer Planung, strukturierte Ausgaben gegen hochkomplexe Schemata, Analysen, die ein sorgfältiges Abwägen vieler Faktoren erfordern — eskalieren Sie auf die Pro-Stufe.
Für code-spezifische Lasten sind die Codex-Varianten in der breiteren 5.x-Familie besser abgestimmt. Das Basis-5.4 produziert funktionsfähigen Code, erreicht aber bei der Idiomqualität nicht das Niveau eines Code-Spezialisten.
Für reproduzierbarkeitssensitive Lasten pinnen Sie den datierten Snapshot gpt-5.4-2026-03-05, anstatt den schwebenden gpt-5.4-Slug zu nutzen.
Alternativen
Für Lasten, bei denen das Spitzenreasoning wichtiger ist als die Passung ins OpenAI-Ökosystem, verdienen Anthropics stärkste Reasoning-Stufe und die äquivalenten Google-Angebote einen direkten Head-to-Head-Vergleich auf Ihrer spezifischen Arbeitslast.
Für air-gapped Deployments oder solche mit strengen Residency-Anforderungen liefern die Open-Weights-Frontier-Modelle die Residency-Geschichte, die kein OpenAI-Endpunkt bietet. Die Genauigkeitslücke hat sich erheblich verringert und ist für die meisten Lasten praktikabel.
Für kostenoptimierten Routine-Traffic hält der Betrieb eines Routers über Basis-5.4 und kleinere Geschwister-Stufen die Rechnung beherrschbar, während der Zugriff auf die volle Fähigkeit erhalten bleibt, wenn es darauf ankommt.
Letzte technische Überprüfung: 2026-05-22 — Tokonomix.ai
