Zum Inhalt
Tier A — Frontier
Läuft in:USErstellt in:United States
OpenAI

gpt-5.4

Tier A — Frontier

Tokonomix-Redaktionsteam·Geprüft von Mes Kalkan··

GPT-5.4 ist ein großes Sprachmodell, das von OpenAI für allgemeine Textgenerierungsaufgaben entwickelt wurde. Es ist darauf ausgelegt, menschenähnliche Texte für ein breites Anwendungsspektrum zu verarbeiten und zu generieren, darunter Content-Erstellung, Beantwortung von Fragen, Code-Generierung, Analyse und dialogbasierte Interaktionen. Das Modell verfügt über Standardfunktionen zur Textgenerierung, nimmt Texteingaben entgegen und erzeugt darauf basierend kohärente Antworten anhand der während des Trainings erlernten Muster. Als Teil der GPT-Serie von OpenAI setzt dieses Modell die in früheren Generationen etablierte Architektur fort und nutzt transformerbasierte neuronale Netze zur Verarbeitung sequenzieller Daten. Die Größe des Kontextfensters von GPT-5.4 wurde nicht öffentlich bekannt gegeben, es ist jedoch davon auszugehen, dass es mehrteilige Dialoge und mäßig lange Dokumente verarbeiten kann. Das Modell verarbeitet Text mittels Tokenisierung und erzeugt Ausgaben über probabilistische Sampling-Methoden, wie sie bei autoregressiven Sprachmodellen üblich sind. GPT-5.4 fügt sich in das breitere Modellportfolio von OpenAI als Standardangebot für Textgenerierungs-Workloads ein. Es ist auf Nutzer ausgerichtet, die zuverlässige Funktionen zur Verarbeitung natürlicher Sprache benötigen, ohne spezialisierte Merkmale wie multimodale Eingaben, Function Calling oder erweiterte Kontextverarbeitung. Das Modell ist über die API-Infrastruktur von OpenAI zugänglich und lässt sich so in unterschiedliche Anwendungen und Dienste integrieren. Wie andere Modelle der GPT-Familie wurde es mit vielfältigen Textdaten aus dem Internet trainiert, wobei der Anbieter spezifische Trainingsdetails und Datensatzzusammensetzungen nicht vollständig offengelegt hat.

GPT-5.4 positioniert sich als solides Allzweck-Sprachmodell im Tier-A-Segment von OpenAI und richtet sich an Teams, die zuverlässige Textgenerierung ohne experimentelle Sonderfunktionen suchen.

Tokonomix Redaktionsanalyse
Abschnitt 01

Geschwindigkeitsanalyse

Latenz über alle Benchmark-Läufe gemessen. P50 (Median) und P95 (95. Perzentil) zeigen ein realistisches Bild der Antwortgeschwindigkeit bei normaler und Spitzenlast.

P50-Latenz (Median)P95-Latenz101 runs
449148825273566460508-1609-10ms
Abschnitt 02

Qualitätswerte

Wie sich dieses Modell je Prompt-Kategorie zum übrigen Feld verhält, aus einem paarweisen Fit über dieselben Prompts. Die rohe Jury-Wertung steht unter jeder Zahl.

65%
Codegenerierung
Jury-Mittel 98
90%
Kreativ
Jury-Mittel 96
57%
Faktisch
Jury-Mittel 86
68%
Mehrsprachig
Jury-Mittel 99
74%
Schlussfolgern
Jury-Mittel 99

Gewinnrate je Kategorie: wie oft dieses Modell ein durchschnittliches Modell bei einem Prompt dieser Kategorie schlägt. 50% ist der Durchschnitt, keine schlechte Note. Es ist kein Prozentsatz richtiger Antworten.

Abschnitt 03

Preisverlauf

Direkte Provider-Tarife pro Million Tokens, plus eine typische Gesprächskostenschätzung.

💰
API-Tarife — gpt-5.4
$2.50 pro 1M Input-Tokens
$15.00 pro 1M Output-Tokens
≈ $0.0045 pro typischem Gespräch (800 Tokens)
Input- vs. Output-Preis (pro 1M Tokens)
pro 1M Input-Tokens$2.50
pro 1M Output-Tokens$15.00

Pricing over time

Input & output per 1M tokens · step-line = price changes

$2.50

input / 1M

— stable

$15.00

output / 1M

— stable

2026-05-242026-07-262026-09-06
Input
Output
Price change
⟳ synced weekly
Abschnitt 04

Tokens pro Sekunde

Durchsatz in Tokens pro Sekunde, abgeleitet aus gemessener P50-Latenz. Höhere Werte sind besser; Schwankungen spiegeln die Provider-seitige Last wider.

Durchsatz (Tokens / s)230 / avg 283
44172

Geschätzt aus P50-Latenz × 200 Output-Tokens — die absolute Zahl hängt von dieser Annahme ab; entscheidend ist der Trend.

Abschnitt 05

Stärken & Schwächen

Basierend auf Benchmark-Ergebnissen und aggregiertem Community-Feedback zu realen Anwendungsfällen.

Stärken

Starke Textgenerierung über viele DomänenRobuste Mehrfachdialog-FähigkeitSolide Code-GenerierungBreite SprachabdeckungEinfache Integration via OpenAI-APITier-A-Qualität für ProduktivumgebungenGute Analyse- und Zusammenfassungs-QualitätZuverlässige Frage-Antwort-Performance

Schwächen

Kontextfenster nicht öffentlich dokumentiertKeine bestätigte multimodale EingabeFunction Calling nicht offiziell bestätigtWissensstichtag nicht transparent kommuniziert
Abschnitt 06

Fähigkeiten

toolssource: litellmvisionjson modepdf inputreasoningjson schemaparallel toolsprompt cachingmax output tokens: 128000
Abschnitt 07

Häufig gestellte Fragen

Ja, als Tier-A-Modell von OpenAI ist es auf stabile Textgenerierung ausgelegt und über die offizielle API skalierbar einsetzbar. Für regulierte Branchen sollten zusätzlich Compliance- und Datenschutzfragen mit OpenAI geklärt werden.

Für die meisten produktiven Text-Workloads ist GPT-5.4 eine pragmatische Wahl, sofern man auf detaillierte Spezifikationen wie Kontextfenster oder Multimodalität verzichten kann. Wer transparente Limits braucht, sollte Alternativen mit dokumentierten Specs prüfen.

Tokonomix Verdict
Abschnitt 08

Verfügbarkeit

Verfügbarkeit

Wie oft dieses Modell antwortet, wenn wir es aufrufen — gemessen anhand echter API-Anfragen und Live-Tests der letzten 30 Tage. Dies ist unabhängig von der Qualität: Diese Zahlen zeigen nur, ob das Modell antwortet, nicht wie gut die Antwort ist.

Letzte 7 Tage

100.0%

n=13

Letzte 30 Tage

100.0%

n=25

Mediane Antwortzeit

9,900ms

n=25

Basierend auf 405 Messungen in den letzten 30 Tagen.

Technische Details

Nur echte API-Aufrufe und Live-Test-Anfragen werden gezählt — interne Proben und Benchmark-Läufe sind ausgeschlossen.

Aufrufe mit einem eigenen API-Schlüssel (BYOK) sind ausgeschlossen: Diese Fehler sind schlüsselspezifisch und kein Zeichen für Modellausfälle.

Fehlgeschlagene Aufrufe werden NICHT in Qualitätswerten berücksichtigt — Qualität wird nur für erfolgreiche Antworten gemessen. Verfügbarkeit und Qualität sind unabhängige Signale.

Mediane Antwortzeit (p50) über erfolgreiche Aufrufe mit aufgezeichneter Dauer. Ausreißer beeinflussen den Median weniger als den Durchschnitt.

Gesamte Aufrufe (30d)

25

OK-Antworten (30d)

25

Gesamte Aufrufe (7d)

13

OK-Antworten (7d)

13

Abschnitt 09

Tokonomix-Benchmark-Urteile

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-596/100 · 50 runs
49 correct0 partial1 wrong98% accuracy
2026-09-06

Second benchmark window shows stable performance across all metrics

GPT-5.4 demonstrates consistent performance in its second benchmark window, with no significant changes detected across any measured dimensions. All previously introduced capabilities including tools, vision, json_mode, pdf_input, reasoning, json_schema, parallel_tools, and prompt_caching remain stable and functional. This stability period suggests the model has reached a mature operational state following its initial deployment. Users can expect reliable and predictable behavior across all supported features. The lack of performance variance indicates strong engineering practices in maintaining model consistency. For production deployments, this stability is a positive signal that the model's behavior will remain consistent over time. Organizations already using GPT-5.4 should not expect any disruption to existing workflows or integration patterns. While no improvements were observed in this window, the absence of regressions is noteworthy. Teams evaluating GPT-5.4 can proceed with confidence that the feature set and performance characteristics documented in the previous window remain accurate and representative of current capabilities.

Qualität

Latenz p50

Testläufe

0

No performance regressions detected All capabilities remain stable
Abschnitt 10

Vollständiges Modellprofil

gpt-5.4 — illustration 1
GPT-5.4: die Konsolidierungs-Generation

Hinweis — vorausschauendes Profil. Diese Seite beschreibt ein Modell, das sich entweder in einer frühen Preview-Phase befindet, angekündigt, aber noch nicht allgemein verfügbar ist, oder anhand von Roadmap-Signalen projiziert wurde. Spezifikationen und Fähigkeiten können sich vor dem öffentlichen Launch noch ändern. Die Live-Benchmark-Daten auf dieser Seite spiegeln den Endpunkt wider, den unser Test-Harness heute erreichen kann.

GPT-5.4 ist OpenAIs Konsolidierungs-Release in der Mitte des Zyklus innerhalb der breiteren 5.x-Familie. Es ist kein grundlegender Architekturwechsel, kein dramatischer Fähigkeitssprung — was es ist, ist eine sorgfältige Verfeinerung jener Dinge, die Teams seit den früheren Generationen im Produktivbetrieb gestört haben. Bessere Befolgung von Anweisungen in Grenzfällen. Strafferes Verhalten bei strukturierten Ausgaben. Reduzierte Halluzinationen bei jenen Nischenthemen, die immer wieder in Support-Tickets landen. Ein Release der Sorte, die Ingenieure mehr mögen als Marketing-Leute.

Was 5.4 tatsächlich ändert

Die zentralen Verbesserungen kommen leise daher. Die Halluzinationsrate bei Out-of-Distribution-Fakten ist im Vergleich zu 5.2 und 5.3 gesunken. Die Reduktion ist nicht null, und das Modell wird weiterhin selbstbewusst plausibel klingende Behauptungen zu obskuren Themen fabrizieren. Aber die Rate, mit der dies bei Routineanfragen geschieht, ist spürbar gesunken, was sich in der Produktion in weniger korrekturbedürftigen Support-Fällen niederschlägt.

Strukturierte Ausgaben sind verlässlicher. JSON-Mode-Ausgaben gegen tief verschachtelte Schemata liefern konsistenter gültige Ergebnisse als in den früheren Generationen. Function-Calling mit parallelen Tool-Aufrufen verhält sich vorhersehbarer. Die Art von Grenzfällen, die früher defensives Parsen erforderten — fast gültiges JSON, leicht abweichende Schema-Treue — kommt seltener vor.

Die Kohärenz über lange Kontexte ist inkrementell besser. Das Modell behält Vorgaben, die früh in langen Prompts gesetzt werden, zuverlässiger bei als die Vorgängergeneration. Für Workflows, die umfangreiche Anweisungen in den System-Prompt packen, gehen in langen Läufen weniger Anweisungen verloren.

Keine dieser Verbesserungen ist für sich genommen dramatisch. Zusammen machen sie 5.4 zur richtigen Standardwahl für Teams, die auf „die Version, die das tut, worum wir die vorherige gebeten haben" gewartet haben.

Unter der Haube

GPT-5.4 ist ein Transformer-Decoder, der verschachtelte Text- und Bildeingaben akzeptiert, mit reiner Textausgabe. Die Vision-Fähigkeiten decken die üblichen Aufgabenfelder ab: Verständnis von Diagrammen und Schaubildern, OCR-artige Textextraktion, Parsing von Dokumentlayouts, Szenenbeschreibung. Die Ausgabe bleibt rein textbasiert — keine Bildgenerierung, kein Audio über diesen Endpunkt.

OpenAI hat weder Parameteranzahlen noch Details zum Expert-Routing oder präzise architektonische Änderungen gegenüber 5.2 und 5.3 veröffentlicht. Das Modell akzeptiert längere Kontextfenster als die früheren Generationen der Familie, wobei die praktische Kohärenzobergrenze bei schwierigen Reasoning-Aufgaben unterhalb des nominellen Token-Limits liegt.

Die Tokenisierung verwendet das Standard-BPE-Vokabular von GPT-5. Bildeingaben werden kachelweise mit festen Token-Kosten pro Kachel kodiert. Der Trainings-Cutoff liegt für diese Generation Anfang 2026, was die Grenze dessen, was das Modell über aktuelle Ereignisse und gegenwärtige Bibliotheksversionen weiß, gegenüber den Vorgängergenerationen um mehrere Monate nach vorn verschiebt.

Wo es heute steht

Für allgemeine Arbeit — Chat, strukturierte Ausgaben, vision-gestützte Analyse, Agent-Loops — bewegt sich GPT-5.4 in der obersten Liga der derzeit produktionsreifen Modelle. Das Intelligence-Leaderboard verfolgt die vergleichende Positionierung gegenüber Anthropics stärkster Stufe und dem entsprechenden Google-Angebot. Die Rangfolgen verschieben sich wöchentlich mit neuen Releases, aber 5.4 ist in den meisten Kategorien konkurrenzfähig, ohne in einer einzelnen zu dominieren.

Das Modell ist die richtige Standardwahl für neue Entwicklungsarbeit auf dem OpenAI-Stack, sofern keine spezifischen Gründe vorliegen, einen älteren Snapshot zu pinnen, eine kleinere Stufe aus Kostengründen zu fahren oder für anspruchsvolles Reasoning auf die Pro-Stufe zu eskalieren.

Für Content-Workflows zahlt sich die verbesserte Long-Context-Kohärenz bei Workflows mit umfangreichen Style-Guides aus. Für Datenextraktion reduziert das straffere Verhalten bei strukturierten Ausgaben den nachgelagerten Bereinigungsaufwand.

Wo die Grenzen weiterhin liegen

Halluzinationen sind reduziert, aber nicht eliminiert. Das Modell ist bei Allgemeinwissen gut kalibriert und bei breit dokumentiertem technischen Material zuverlässig selbstsicher. Bei obskuren historischen Ereignissen, jüngeren Nischenpublikationen und kleinen Organisationen wird es weiterhin fabrizieren. Behandeln Sie jede konkrete Faktenbehauptung als Hypothese, bis sie verifiziert ist.

Sprachen mit geringen Ressourcen bleiben schwächer als die großen europäischen und ostasiatischen. Die Lücke hat sich über die Generationen hinweg verringert, ist aber nicht geschlossen. Führen Sie Stichprobenprüfungen in jeder Zielsprache durch, bevor Sie ausrollen.

Die Long-Context-Kohärenz ist gut, aber nicht unbegrenzt. Jenseits von rund 100k Tokens dichter Eingabe beginnen sehr früh im Prompt gesetzte Vorgaben zu driften. Strukturieren Sie lange Prompts so, dass kritische Vorgaben in der Nähe des Generierungspunkts wiederholt werden.

Die Pro-Stufe gewinnt weiterhin bei den schwierigsten Reasoning-Aufgaben. Das Basis-5.4 ist eine hervorragende Standardwahl für die meisten Arbeiten, ist aber nicht das Modell, das man wählt, wenn die Aufgabe tiefe mehrstufige Planung unter echter Unsicherheit erfordert.

Wann 5.4 die richtige Standardwahl ist

Wählen Sie das Basis-5.4 für allgemeine Chats, Content-Generierung, strukturierte Ausgaben, vision-gestützte Analyse und Agent-Loops moderater Komplexität. Es ist die einfachste Single-Endpoint-Wahl für Teams, deren KI-Last überwiegend breit und nicht überwiegend schwer ist.

Wählen Sie es für die Migration von früheren 5.x-Generationen, bei denen die Einschränkungen jener Generationen Reibung verursacht haben. Die Verbesserungen sind real und summieren sich bei hohem Traffic-Volumen.

Für Content-Workflows am Long-Form-Ende des Spektrums ist 5.4 die richtige Standardwahl. Für gemischte Text-und-Vision-Dokumenten-Workflows machen die Vision-Fähigkeit plus die Verlässlichkeit bei strukturierten Ausgaben es zu einer natürlichen Wahl.

Wann etwas anderes besser passt

Für interaktives Autocomplete und kostenoptimierten Batch-Traffic bewältigen die mini- und nano-Stufen innerhalb der 5.4-Familie die Last bei geringeren Kosten und niedrigerer Latenz.

Für anspruchsvolle Reasoning-Lasten — Agent-Loops mit tiefer Planung, strukturierte Ausgaben gegen hochkomplexe Schemata, Analysen, die ein sorgfältiges Abwägen vieler Faktoren erfordern — eskalieren Sie auf die Pro-Stufe.

Für code-spezifische Lasten sind die Codex-Varianten in der breiteren 5.x-Familie besser abgestimmt. Das Basis-5.4 produziert funktionsfähigen Code, erreicht aber bei der Idiomqualität nicht das Niveau eines Code-Spezialisten.

Für reproduzierbarkeitssensitive Lasten pinnen Sie den datierten Snapshot gpt-5.4-2026-03-05, anstatt den schwebenden gpt-5.4-Slug zu nutzen.

Alternativen

Für Lasten, bei denen das Spitzenreasoning wichtiger ist als die Passung ins OpenAI-Ökosystem, verdienen Anthropics stärkste Reasoning-Stufe und die äquivalenten Google-Angebote einen direkten Head-to-Head-Vergleich auf Ihrer spezifischen Arbeitslast.

Für air-gapped Deployments oder solche mit strengen Residency-Anforderungen liefern die Open-Weights-Frontier-Modelle die Residency-Geschichte, die kein OpenAI-Endpunkt bietet. Die Genauigkeitslücke hat sich erheblich verringert und ist für die meisten Lasten praktikabel.

Für kostenoptimierten Routine-Traffic hält der Betrieb eines Routers über Basis-5.4 und kleinere Geschwister-Stufen die Rechnung beherrschbar, während der Zugriff auf die volle Fähigkeit erhalten bleibt, wenn es darauf ankommt.

Letzte technische Überprüfung: 2026-05-22 — Tokonomix.ai

gpt-5.4 — illustration 2
Letzter automatisierter Test
10. Sept. 2026 · 08:02 UTC · Geschwindigkeits-Benchmark
P50-Latenz
871 ms
P95-Latenz
910 ms
Fehler
0 / 6 Läufe
Zuletzt geprüft von Tokonomix-Team·26. Mai 2026