Zum Inhalt
Tier B — Produktion
Läuft in:USErstellt in:United States
OpenAI

gpt-5.4-2026-03-05

Tier B — Produktion

Tokonomix-Redaktionsteam·Geprüft von Mes Kalkan··

GPT-5.4-2026-03-05 ist ein großes Sprachmodell, das von OpenAI entwickelt und im März 2026 veröffentlicht wurde. Dieses Modell stellt eine Fortsetzung der GPT-Serienarchitektur von OpenAI dar und bietet standardmäßige Textgenerierungsfunktionen für eine Reihe von Aufgaben der natürlichen Sprachverarbeitung. Das Modell kann Text über mehrere Domänen hinweg verarbeiten und generieren, einschließlich kreativem Schreiben, Analyse, Fragebeantwortung und Code-Generierung. Die Größe des Kontextfensters wurde von OpenAI bislang nicht öffentlich bekannt gegeben. Das Modell ist für allgemeine Textgenerierungsanwendungen konzipiert, bei denen Nutzer kohärente, kontextuell angemessene Antworten über diverse Themenbereiche hinweg benötigen. Es folgt den instruktionsbasierten Prompting-Mustern, die in früheren GPT-Serienmodellen etabliert wurden, wodurch Nutzer die Ausgabe durch natürlichsprachliche Anweisungen steuern können. Die technische Architektur baut auf transformerbasierten neuronalen Netzwerken auf, wobei spezifische Parameterzahlen und Trainingsdetails von OpenAI nicht öffentlich verfügbar gemacht wurden. Innerhalb der Modellpalette von OpenAI gehört GPT-5.4-2026-03-05 zu den neueren Veröffentlichungen des Anbieters, folgt auf die GPT-4-Serie und repräsentiert die GPT-5-Generation. Die Versionsnummer deutet darauf hin, dass es sich um ein Punktrelease innerhalb der GPT-5-Familie handelt, das möglicherweise Verfeinerungen oder Anpassungen gegenüber früheren GPT-5-Iterationen enthält. Nutzer können über die API-Infrastruktur von OpenAI neben den anderen verfügbaren Modellen des Unternehmens auf dieses Modell zugreifen, wo es als Option für Anwendungen dient, die Sprachmodellfähigkeiten der aktuellen Generation erfordern.

GPT-5.4-2026-03-05 markiert OpenAIs neueste Iteration der GPT-5-Reihe und bringt die bewährte Transformer-Architektur in die nächste Generation.

Tokonomix Modellanalyse, März 2026
Abschnitt 01

Geschwindigkeitsanalyse

Latenz über alle Benchmark-Läufe gemessen. P50 (Median) und P95 (95. Perzentil) zeigen ein realistisches Bild der Antwortgeschwindigkeit bei normaler und Spitzenlast.

P50-Latenz (Median)P95-Latenz96 runs
457115818592560326108-2209-14ms
Abschnitt 02

Qualitätswerte

Wie sich dieses Modell je Prompt-Kategorie zum übrigen Feld verhält, aus einem paarweisen Fit über dieselben Prompts. Die rohe Jury-Wertung steht unter jeder Zahl.

74%
Codegenerierung
Jury-Mittel 99
89%
Kreativ
Jury-Mittel 95
55%
Faktisch
Jury-Mittel 80
64%
Mehrsprachig
Jury-Mittel 99
74%
Schlussfolgern
Jury-Mittel 98

Gewinnrate je Kategorie: wie oft dieses Modell ein durchschnittliches Modell bei einem Prompt dieser Kategorie schlägt. 50% ist der Durchschnitt, keine schlechte Note. Es ist kein Prozentsatz richtiger Antworten.

Abschnitt 03

Preise

Was Sie pro Million Tokens zahlen, wenn Sie dieses Modell über Tokonomix nutzen, plus eine Schätzung für ein typisches Gespräch.

💰
API-Tarife — gpt-5.4-2026-03-05
$3.25 pro 1M Input-Tokens
$19.50 pro 1M Output-Tokens
≈ $0.0058 pro typischem Gespräch (800 Tokens)
Input- vs. Output-Preis (pro 1M Tokens)
pro 1M Input-Tokens$3.25
pro 1M Output-Tokens$19.50
Abschnitt 04

Tokens pro Sekunde

Durchsatz in Tokens pro Sekunde, abgeleitet aus gemessener P50-Latenz. Höhere Werte sind besser; Schwankungen spiegeln die Provider-seitige Last wider.

Durchsatz (Tokens / s)235 / avg 294
434142

Geschätzt aus P50-Latenz × 200 Output-Tokens — die absolute Zahl hängt von dieser Annahme ab; entscheidend ist der Trend.

Abschnitt 05

Stärken & Schwächen

Basierend auf Benchmark-Ergebnissen und aggregiertem Community-Feedback zu realen Anwendungsfällen.

Stärken

Aktuelle GPT-5-GenerationVielseitige TextgenerierungInstruktionsbasierte SteuerungCode-Generierung integriertDomänenübergreifende AnwendbarkeitOpenAI API-IntegrationAnalyse- und FragebeantwortungKreatives Schreiben möglich

Schwächen

Kontextfenster nicht offengelegtParameteranzahl unbekanntMultimodale Fähigkeiten ungeklärtTrainingsdaten nicht dokumentiert
Abschnitt 06

Fähigkeiten

toolssource: litellmvisionjson modepdf inputreasoningjson schemaparallel toolsprompt cachingmax output tokens: 128000
Abschnitt 07

Häufig gestellte Fragen

OpenAI hat die Kontextfenstergröße für dieses Modell bisher nicht öffentlich kommuniziert. Für produktive Einsätze sollte diese Information direkt bei OpenAI erfragt werden, da sie entscheidend für die Verarbeitung längerer Dokumente ist.

Für Anwendungen, die auf die neueste GPT-Generation setzen, bietet dieses Modell eine solide Grundlage – vorausgesetzt, die fehlenden technischen Spezifikationen passen zum Einsatzszenario.

Tokonomix Editorial Team
Abschnitt 08

Verfügbarkeit

Verfügbarkeit

Noch keine Messdaten

Es wurden noch nicht genug API-Aufrufe aufgezeichnet, um Verfügbarkeitsstatistiken für dieses Modell anzuzeigen. Daten erscheinen, sobald das Modell Live-Traffic erhält.

Abschnitt 09

Tokonomix-Benchmark-Urteile

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-595/100 · 55 runs
52 correct1 partial2 wrong95% accuracy
2026-09-13

Quality decline and latency spike with category composition shift

The gpt-5.4-2026-03-05 release shows a concerning 8.9 point drop in overall quality score to 82.5, accompanied by a 58% latency increase to 2586ms at the median. The benchmark window reveals a significant shift in capability composition. Reasoning performance reached a perfect 100 score and coding remained exceptionally strong at 96, demonstrating continued excellence in analytical tasks. However, the factual accuracy category scored only 52, representing a notable weakness. More significantly, the creative and multilingual categories that were previously tested and scored well are absent from the current window, suggesting either reduced emphasis or changes in model scope. The dramatic latency increase from 1637ms to 2586ms will impact user experience, particularly for interactive applications. With only 5 test runs in each window, these results provide a limited but consistent signal. Users relying on factual accuracy should exercise additional validation, while those focused on reasoning and coding tasks may find continued strong performance. The absence of creative and multilingual testing in this window leaves questions about whether those capabilities have been maintained, modified, or deprioritized.

Qualität

82.5

Latenz p50

2,586 ms

Testläufe

5

Quality dropped 8.9 points Latency increased 58% Perfect reasoning score Factual accuracy at 52
Abschnitt 10

Vollständiges Modellprofil

gpt-5.4-2026-03-05 — illustration 1
GPT-5.4 (2026-03-05 Snapshot): Fixierung einer frisch veröffentlichten Basis

Hinweis — zukunftsgerichtetes Profil. Diese Seite beschreibt ein Modell, das sich entweder in einer frühen Vorschau befindet, angekündigt aber noch nicht allgemein verfügbar ist oder auf Basis von Roadmap-Signalen projiziert wurde. Spezifikationen und Fähigkeiten können sich vor der öffentlichen Markteinführung ändern. Live-Benchmark-Daten auf dieser Seite spiegeln wider, welchen Endpunkt unser Test-Harness heute erreichen kann.

Dies ist der Launch-Snapshot von GPT-5.4 base, eingefroren zum Release vom 5. März 2026. Die Fixierung eines neu veröffentlichten Snapshots ist eine andere Diskussion als die Fixierung eines älteren. Der floating gpt-5.4-Slug ist noch nicht nennenswert abgewichen — dafür war schlicht keine Zeit. Die interessante Frage bei diesem Snapshot lautet nicht „sollte ich davon wegmigrieren", sondern „sollte ich ihn überhaupt fixieren, oder sollte ich warten, bis der floating Slug erst einmal eine gewisse Historie aufgebaut hat".

Das Argument für die Fixierung zum Launch

Die konservative Antwort lautet ja, fixieren Sie zum Launch, noch bevor der floating Slug abgedriftet ist. Drei Gründe sprechen dafür.

Erstens hat die Fixierungsentscheidung einen sich aufaddierenden Wert. Wenn Sie die Fixierung so lange hinauszögern, bis der floating Slug so weit abgedriftet ist, dass er einen Vorfall verursacht, haben Sie die Kosten dieses Vorfalls bereits bezahlt. Der gesamte Sinn der Fixierung besteht darin, diese Kosten niemals zu zahlen. Etablieren Sie die Disziplin frühzeitig.

Zweitens beginnen Evaluierungsvergleiche über die Zeit an dem Tag, an dem Sie ausliefern. Wenn Ihre Benchmark-Suite im März gegen diesen Snapshot lief und Sie zukünftige Durchläufe im Juni gegen den floating Slug vergleichen, messen Sie Modell-Drift, nicht Ihre eigene Änderung. Fixieren Sie von Anfang an, und der Vergleich bleibt sauber.

Drittens ist der Migrationspfad zwischen Snapshots derselbe, egal ob Sie zum ersten Mal nach einem Monat oder zum ersten Mal nach zwölf Monaten migrieren. Das Üben der Migration bei einem risikoarmen frühen Update ist billiger als die Entdeckung, dass Sie keinen Migrationsprozess haben, an dem Tag, an dem eine kritische floating-Slug-Rotation die Produktion zum Stillstand bringt.

Das Argument fürs Abwarten

Das Gegenargument hat ebenfalls Gewicht. Frisch veröffentlichte Snapshots haben manchmal unentdeckte Probleme — Grenzfälle in bestimmten Sprachen, Ablehnungsmuster bei bestimmten Inhaltskategorien, Latenz bei spezifischen Input-Formen — die in den floating Slug gepatcht werden, während OpenAI Berichte von Produktionsnutzern erhält. Zum Launch zu fixieren bedeutet, diese Fixes zu verpassen.

Die Abhilfe ist ein Zwei-Slug-Muster: dated Snapshot in der Produktion für Stabilität, floating Slug in Pre-Release für die Evaluierung. Wenn der floating Slug etwas behebt, das für Ihre Workload relevant ist, und die Canary-Suite keine Regressionen bei dem bestätigt, worauf Sie aktuell angewiesen sind, rücken Sie den Produktions-Pin vor. Die erste Migration erfolgt in der Regel innerhalb weniger Wochen nach dem Launch, wenn die ersten Patch-Wellen eintreffen.

Für Workloads, die noch nicht in Produktion, sondern in der Entwicklung sind, ist es ebenfalls vernünftig, während der Entwicklung den floating Slug zu lesen und zum Produktions-Launch auf denjenigen dated Snapshot zu wechseln, der zu diesem Zeitpunkt aktuell ist. Die Fixierungsdisziplin ist am wichtigsten, wenn tatsächliches, für Kunden sichtbares Verhalten auf dem Spiel steht.

Was dieser Snapshot erfasst

Der März-2026-Release von GPT-5.4 base: Launch-Gewichte, Launch-Safety-Training, Launch-Vision-Encoder-Kalibrierung, Launch-Verhalten für Instruction-Following und strukturierten Output. Alle nachfolgenden floating-Slug-Updates sind andernorts geschehen; dieser Snapshot ist zum Launch eingefroren.

Die Verbesserungen, die 5.4 gegenüber den früheren Generationen mitbringt — reduzierte Halluzinationen bei Out-of-Distribution-Fakten, engere Structured-Output-Zuverlässigkeit, bessere Long-Context-Kohärenz — sind alle hier in ihrer Launch-Form erfasst. Nachfolgende Verfeinerungen dieser Eigenschaften in floating-Slug-Updates erscheinen nicht in diesem Pin.

Unter der Haube

Architektonisch ist dies der GPT-5.4-Transformer-Decoder, der verschachtelte Text- und Bild-Inputs akzeptiert, mit reinem Text-Output. OpenAI hat keine Parameteranzahlen veröffentlicht. Die Vision-Fähigkeiten decken die übliche Oberfläche ab: Chart-Verständnis, OCR-artige Extraktion, Dokument-Layout-Parsing, Szenenbeschreibung.

Die Tokenisierung verwendet das Standard-GPT-5-BPE-Vokabular. Bild-Inputs werden tile-kodiert mit festen Token-Kosten pro Tile. Das Kontextfenster entspricht der breiteren 5.4-Linie. Tool-Use-Oberfläche und Structured-Output-Fähigkeiten spiegeln die März-2026-Launch-Konfiguration wider.

Der Trainings-Cutoff liegt Anfang 2026. Das Modell kennt Mainstream-Sprachstandards, Framework-Versionen und öffentliche Informationen, die bis zu diesem Zeitraum aktuell sind. Alles Spätere ist Fabrikationsterritorium.

Wo es heute steht

Gegenüber aktuellen Frontier-Tier-Modellen sitzt der März-2026-Snapshot von GPT-5.4 base in der obersten Klasse der aktuell auslieferbaren Optionen. Das Intelligence-Leaderboard verfolgt die vergleichende Position; der Snapshot ist auf den meisten General-Purpose-Workloads konkurrenzfähig mit Anthropics stärkstem Non-Pro-Tier und Googles Äquivalent.

Für Content-Workflows bewältigt der Snapshot Long-Form-Output mit umfangreichen Stil-Constraints gut. Für Datenextraktion ist die Structured-Output-Zuverlässigkeit solide, und die Vision-Fähigkeit deckt die meisten Dokumentenextraktions-Tasks kompetent ab.

Wann man diesen Snapshot fixieren sollte

Die klaren Fälle sind reproduzibilitätsgetrieben:

Sie bauen ein neues Produkt auf Basis von GPT-5.4 auf und möchten vom ersten Tag an mit einem fixierten Snapshot beginnen, sodass Ihre Evaluierungs-Suite, das kundenseitig sichtbare Verhalten und der Audit-Trail sich alle auf ein bekanntes Modell beziehen statt auf ein bewegliches Ziel.

Sie migrieren von einem älteren 5.x dated Snapshot und möchten auf einem aktuellen Pin landen statt auf einem floating Slug. Der März-2026-Snapshot ist das natürliche Ziel, bis OpenAI einen nachfolgenden dated Snapshot ausliefert, zu dem eine Migration sich lohnt.

Sie arbeiten in einem regulierten Bereich, und die Compliance-Belastung eines sich bewegenden Modells ist inakzeptabel. Der dated Snapshot ist die einzige operativ ehrliche Wahl.

Wann man abwarten sollte

Überspringen Sie den Pin, wenn Sie sich noch in der frühen Entwicklung befinden und die Kosten kleiner Verhaltensänderungen wirklich niedrig sind. Lesen Sie den floating Slug, akzeptieren Sie, dass sich das Verhalten in den nächsten Wochen leicht verschieben kann, und fixieren Sie, wenn Sie ausliefern.

Überspringen Sie ihn, wenn Ihre Workload von spezifischem 5.4-Verhalten abhängt, das in floating-Slug-Updates noch verfeinert wird. Die Patch-Welle in den ersten ein bis zwei Monaten nach einem Launch kann Dinge beheben, die für Sie relevant sind.

Praktisches Migrationsmuster

Das Zwei-Slug-Muster gilt hier wie anderswo: dated Snapshot in Produktion, floating Slug in Pre-Release mit einer Canary-Suite, die Regressionen abfängt, bevor sie ausgeliefert werden. Wenn OpenAI den nächsten dated 5.4-Snapshot (oder den nächsten Generation-5.5-Snapshot) veröffentlicht, läuft die Canary-Suite gegen beide Versionen, und der Produktions-Pin rückt vor, wenn die Canary durchläuft.

Speziell für den März-2026-Snapshot erwarten Sie den nächsten dated Nachfolger innerhalb weniger Monate, während OpenAIs Release-Kadenz weiterläuft. Planen Sie die Migration im Voraus.

Alternativen

Für Workloads, die Top-Tier-Reasoning jenseits dessen benötigen, was base 5.4 bietet, fixieren Sie stattdessen den 5.4 Pro dated Snapshot. Das Reproduzibilitätsargument gilt gleichermaßen für den Pro-Tier und ist dort wichtiger, weil die Workloads anspruchsvoller sind.

Für Workloads, bei denen Reproduzierbarkeit nicht tragend ist, wird der floating gpt-5.4-Slug oder eine neuere Generation insgesamt diesen Pin über die Zeit übertreffen.

Letzte technische Überprüfung: 2026-05-22 — Tokonomix.ai

gpt-5.4-2026-03-05 — illustration 2gpt-5.4-2026-03-05 — illustration 3
Letzter automatisierter Test
14. Sept. 2026 · 20:03 UTC · Geschwindigkeits-Benchmark
P50-Latenz
850 ms
P95-Latenz
1306 ms
Fehler
0 / 6 Läufe
Zuletzt geprüft von Tokonomix-Team·26. Mai 2026