Zum Inhalt
Tier A — Frontier
Läuft in:USErstellt in:United States
OpenAI

gpt-5.4-mini

Tier A — Frontier

Tokonomix-Redaktionsteam·Geprüft von Mes Kalkan··

GPT-5.4-mini ist ein kompaktes Sprachmodell von OpenAI, das innerhalb des Modellportfolios des Unternehmens als effiziente Option positioniert ist. Als Teil der GPT-5-Reihe stellt es eine verkleinerte Variante dar, die Leistung und Recheneffizienz in Einklang bringen soll. Das Modell bietet Standardfunktionen zur Textgenerierung und bewältigt eine Reihe von Aufgaben der natürlichen Sprachverarbeitung, darunter Inhaltserstellung, Zusammenfassung, Beantwortung von Fragen und dialogorientierte Interaktionen. Zu den technischen Spezifikationen von GPT-5.4-mini gehört eine nicht offengelegte Kontextfenstergröße, wobei die für OpenAIs GPT-Familie typische Transformer-Architektur beibehalten wird. Als „Mini"-Variante ist das Modell auf einen reduzierten Ressourcenbedarf optimiert und behält dabei funktionale Textgenerierungsfähigkeiten. Es verarbeitet und erzeugt menschenähnliche Texte in verschiedenen Bereichen und Anwendungsfällen, allerdings mit potenziell geringerer Differenzierung im Vergleich zu größeren Modellen derselben Generation. Innerhalb der Modellpalette von OpenAI belegt GPT-5.4-mini den auf Effizienz ausgerichteten Bereich und richtet sich an Anwendungen, bei denen schnelle Antwortzeiten und geringerer Rechenaufwand wichtiger sind als maximale Leistung. Damit eignet es sich für Entwickler und Organisationen, die zuverlässige Sprachmodellfähigkeiten benötigen, ohne den Ressourcenbedarf von Flaggschiff-Modellen in Kauf nehmen zu müssen. Das Modell folgt OpenAIs etabliertem Ansatz, abgestufte Modellgrößen für unterschiedliche Einsatzszenarien und technische Anforderungen anzubieten.

GPT-5.4-mini positioniert sich als pragmatische Wahl für Teams, die solide Sprachverarbeitung ohne den Ressourcenhunger der Flaggschiff-Modelle benötigen.

Tokonomix Redaktionsnotiz
Abschnitt 01

Geschwindigkeitsanalyse

Latenz über alle Benchmark-Läufe gemessen. P50 (Median) und P95 (95. Perzentil) zeigen ein realistisches Bild der Antwortgeschwindigkeit bei normaler und Spitzenlast.

P50-Latenz (Median)P95-Latenz105 runs
34038387336108341433208-1009-05ms
Abschnitt 02

Qualitätswerte

Wie sich dieses Modell je Prompt-Kategorie zum übrigen Feld verhält, aus einem paarweisen Fit über dieselben Prompts. Die rohe Jury-Wertung steht unter jeder Zahl.

76%
Codegenerierung
Jury-Mittel 100
90%
Kreativ
Jury-Mittel 97
59%
Faktisch
Jury-Mittel 86
61%
Mehrsprachig
Jury-Mittel 98
79%
Schlussfolgern
Jury-Mittel 100

Gewinnrate je Kategorie: wie oft dieses Modell ein durchschnittliches Modell bei einem Prompt dieser Kategorie schlägt. 50% ist der Durchschnitt, keine schlechte Note. Es ist kein Prozentsatz richtiger Antworten.

Abschnitt 03

Preisverlauf

Direkte Provider-Tarife pro Million Tokens, plus eine typische Gesprächskostenschätzung.

💰
API-Tarife — gpt-5.4-mini
$0.7500 pro 1M Input-Tokens
$4.50 pro 1M Output-Tokens
≈ $0.0014 pro typischem Gespräch (800 Tokens)
Input- vs. Output-Preis (pro 1M Tokens)
pro 1M Input-Tokens$0.7500
pro 1M Output-Tokens$4.50

Pricing over time

Input & output per 1M tokens · step-line = price changes

$0.7500

input / 1M

— stable

$4.50

output / 1M

— stable

2026-05-242026-07-262026-08-30
Input
Output
Price change
⟳ synced weekly
Abschnitt 04

Tokens pro Sekunde

Durchsatz in Tokens pro Sekunde, abgeleitet aus gemessener P50-Latenz. Höhere Werte sind besser; Schwankungen spiegeln die Provider-seitige Last wider.

Durchsatz (Tokens / s)431 / avg 353
583119

Geschätzt aus P50-Latenz × 200 Output-Tokens — die absolute Zahl hängt von dieser Annahme ab; entscheidend ist der Trend.

Abschnitt 05

Stärken & Schwächen

Basierend auf Benchmark-Ergebnissen und aggregiertem Community-Feedback zu realen Anwendungsfällen.

Stärken

Schnelle AntwortzeitenEffizientes Kosten-Nutzen-VerhältnisSolide TextgenerierungStabile KonversationsführungZuverlässige ZusammenfassungenVertrauenswürdiger OpenAI-StackEinfache API-IntegrationSkalierbar für hohes Volumen

Schwächen

Begrenzte Tiefe bei komplexen AufgabenKontextfenster nicht offengelegtKeine bestätigte MultimodalitätWissensstichtag unklar
Abschnitt 06

Fähigkeiten

toolssource: litellmvisionjson modepdf inputreasoningjson schemaparallel toolsprompt cachingmax output tokens: 128000
Abschnitt 07

Häufig gestellte Fragen

Das Modell ist ideal für Aufgaben mit hohem Volumen wie Klassifikation, Zusammenfassung, Chat-Assistenten und Inhaltserstellung. Für tiefe Analyse oder komplexes Reasoning empfiehlt sich ein größeres Schwestermodell.

Für produktive Anwendungen mit hohem Durchsatz und überschaubarer Komplexität ist gpt-5.4-mini eine verlässliche Arbeitspferd-Option. Wer maximale Tiefe oder multimodale Fähigkeiten braucht, sollte zu einem größeren Modell greifen.

Tokonomix Bewertungsfazit
Abschnitt 08

Verfügbarkeit

Verfügbarkeit

Wie oft dieses Modell antwortet, wenn wir es aufrufen — gemessen anhand echter API-Anfragen und Live-Tests der letzten 30 Tage. Dies ist unabhängig von der Qualität: Diese Zahlen zeigen nur, ob das Modell antwortet, nicht wie gut die Antwort ist.

Letzte 7 Tage

Letzte 30 Tage

100.0%

n=4

Mediane Antwortzeit

1,654ms

n=4

Basierend auf 384 Messungen in den letzten 30 Tagen.

Technische Details

Nur echte API-Aufrufe und Live-Test-Anfragen werden gezählt — interne Proben und Benchmark-Läufe sind ausgeschlossen.

Aufrufe mit einem eigenen API-Schlüssel (BYOK) sind ausgeschlossen: Diese Fehler sind schlüsselspezifisch und kein Zeichen für Modellausfälle.

Fehlgeschlagene Aufrufe werden NICHT in Qualitätswerten berücksichtigt — Qualität wird nur für erfolgreiche Antworten gemessen. Verfügbarkeit und Qualität sind unabhängige Signale.

Mediane Antwortzeit (p50) über erfolgreiche Aufrufe mit aufgezeichneter Dauer. Ausreißer beeinflussen den Median weniger als den Durchschnitt.

Gesamte Aufrufe (30d)

4

OK-Antworten (30d)

4

Gesamte Aufrufe (7d)

0

OK-Antworten (7d)

0

Abschnitt 09

Tokonomix-Benchmark-Urteile

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-597/100 · 45 runs
44 correct0 partial1 wrong98% accuracy
2026-08-30

gpt-5.4-mini adds reasoning, PDF input, and advanced schema capabilities

The gpt-5.4-mini model represents a significant expansion of the mini model line with the addition of eight new capabilities. Most notably, reasoning capabilities have been integrated, bringing advanced problem-solving features to the smaller model variant. PDF input support allows direct document processing without preprocessing, while vision capabilities enable multimodal applications. The model now supports JSON mode with both basic and advanced schema validation, alongside parallel tool execution for improved efficiency. Prompt caching has been added to optimize repeated interactions. These additions position gpt-5.4-mini as a more versatile option that bridges the gap between lightweight and full-featured models. Users gain access to document understanding, visual analysis, and structured output generation in a compact package. The reasoning feature is particularly significant, as it historically has been reserved for larger models. For applications requiring multimodal input, structured outputs, or cost-effective reasoning, this release substantially expands what can be accomplished with the mini tier. Users should evaluate whether these new capabilities meet their needs for tasks previously requiring larger models.

Qualität

Latenz p50

Testläufe

0

Reasoning capability added PDF and vision input support Advanced JSON schema validation Parallel tools and caching enabled
Abschnitt 10

Vollständiges Modellprofil

gpt-5.4-mini — illustration 1
GPT-5.4 Mini: wenn die Mini-Ebene zum richtigen Standard wird

Hinweis — zukunftsgerichtetes Profil. Diese Seite beschreibt ein Modell, das sich entweder in einer frühen Vorschauphase befindet, angekündigt aber noch nicht allgemein verfügbar ist, oder basierend auf Roadmap-Signalen projiziert wurde. Spezifikationen und Fähigkeiten können sich vor dem öffentlichen Launch noch ändern. Live-Benchmark-Daten auf dieser Seite spiegeln wider, welchen Endpunkt unser Test-Harness heute erreichen kann.

GPT-5.4 Mini ist die kleine, aber leistungsfähige Stufe der 5.4-Generation. Das Muster ist vertraut aus früheren Mini-Ebenen — kleineres Modell, schnellere Inferenz, niedrigere Kosten pro Token, weniger rohe Leistungsfähigkeit als die darüberliegende Basis-Ebene. Was bei der 5.4-Generation anders ist: Mini hat eine Qualitätsschwelle überschritten, bei der es zum richtigen Standard für ein deutlich breiteres Spektrum von Arbeitslasten wird, als es die älteren Mini-Ebenen waren.

Wenn Mini aufhört, ein Kompromiss zu sein

Frühere Mini-Ebenen in der GPT-5-Familie waren die offensichtliche Wahl für billige und schnelle Arbeitslasten und die offensichtlich falsche Wahl für alles, was echte Leistungsfähigkeit benötigte. Die Entscheidung war binär: Basis für ernsthafte Arbeit nutzen, nur zu Mini eskalieren, wenn Kosten dominierten.

Die 5.4-Generation verschiebt diese Grenze. GPT-5.4 Mini bewältigt den Großteil der Arbeit, die Basis 5.2 und 5.3 früher erledigt haben, zu einem Bruchteil der Kosten und deutlich schneller. Für Teams, deren Arbeitslast-Mix überwiegend aus Chat, überwiegend strukturierter Output-Generierung, überwiegend unkomplizierten Content-Aufgaben besteht — die Art von Traffic, die keine Reasoning-Tiefe unter Stress setzt — ist Basis 5.4 oft die falsche Wahl. Mini erledigt denselben Job für weniger Geld.

Die Entscheidung wird zu: Wann profitiert die Arbeitslast tatsächlich von der zusätzlichen Leistungsfähigkeit der Basis-Ebene? Die Antwort ist enger gefasst, als die meisten Teams annehmen. Hartes Reasoning, Agent-Loops mit tiefer Planung, strukturierter Output gegen extrem komplexe Schemata, Long-Context-Kohärenz unter hoher Last — das sind die Arbeitslasten, bei denen Basis gewinnt. Die meisten anderen Dinge bewältigt Mini kompetent.

Unter der Haube

GPT-5.4 Mini ist ein Transformer-Decoder, multimodal über Text- und Vision-Inputs, mit reinem Text-Output. Die Architektur spiegelt die breitere 5.4-Familie in kleinerem Parameter-Maßstab wider. OpenAI hat keine exakten Parameter-Zahlen veröffentlicht.

Vision-Fähigkeit ist vorhanden und weitgehend vergleichbar mit Basis 5.4 bei Standard-Aufgaben: Chart-Verständnis, OCR-artige Extraktion, Parsing von Dokumenten-Layouts, Szenenbeschreibung. Bei den härtesten Vision-Aufgaben — adversarial Layouts, dichte technische Diagramme, niedrig aufgelöste Inputs — ist der Abstand zu Basis 5.4 deutlicher sichtbar.

Die Tokenisierung verwendet das Standard-GPT-5-BPE-Vokabular. Bild-Inputs werden kachelbasiert kodiert in feste Token-Kosten pro Kachel. Das Kontextfenster entspricht der breiteren 5.4-Linie, obwohl die Kohärenz bei extrem langen Inputs früher nachlässt als bei der Basis-Ebene.

Der Training-Cutoff liegt Anfang 2026. Das Modell kennt Mainstream-Sprachstandards und Framework-Versionen, die bis zu diesem Zeitraum aktuell sind.

Wo es heute steht

Für Chat, Content-Generierung, Structured-Output-Workflows und vision-unterstützte Aufgaben routinemäßiger Schwierigkeit ist GPT-5.4 Mini wettbewerbsfähig mit den Basis-Ebenen älterer Generationen und deutlich günstiger und schneller als das aktuelle Basis 5.4. Das Intelligence-Leaderboard verfolgt die vergleichende Performance über Ebenen hinweg.

Das Latenz-Profil ist das wirkliche Verkaufsargument. Minis Time-to-First-Token ist deutlich niedriger als bei Basis 5.4 bei demselben Prompt, was für interaktive Arbeitslasten wichtig ist, bei denen Benutzer die Antwortzeit direkt spüren. Für Chatbots, Inline-Assistenz und jede andere Anwendung mit Echtzeit-Gefühl ist Mini die bessere Erfahrung, selbst wenn Basis marginal besseren Output produzieren würde.

Für Content-Workflows am routinemäßigen Ende des Spektrums ist Mini der richtige Standard. Für Datenextraktion bei Standard-Dokumentformaten erledigt Mini die Arbeit mit erheblichen Kosteneinsparungen gegenüber Basis.

Wo der Abstand zu Basis sich noch zeigt

Hartes Reasoning ist der deutlichste Abstand. Multi-Step-Planung, sorgfältiges Abwägen vieler Faktoren, Constraint-Satisfaction-Probleme in natürlicher Sprache ausgedrückt — Basis 5.4 übertrifft Mini hier spürbar. Wenn Ihre Arbeitslast routinemäßig an die Grenzen dessen stößt, worüber Mini nachdenken kann, eskalieren Sie.

Long-Context-Kohärenz lässt früher nach. Mini bewältigt lange Prompts gut bis zu einem gewissen Punkt, verliert dann aber Constraints, die früh gesetzt wurden. Basis 5.4 hält den roten Faden länger durch. Für Workflows, die umfangreiche Anweisungen oder große Referenzdokumente in den System-Prompt packen, ist die Basis-Ebene zuverlässiger.

Strukturierter Output gegen extrem komplexe Schemata ist fehleranfälliger bei Mini. Einfache JSON-Outputs funktionieren gut. Tief verschachtelte Schemata mit vielen discriminated Unions produzieren gelegentlich fast-validen Output, der Nachbearbeitung benötigt.

Halluzination bei Nischenthemen ist etwas häufiger als bei Basis. Die Reduktion der Halluzinationsrate, die 5.4 gegenüber früheren Generationen bringt, gilt für beide Ebenen, aber das kleinere Modell hat weniger Kapazität, überzeugt falsche Antworten über Edge-Case-Fakten zu unterdrücken.

Nicht-englische Performance bei Sprachen mit weniger Ressourcen fällt bei Mini sichtbarer ab als bei Basis. Die großen europäischen und ostasiatischen Sprachen sind stark. Kleinere Sprachgemeinschaften sehen einen steileren Qualitätsabfall.

Wann Mini der richtige Standard ist

Das Standard-Ebenen-Muster für neue Entwicklungen auf der 5.4-Linie ist: mit Mini beginnen, nur zu Basis oder Pro eskalieren, wenn die Arbeitslast demonstriert, dass sie die zusätzliche Leistungsfähigkeit braucht. Dies kehrt das ältere Muster um von „mit Basis beginnen, nur zu Mini absteigen, um Geld zu sparen."

Nutzen Sie Mini für Chat, Kundenservice-Workflows, Content-Entwürfe, strukturierten Output bei Routine-Schemata, vision-unterstützte Analyse von Standarddokumenten und jede Arbeitslast, bei der der Benutzer in Echtzeit auf die Antwort wartet.

Nutzen Sie es für hochvolumigen Traffic, wo sich die Kosteneinsparungen summieren. Eine Arbeitslast, die täglich Tausende von Completions durchführt, wird deutlich unterschiedliche Rechnungen zwischen Mini und Basis sehen, und wenn die Qualität bei Mini gut genug ist, sind die Einsparungen ein reiner Gewinn.

Wann zu Basis oder Pro eskalieren

Eskalieren Sie zu Basis, wenn die Arbeitslast routinemäßig Multi-Step-Reasoning beinhaltet, das Mini falsch macht, wenn Long-Context-Kohärenz wichtig ist und Mini Constraints fallen lässt, oder wenn strukturierter Output gegen komplexe Schemata zu viel nachgelagerte Aufräumarbeit produziert.

Eskalieren Sie weiter zu Pro, wenn selbst Basis 5.4 nicht ausreicht — Agent-Loops mit tiefer Planung, harte Analysen, Top-of-Stack-Reasoning-Arbeit. Pro ist überdimensioniert für die meisten Arbeitslasten, aber die richtige Wahl, wenn die Arbeit es verlangt.

Ein Router, der zuerst Mini ausführt und basierend auf Qualitätschecks oder Arbeitslast-Typ-Heuristiken eskaliert, hält das Kostenprofil vernünftig, während er die schwereren Ebenen für die Fälle reserviert, die sie benötigen.

Alternativen

Für interaktive Autovervollständigung bei noch niedrigerer Latenz tauscht die Nano-Ebene in der 5.4-Linie mehr Leistungsfähigkeit gegen mehr Geschwindigkeit. Die Nano-Varianten sind die richtige Wahl für Vervollständigungspfade pro Tastendruck.

Für Kostenoptimierung über das hinaus, was Mini bietet, können kleinere Open-Weights-Modelle, die auf Ihrer eigenen Infrastruktur laufen, Minis Qualität bei engen Aufgaben bei nahezu null Grenzkosten erreichen. Der operative Overhead ist der Kompromiss.

Für Arbeitslasten, bei denen Reproduzierbarkeit wichtig ist, fixieren Sie den datierten Snapshot gpt-5.4-mini-2026-03-17, statt den floating Slug zu lesen.

Letzte technische Überprüfung: 2026-05-22 — Tokonomix.ai

gpt-5.4-mini — illustration 2gpt-5.4-mini — illustration 3
Letzter automatisierter Test
5. Sept. 2026 · 08:02 UTC · Geschwindigkeits-Benchmark
P50-Latenz
464 ms
P95-Latenz
464 ms
Fehler
0 / 6 Läufe
Zuletzt geprüft von Tokonomix-Team·26. Mai 2026