Zum Inhalt
Tier B — Produktion
Läuft in:USErstellt in:United States

Einstellungsdatum

Der Anbieter stellt dieses Modell am 11. Dezember 2026 ein. Bis dahin funktioniert es wie gewohnt.

OpenAI

gpt-5-nano-2025-08-07

Tier B — Produktion

Tokonomix-Redaktionsteam·Geprüft von Mes Kalkan··

GPT-5-nano-2025-08-07 ist ein Textgenerierungsmodell, das von OpenAI entwickelt und im August 2025 veröffentlicht wurde. Wie die Bezeichnung „nano" andeutet, stellt dieses Modell eine kompakte Variante innerhalb der GPT-5-Familie dar, die Effizienz und reduzierte Rechenanforderungen priorisiert und dabei zentrale Sprachverständnisfähigkeiten beibehält. Es führt Standard-Textgenerierungsaufgaben durch, einschließlich Fragebeantwortung, Zusammenfassung, Content-Erstellung und Konversationsinteraktionen. Die technischen Spezifikationen des Modells umfassen Standard-Textgenerierungsfähigkeiten, wobei die Größe des Kontextfensters nicht öffentlich bekannt gegeben wurde. Die „nano"-Klassifizierung deutet auf architektonische Optimierungen für den Einsatz in ressourcenbeschränkten Umgebungen oder Anwendungen hin, bei denen niedrige Latenz Vorrang vor maximaler Leistungsfähigkeit hat. Diese Positionierung macht es geeignet für die Integration in Anwendungen, die schnelle Antwortzeiten erfordern oder mit begrenzten Rechenressourcen arbeiten. Innerhalb des Modellangebots von OpenAI befindet sich GPT-5-nano am kleineren Ende der GPT-5-Serie und ergänzt größere Varianten, die erweiterte Fähigkeiten und Kontextfenster bieten. Das Modell bedient Anwendungsfälle, bei denen die Leistung eines vollwertigen Modells nicht erforderlich ist, wie einfache Chatbot-Interaktionen, grundlegende Textklassifizierung oder Anwendungen, die kürzere Eingaben verarbeiten. Das Veröffentlichungsdatum im August 2025 zeigt, dass es zu diesem Zeitpunkt verfügbare Trainingsdaten und architektonische Verbesserungen integriert, wobei spezifische technische Details zur Parameteranzahl und Trainingsmethodik nicht öffentlich gemacht wurden.

GPT-5-nano (August 2025): kompakte Effizienz trifft auf die GPT-5-Generation in einem stabilen Produktions-Snapshot.

Tokonomix-Benchmark-Zusammenfassung
Abschnitt 01

Geschwindigkeitsanalyse

Latenz über alle Benchmark-Läufe gemessen. P50 (Median) und P95 (95. Perzentil) zeigen ein realistisches Bild der Antwortgeschwindigkeit bei normaler und Spitzenlast.

P50-Latenz (Median)P95-Latenz97 runs
406142424413459447608-2209-15ms
Abschnitt 02

Qualitätswerte

Wie sich dieses Modell je Prompt-Kategorie zum übrigen Feld verhält, aus einem paarweisen Fit über dieselben Prompts. Die rohe Jury-Wertung steht unter jeder Zahl.

27%
Codegenerierung
Jury-Mittel 33
7%
Kreativ
Jury-Mittel 45
48%
Faktisch
Jury-Mittel 74
27%
Mehrsprachig
Jury-Mittel 27
21%
Schlussfolgern
Jury-Mittel 29

Gewinnrate je Kategorie: wie oft dieses Modell ein durchschnittliches Modell bei einem Prompt dieser Kategorie schlägt. 50% ist der Durchschnitt, keine schlechte Note. Es ist kein Prozentsatz richtiger Antworten.

Abschnitt 03

Preise

Was Sie pro Million Tokens zahlen, wenn Sie dieses Modell über Tokonomix nutzen, plus eine Schätzung für ein typisches Gespräch.

💰
API-Tarife — gpt-5-nano-2025-08-07
$0.1300 pro 1M Input-Tokens
$1.04 pro 1M Output-Tokens
≈ $0.0003 pro typischem Gespräch (800 Tokens)
Input- vs. Output-Preis (pro 1M Tokens)
pro 1M Input-Tokens$0.1300
pro 1M Output-Tokens$1.04
Abschnitt 04

Tokens pro Sekunde

Durchsatz in Tokens pro Sekunde, abgeleitet aus gemessener P50-Latenz. Höhere Werte sind besser; Schwankungen spiegeln die Provider-seitige Last wider.

Durchsatz (Tokens / s)346 / avg 320
48767

Geschätzt aus P50-Latenz × 200 Output-Tokens — die absolute Zahl hängt von dieser Annahme ab; entscheidend ist der Trend.

Abschnitt 05

Stärken & Schwächen

Basierend auf Benchmark-Ergebnissen und aggregiertem Community-Feedback zu realen Anwendungsfällen.

Stärken

Stabiler versionierter SnapshotRessourcenoptimierter BetriebSchnelle TextverarbeitungAllgemeine NLP-AufgabenKosteneffizientOpenAI-API-Integration

Schwächen

Eingeschränkte Reasoning-TiefeKontextgröße nicht publiziertNicht für komplexe Analyse
Abschnitt 06

Fähigkeiten

toolssource: litellmvisionjson modepdf inputreasoningjson schemaparallel toolsprompt cachingmax output tokens: 128000
Abschnitt 07

Häufig gestellte Fragen

Datierte Snapshots bieten konsistentes, unveränderliches Verhalten – wichtig für reproduzierbare Produktionssysteme.

Der August-2025-Snapshot gibt Entwicklern ein verlässliches, versioniertes nano-Modell für konsistente Deployments.

Tokonomix-Benchmark-Zusammenfassung
Abschnitt 08

Verfügbarkeit

Verfügbarkeit

Noch keine Messdaten

Es wurden noch nicht genug API-Aufrufe aufgezeichnet, um Verfügbarkeitsstatistiken für dieses Modell anzuzeigen. Daten erscheinen, sobald das Modell Live-Traffic erhält.

Abschnitt 09

Tokonomix-Benchmark-Urteile

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-540/100 · 37 runs
10 correct1 partial26 wrong27% accuracy
2026-09-13

GPT-5-nano maintains perfect quality score with faster response times

The latest benchmark window for gpt-5-nano-2025-08-07 shows continued excellence with a perfect 100.0 quality score, matching its previous performance level. The model demonstrates consistent top-tier capabilities, though testing coverage remains limited with only one test run in each window. The most notable improvement comes in latency performance, with the median response time dropping from 4199ms to 3391ms, representing a 19% speed improvement. This enhanced responsiveness makes the model more practical for real-time applications without sacrificing output quality. Testing focus shifted between windows, moving from multilingual capabilities in the previous period to reasoning tasks in the current assessment. Both categories achieved perfect scores, suggesting strong cross-functional performance. However, the limited test coverage means comprehensive capability assessment across all domains remains incomplete. Users can expect reliable, high-quality outputs with noticeably improved response times compared to the previous window. The model appears well-suited for applications requiring both speed and accuracy, particularly in reasoning-intensive tasks. Organizations should note that while performance metrics are excellent, the single-run test data suggests monitoring additional evaluation cycles for fuller confidence in production deployments.

Qualität

100.0

Latenz p50

3,391 ms

Testläufe

1

19% faster response time Perfect quality score maintained Strong reasoning performance Limited test coverage
Abschnitt 10

Vollständiges Modellprofil

gpt-5-nano-2025-08-07 — illustration 1
GPT-5 Nano (2025-08-07 Snapshot): die einfachste Migration in der Familie

Dies ist der datierte Snapshot des ursprünglichen GPT-5 Nano, eingefroren beim Launch am 7. August 2025. Es ist der älteste datierte Nano in der Familie und der stärkste Kandidat für proaktive Migration — nicht weil das Modell defekt ist, sondern weil die Migrationskosten auf der Nano-Stufe ungewöhnlich niedrig sind und die Gewinne durch den Wechsel zu einem neueren Nano ungewöhnlich hoch.

Warum Nano-Migrationen einfacher sind als sie aussehen

Migrationsprojekte zwischen Modellstufen umfassen normalerweise erhebliche Prompt-Engineering-Arbeit, Aktualisierungen nachgelagerter Pipelines und Validierungszyklen. Die Kosten können die Entscheidung zur Migration dominieren, selbst wenn das neue Modell eindeutig besser ist.

Die Nano-Stufe kehrt dies um. Nano-Workloads sind konstruktionsbedingt meist einfach — Klassifikation über ein kleines Label-Set, Extraktion klar definierter Felder, kurze strukturierte Ausgaben. Die Prompts sind in der Regel kurz. Die nachgelagerten Konsumenten wollen meist einfache Ausgaben. Die Validierungsoberfläche ist schmal.

Das bedeutet, dass die Migration von einer Nano-Generation zur nächsten typischerweise einen Bruchteil des Engineering-Aufwands erfordert, den dieselbe Migration auf den Base- oder Pro-Stufen kostet. Die Prompts lassen sich mit geringfügigen Anpassungen portieren. Die Evaluierung geht schnell, weil der Ausgaberaum klein ist. Die nachgelagerten Änderungen beschränken sich meist auf die Handhabung leichter Formatverschiebungen.

Die Kombination aus niedrigen Migrationskosten und substanziellen Fähigkeitsgewinnen macht die Migrationskalkulation einfach. Für Teams, die auf diesem Snapshot sitzen, lautet die Frage meist nicht „lohnt sich die Migration", sondern „warum haben wir sie noch nicht durchgeführt".

Was dieser Snapshot erfasst

Der Launch von GPT-5 Nano im August 2025: Launch-Gewichte, Launch-Verhalten bei Klassifikation und Extraktion, Launch-Latenzprofil, Launch-Vision-Encoder-Konfiguration für die Größenklasse. Das Modell hat sich seitdem nicht verändert.

Die Verbesserungen, die die breitere GPT-5-Linie in nachfolgenden Generationen akkumuliert hat — bessere Klassifikationsgenauigkeit, straffere Handhabung strukturierter Ausgaben, verbesserte Per-Keystroke-Completion-Qualität, Kenntnis von Entwicklungen nach Mitte 2025 — keine davon erscheint hier.

Unter der Haube

Architektonisch ist dies der GPT-5-Nano-Transformer-Decoder mit einem substanziell kleineren Parameter-Maßstab als Mini. Das Modell akzeptiert verschachtelte Text- und Bildeingaben und gibt ausschließlich Text aus. OpenAI hat keine Parameterzahlen veröffentlicht.

Die Tokenisierung verwendet das Standard-GPT-5-BPE-Vokabular. Bildeingaben werden gekachelt kodiert mit fixen Token-Kosten pro Kachel. Das Kontextfenster ist in absoluten Zahlen kürzer als bei den größeren Stufen. Der Trainings-Cutoff liegt Mitte 2025.

Wo es heute steht

Gegen aktuelle Smallest-Tier-Angebote liegt der August-2025-Snapshot deutlich unter den neueren GPT-5-Nanos auf den meisten Benchmark-Dimensionen. Das Intelligence-Leaderboard verfolgt die vergleichende Position; die Lücke hat sich vergrößert, während neuere Generationen gelandet sind.

Für Pre-Filter-Pipelines, die schwierige Fälle eskalieren, funktioniert der Snapshot noch als erste Stufe. Für Workloads, bei denen die Nano-Ausgabe die finale Antwort ist, beginnt die Qualitätslücke zu neueren Nanos zu zählen.

Wann diesen Pin beibehalten

Die Fälle für das Verbleiben auf diesem Snapshot sind eng:

Sie haben nachgelagerte Pipelines, die eng auf die spezifischen Ausgabemuster dieses Modells kalibriert sind, und selbst die geringen Migrationskosten sind derzeit aus irgendeinem Grund nicht gerechtfertigt.

Sie befinden sich in einem regulierten Kontext, in dem dieser spezifische Pin Teil eines aktiven Audit-Zyklus ist.

Ihr Workload ist so routinemäßig, dass die Qualitätslücke zu neueren Nanos null messbaren Effekt auf die Ergebnisse hat.

Wann jetzt migrieren

Für die meisten Teams, die auf diesem Snapshot sitzen, lautet die Antwort „jetzt". Die klaren Auslöser:

OpenAI hat die Deprecation-Timeline veröffentlicht. Ältere Nano-Snapshots neigen dazu, relativ früh im Deprecation-Zyklus auszulaufen, weil die Migrationskosten niedrig sind und die aktive Nutzerbasis kleiner ist.

Ihre Evaluierungsharness zeigt, dass neuere Nanos Ihren Workload mit deutlich weniger Fehlern handhaben. Die Klassifikationsgenauigkeitslücke, die Extraktionsqualitätslücke, die Vision-Fähigkeitslücke — jede davon kann die Migration für sich allein rechtfertigen.

Sie brauchen Post-Mitte-2025-Wissen. Dieses Modell hat keines.

Ihr Engineering-Team hat Bandbreite für ein aufwandsarmes, wirkungsstarkes Migrationsprojekt. Nano-Migrationen sind genau das.

Das Migrationsmuster

Wählen Sie den Ziel-Nano. Der neueste stabile datierte Nano in der GPT-5-Familie ist meist die richtige Antwort — 5.4 Nano dated, 5.5 Nano dated, oder welcher auch immer aktuell ist, wenn Sie migrieren. Pinnen Sie die datierte Version des Ziels.

Portieren Sie die Prompts. Führen Sie das vorhandene Prompt-Set gegen den Ziel-Nano aus. Vergleichen Sie Ausgaben gegen den aktuellen Snapshot an einer repräsentativen Stichprobe Ihres Traffics. Identifizieren Sie die kleine Anzahl von Fällen, in denen sich das neue Modell anders verhält, und passen Sie die Prompts nach Bedarf an.

Validieren Sie nachgelagert. Prüfen Sie, ob nachgelagerte Pipelines die leichten Formatverschiebungen handhaben, die mit der neuen Generation kommen können. Die meisten Pipelines absorbieren sie ohne Änderungen; einige benötigen möglicherweise kleine Anpassungen an der Parsing-Logik.

Wechseln Sie. Aktualisieren Sie den Produktionstraffic auf den neuen Pin. Überwachen Sie die ersten Tage auf alles, was die Evaluierung übersehen hat.

Retirieren Sie den alten Pin. Entfernen Sie Referenzen in Code, Konfiguration und Infrastruktur auf den alten Slug. Das vollständige Projekt dauert für einen Workload mittlerer Komplexität normalerweise einige Tage.

Wo die Limits noch sitzen

Die Standard-Nano-Limits gelten: flaches Reasoning, schlechte Long-Context-Kohärenz, schwache Performance bei komplexen Schemas, höhere Halluzination als größere Stufen, schwächere Nicht-Englisch-Performance. Keines davon ändert sich durch Pinning.

Das Early-Cutoff-Wissens-Limit ist spezifisch für diesen Snapshot. Post-Mitte-2025-Entwicklungen sind für dieses Modell unsichtbar, und jeder neuere Nano wird mehr über sie wissen.

Alternativen

Für Workloads, die gepinntes Smallest-Tier-Verhalten bei einem anderen Anbieter benötigen, bieten die vergleichbaren Nano-äquivalenten Snapshots von Anthropic und Google dasselbe Pinning-Muster.

Für kostenoptimierte Workloads, bei denen das OpenAI-Ökosystem nicht tragend ist, bieten kleine Open-Weights-Klassifikatoren auf Ihrer eigenen Infrastruktur die Residency-Story und die operationale Vorhersagbarkeit, die floating Slugs nicht bieten können.

Letzte technische Prüfung: 2026-05-22 — Tokonomix.ai

gpt-5-nano-2025-08-07 — illustration 2gpt-5-nano-2025-08-07 — illustration 3
Letzter automatisierter Test
15. Sept. 2026 · 02:05 UTC · Geschwindigkeits-Benchmark
P50-Latenz
578 ms
P95-Latenz
597 ms
Fehler
0 / 6 Läufe
Zuletzt geprüft von Tokonomix-Team·26. Mai 2026