Zum Inhalt
Tier B — Produktion
Läuft in:USErstellt in:United States
OpenAI

gpt-5.1-2025-11-13

Tier B — Produktion

Tokonomix-Redaktionsteam·Geprüft von Mes Kalkan··

GPT-5.1-2025-11-13 ist ein großes Sprachmodell, das von OpenAI entwickelt wurde und im November 2025 als Teil der GPT-5-Serie veröffentlicht wurde. Dieses Modell stellt eine iterative Aktualisierung von OpenAIs führender Sprachmodell-Reihe dar und integriert architektonische Verbesserungen sowie Training auf aktuelleren Daten im Vergleich zu seinen Vorgängern. Es ist für allgemeine Textgenerierungsaufgaben konzipiert, einschließlich Verarbeitung natürlicher Sprache, Content-Erstellung, Fragebeantwortung, Code-Generierung und Konversationsanwendungen. Das Modell verfügt über standardmäßige Textgenerierungsfähigkeiten mit Unterstützung für komplexes Schlussfolgern, mehrstufigen Dialog und Befolgung von Anweisungen. Obwohl die exakte Größe des Kontextfensters nicht öffentlich bekannt gegeben wurde, wird erwartet, dass es erhebliche Eingabelängen verarbeitet, die mit modernen großen Sprachmodellen konsistent sind. GPT-5.1 baut auf dem Fundament der GPT-5-Serie auf und bietet verbesserte Leistung bei Reasoning-Benchmarks sowie erhöhte faktische Genauigkeit durch Aktualisierungen des Trainingsdaten-Cutoffs. Innerhalb von OpenAIs Modell-Lineup ist GPT-5.1-2025-11-13 ein Angebot der aktuellen Generation in der GPT-5-Familie. Die datumsbezogene Versionskennung zeigt an, dass dies ein spezifischer Snapshot ist, der im November 2025 veröffentlicht wurde und OpenAIs Praxis widerspiegelt, versionierte Releases für Konsistenz und Reproduzierbarkeit bereitzustellen. Dieses Modell dient Nutzern, die zuverlässige, allgemeine Sprachmodellfähigkeiten für Produktionsanwendungen, Forschung und Entwicklung in verschiedenen Bereichen benötigen.

GPT-5.1 markiert OpenAIs jüngsten Iterationsschritt in der GPT-5-Reihe und bringt verbesserte Reasoning-Fähigkeiten sowie aktuelle Trainingsdaten in ein ausgereiftes Sprachmodell.

Tokonomix Modellanalyse
Abschnitt 01

Geschwindigkeitsanalyse

Latenz über alle Benchmark-Läufe gemessen. P50 (Median) und P95 (95. Perzentil) zeigen ein realistisches Bild der Antwortgeschwindigkeit bei normaler und Spitzenlast.

P50-Latenz (Median)P95-Latenz96 runs
435228141265972781708-2209-14ms
Abschnitt 02

Qualitätswerte

Wie sich dieses Modell je Prompt-Kategorie zum übrigen Feld verhält, aus einem paarweisen Fit über dieselben Prompts. Die rohe Jury-Wertung steht unter jeder Zahl.

75%
Codegenerierung
Jury-Mittel 99
73%
Kreativ
Jury-Mittel 87
59%
Faktisch
Jury-Mittel 80
64%
Mehrsprachig
Jury-Mittel 99
74%
Schlussfolgern
Jury-Mittel 99

Gewinnrate je Kategorie: wie oft dieses Modell ein durchschnittliches Modell bei einem Prompt dieser Kategorie schlägt. 50% ist der Durchschnitt, keine schlechte Note. Es ist kein Prozentsatz richtiger Antworten.

Abschnitt 03

Preise

Was Sie pro Million Tokens zahlen, wenn Sie dieses Modell über Tokonomix nutzen, plus eine Schätzung für ein typisches Gespräch.

💰
API-Tarife — gpt-5.1-2025-11-13
$1.63 pro 1M Input-Tokens
$13.00 pro 1M Output-Tokens
≈ $0.0036 pro typischem Gespräch (800 Tokens)
Input- vs. Output-Preis (pro 1M Tokens)
pro 1M Input-Tokens$1.63
pro 1M Output-Tokens$13.00
Abschnitt 04

Tokens pro Sekunde

Durchsatz in Tokens pro Sekunde, abgeleitet aus gemessener P50-Latenz. Höhere Werte sind besser; Schwankungen spiegeln die Provider-seitige Last wider.

Durchsatz (Tokens / s)234 / avg 292
45574

Geschätzt aus P50-Latenz × 200 Output-Tokens — die absolute Zahl hängt von dieser Annahme ab; entscheidend ist der Trend.

Abschnitt 05

Stärken & Schwächen

Basierend auf Benchmark-Ergebnissen und aggregiertem Community-Feedback zu realen Anwendungsfällen.

Stärken

Verbesserte Reasoning-LeistungAktueller Trainingsdaten-CutoffStarke Multi-Turn-DialogeVielseitige Content-GenerierungSolide Code-GenerierungPräzises Instruction-FollowingVersionierte Release-KonsistenzBreite Domain-Abdeckung

Schwächen

Kontextfenster-Größe nicht veröffentlichtTier-Einstufung unklarKeine detaillierten Capability-SpecsMultimodale Fähigkeiten nicht dokumentiert
Abschnitt 06

Fähigkeiten

toolssource: litellmvisionjson modepdf inputreasoningjson schemaparallel toolsprompt cachingmax output tokens: 128000
Abschnitt 07

Häufig gestellte Fragen

OpenAI hat die exakte Context-Window-Größe für dieses Modell nicht öffentlich kommuniziert. Basierend auf der GPT-5-Serie ist von einem substanziellen Kontext auszugehen, der mit modernen Large Language Models vergleichbar ist.

Für Teams, die auf OpenAIs bewährtes Ökosystem setzen und dabei Wert auf aktuelle Daten und starke Allround-Fähigkeiten legen, stellt GPT-5.1 eine solide Wahl dar.

Tokonomix Redaktion
Abschnitt 08

Verfügbarkeit

Verfügbarkeit

Noch keine Messdaten

Es wurden noch nicht genug API-Aufrufe aufgezeichnet, um Verfügbarkeitsstatistiken für dieses Modell anzuzeigen. Daten erscheinen, sobald das Modell Live-Traffic erhält.

Abschnitt 09

Tokonomix-Benchmark-Urteile

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-594/100 · 55 runs
51 correct2 partial2 wrong93% accuracy
2026-09-13

Quality dip and major latency regression offset by perfect code performance

This benchmark window reveals a mixed performance profile for GPT-5.1. The model demonstrates exceptional coding capabilities with a perfect 100 score, maintaining the strong performance from the previous window. Reasoning also achieved a perfect 100, suggesting robust logical processing abilities. However, the overall quality score declined from 85.1 to 83.8, driven primarily by a significant drop in factual accuracy to just 52 points. This represents a concerning regression in knowledge retrieval and factual correctness that users should be aware of when deploying the model for information-intensive tasks. The most notable change is a 72% increase in latency, with the median response time jumping from 1779ms to 3054ms. This substantial slowdown may impact user experience in latency-sensitive applications. The previous window showed strong creative and multilingual performance, but these categories were not evaluated in the current testing cycle, making direct comparison impossible. Users should expect excellent performance for programming and logical reasoning tasks, but exercise caution with factual queries and be prepared for slower response times compared to the previous release.

Qualität

83.8

Latenz p50

3,054 ms

Testläufe

5

Perfect coding score achieved Reasoning capabilities at maximum Factual accuracy dropped to 52 Latency increased 72 percent
Abschnitt 10

Vollständiges Modellprofil

gpt-5.1-2025-11-13 — illustration 1
gpt-5.1-2025-11-13: der GPT-5.1-Freeze vom November 2025

gpt-5.1-2025-11-13 ist der datierte Snapshot der GPT-5.1-Linie von OpenAI aus November 2025. Der Freeze des rollierenden Alias gpt-5.1 in dem Zustand, in dem er am Release-Tag von 5.1 stand, festgeschrieben für Produktiv-Deployments, die sich an ein konkretes Verhalten binden.

Für Teams, die das 5.1-Evaluation-Suite durchlaufen haben, ihre produktiven Workloads gegen das Launch-Day-Verhalten validiert haben und genau dieses Verhalten unverändert beibehalten wollen, während OpenAI über den rollierenden Alias weiter Feinjustierungen ausliefert — das ist der Snapshot, an den man sich pinnen sollte.

Was dieser Snapshot repräsentiert

Das Release vom November 2025 ist der initiale GPT-5.1-Freeze. Zu diesem Release verfügte das Modell über:

  • Das vollständige Set an 5.1-Verfeinerungen gegenüber 5.0 — verbesserte Einhaltung von JSON-Schemata, präziseres Tool-Use-Verhalten, geringere Varianz bei Edge-Case-Prompts, überarbeitete Refusal-Haltung.
  • Das Context-Window und das Attention-Profil der 5.1-Linie im Launch-Zustand.
  • Vision-Input-Verhalten, das auf die Standards der 5.1-Linie abgestimmt wurde.

Was er nicht enthält, relativ zu dem, was sich seither im rollierenden gpt-5.1-Alias angesammelt hat:

  • Jegliche Within-Version-Verfeinerungen, die OpenAI seit dem Launch ausgeliefert hat — kleine Genauigkeitsverbesserungen, zusätzliche Refusal-Justierungen, Latenzoptimierungen.
  • Kompatibilität mit neueren API-Features, die möglicherweise nach dem Snapshot-Datum hinzugefügt wurden.

Für ein Produktiv-Deployment, das gegen das Launch-Verhalten vom November 2025 validiert wurde, sind genau diese Within-Version-Updates die Änderungen, vor denen der Pin schützt. Sie sind im Durchschnitt Verbesserungen; bei den spezifischen Edge Cases, auf die Ihre Evaluation abgestimmt ist, können sie Regressionen sein.

Warum ein datierter 5.1-Pin Sinn ergibt

Das Argument, den datierten GPT-5.1-Snapshot zu pinnen statt auf dem rollierenden Alias zu fahren, ist das klassische Produktiv-Stabilitäts-Argument:

  • Verhaltensänderungen zwischen Within-Version-Updates können Prompt-Templates brechen, die auf spezifische Eigenheiten abgestimmt waren.
  • Verschiebungen in der Schema-Einhaltung können Downstream-Parsing-Ergebnisse verändern, selbst wenn das Hauptverhalten unverändert bleibt.
  • Verschiebungen in der Refusal-Haltung können Ablehnungen in Szenarien produzieren, die vorher funktionierten — und umgekehrt.
  • Compliance-Audits verlangen häufig explizite Snapshot-Pins statt der Nutzung rollierender Aliase.

Der Preis ist der Verzicht auf Within-Version-Verbesserungen. Der Nutzen ist vorhersagbares Produktiv-Verhalten. Für ausgelieferte Produkte mit etablierter Nutzerschaft ist dieser Tausch in der Regel lohnenswert.

Die Migrationsfrage

Bei datierten Snapshots reifer Modell-Linien teilt sich die Migrationsfrage in zwei Richtungen: vorwärts innerhalb der Version (auf das, was der rollierende Alias inzwischen akkumuliert hat) und vorwärts über Versionen hinweg (auf GPT-5.2 oder das, was OpenAI als Nächstes veröffentlicht hat).

Within-Version-Migration ist meist der risikoärmere Pfad. Dieselbe Modell-Linie, dasselbe allgemeine Verhalten, mit den akkumulierten Within-Version-Verfeinerungen. Lassen Sie Ihre Evaluation-Suite erneut durchlaufen und migrieren Sie, wenn die Within-Version-Updates nachweislich gewinnen.

Cross-Version-Migration ist die größere Veränderung. GPT-5.2 hat sein eigenes charakteristisches Verhalten, das in einer Weise von 5.1 abweicht, die über den Within-Version-Drift hinausgeht. Die Revalidierung ist aufwendiger, und das Migrationsziel ist ein bewegliches, bis die 5.2-Linie selbst datierte Snapshots zum Pinnen anbietet.

Wo es schwächelt

Dieselben Einschränkungen wie für den Rest der GPT-5-Linie.

Kostentier. Die Mini- und Nano-Geschwister sind die richtige Wahl für Workloads, bei denen ein Frontier-Sizing überdimensioniert ist.

Latenz. Die Latenz auf Frontier-Niveau ist höher als bei kleineren Geschwistern.

Kein Audio, kein Realtime-Voice, kein Video. Nutzen Sie die spezialisierten Endpoints.

Self-Hosted-Deployment nicht verfügbar.

Code-generation-lastige Workloads, bei denen die Codex-Varianten die bessere Wahl sind.

Wann genau dieser Snapshot zu pinnen ist

Wählen Sie gpt-5.1-2025-11-13, wenn:

  • Sie ein Produktivprodukt auf dem GPT-5.1-Launch-Verhalten vom November 2025 ausgeliefert haben und es stabil halten müssen.
  • Eine Compliance-Anforderung die Modellversion auf Snapshot-Ebene festschreibt.
  • Sie mitten in einer Evaluation von Within-Version-Updates oder von GPT-5.2 stecken und während dieser Evaluation eine stabile Produktiv-Baseline benötigen.

Lassen Sie ihn weg, wenn:

  • Sie neu starten — der rollierende gpt-5.1-Alias oder gpt-5.1-chat-latest ist der praktischere Default für aktive Entwicklung.
  • Within-Version-Updates in Ihrer Evaluation nachweislich gewonnen haben.
  • Das 5.2-Release in der Evaluation gegen 5.1 in den für Ihr Produkt relevanten Dimensionen gewonnen hat.
  • Ein anderes Modell im Katalog besser zum Workload passt — Mini/Nano für die Kostenklasse, Codex für Code, Audio-Geschwister für Voice.

Vergleichswerte Alternativen

Der rollierende gpt-5.1-Alias, wenn Sie Within-Version-Updates ohne Migrationsverwaltung wollen. gpt-5.1-chat-latest für konversationelle Use Cases, die gegen den rollierenden Tag optimiert sind. gpt-5.2, wenn die Evaluation der neueren Version gewonnen hat. Mini- und Nano-Geschwister für kostensensible Workloads. Die Codex-Varianten für code-lastige Arbeit.

Deployment-Hinweise

Standard Chat Completions API. Der Snapshot-Pin ist rein eine Modellnamen-Entscheidung; die API-Oberfläche, das Vision-Input-Verhalten, das Handling strukturierter Outputs und die Ergonomie der Tool-Nutzung sind unverändert gegenüber dem Tag, an dem 5.1 gelauncht wurde.

Token-Abrechnung zu den GPT-5-Frontier-Tier-Sätzen. Der Snapshot-Pin verändert die Kostenstruktur gegenüber dem rollierenden Alias nicht.

Die pragmatische Einschätzung. Das ist der GPT-5.1-Freeze vom November 2025. Pinnen Sie ihn, wenn Ihr Produktivprodukt gegen das Launch-Verhalten validiert wurde und Stabilität auf Snapshot-Ebene zählt. Migrieren Sie innerhalb der Version oder über Versionen hinweg, wenn Ihre eigene Evaluation sagt, dass der nächste Schritt der richtige ist. Vergleichen Sie ihn vor dem Commitment unter /live-test gegen die Alternativen.

Letzte technische Prüfung: 2026-05-22 — Tokonomix.ai

gpt-5.1-2025-11-13 — illustration 2gpt-5.1-2025-11-13 — illustration 3
Letzter automatisierter Test
14. Sept. 2026 · 20:03 UTC · Geschwindigkeits-Benchmark
P50-Latenz
853 ms
P95-Latenz
914 ms
Fehler
0 / 6 Läufe
Zuletzt geprüft von Tokonomix-Team·26. Mai 2026