Zum Inhalt
Tier C — Spezialist
Läuft in:USErstellt in:United States

Einstellungsdatum

Der Anbieter stellt dieses Modell am 28. September 2026 ein. Bis dahin funktioniert es wie gewohnt.

OpenAI

gpt-3.5-turbo-1106

Tier C — Spezialist

Tokonomix-Redaktionsteam·Geprüft von Mes Kalkan··

GPT-3.5 Turbo 1106 ist ein großes Sprachmodell, das von OpenAI entwickelt wurde und im November 2023 als Teil der GPT-3.5-Familie veröffentlicht wurde. Dieses Modell stellt eine iterative Verbesserung gegenüber früheren GPT-3.5-Versionen dar und integriert erweiterte Fähigkeiten zur Befolgung von Anweisungen sowie verbesserte Leistung bei verschiedenen Aufgaben der natürlichen Sprachverarbeitung. Es nutzt eine Transformer-basierte Architektur, die auf vielfältigen Internettext-Daten trainiert wurde, wobei OpenAI weder die exakte Parameteranzahl noch detaillierte Trainingsspezifikationen öffentlich bekannt gegeben hat. Das Modell ist für universelle Textgenerierungsanwendungen konzipiert, darunter konversationelle KI, Content-Erstellung, Zusammenfassung, Übersetzung und Frage-Antwort-Aufgaben. Es verarbeitet Texteingaben und generiert menschenähnliche Antworten basierend auf den während des Trainings erlernten Mustern. GPT-3.5 Turbo 1106 unterstützt standardmäßige textbasierte Interaktionen und kann komplexe Anweisungen verarbeiten, während es den Kontext über mehrstufige Konversationen hinweg beibehält. Das Modell zeigt Kompetenz über mehrere Domänen und Sprachen hinweg, wobei die Leistung je nach spezifischer Aufgabe und Sprache variieren kann. Innerhalb der Modellreihe von OpenAI liegt GPT-3.5 Turbo 1106 hinsichtlich Fähigkeiten und Reasoning-Leistung unter der fortschrittlicheren GPT-4-Serie. Es dient als leistungsfähige Option für Anwendungen, bei denen die zusätzliche Komplexität der GPT-4-Modelle nicht erforderlich ist. Das Modell ist über die API von OpenAI zugänglich und wurde in verschiedene Anwendungen und Dienste integriert. Diese Version löste frühere GPT-3.5 Turbo-Iterationen ab und bietet verbesserte Zuverlässigkeit sowie Function-Calling-Funktionen für Entwickler, die KI-gestützte Anwendungen erstellen.

GPT-3.5 Turbo 1106 markiert eine ausgewogene Wahl für Anwendungen, die solide Sprachverarbeitung ohne die Komplexität fortgeschrittener Modelle benötigen. Als November-2023-Release verbessert es die Instruktionsbefolgung gegenüber früheren GPT-3.5-Versionen.

Tokonomix Modellanalyse
Abschnitt 01

Geschwindigkeitsanalyse

Latenz über alle Benchmark-Läufe gemessen. P50 (Median) und P95 (95. Perzentil) zeigen ein realistisches Bild der Antwortgeschwindigkeit bei normaler und Spitzenlast.

P50-Latenz (Median)P95-Latenz97 runs
368126421593055395008-2209-15ms
Abschnitt 02

Qualitätswerte

Wie sich dieses Modell je Prompt-Kategorie zum übrigen Feld verhält, aus einem paarweisen Fit über dieselben Prompts. Die rohe Jury-Wertung steht unter jeder Zahl.

55%
Codegenerierung
Jury-Mittel 95
54%
Kreativ
Jury-Mittel 91
23%
Faktisch
Jury-Mittel 56
56%
Mehrsprachig
Jury-Mittel 92
52%
Schlussfolgern
Jury-Mittel 81
18%
Gesundheit
Jury-Mittel 64

Gewinnrate je Kategorie: wie oft dieses Modell ein durchschnittliches Modell bei einem Prompt dieser Kategorie schlägt. 50% ist der Durchschnitt, keine schlechte Note. Es ist kein Prozentsatz richtiger Antworten.

Abschnitt 03

Preise

Was Sie pro Million Tokens zahlen, wenn Sie dieses Modell über Tokonomix nutzen, plus eine Schätzung für ein typisches Gespräch.

💰
API-Tarife — gpt-3.5-turbo-1106
$1.50 pro 1M Input-Tokens
$2.99 pro 1M Output-Tokens
≈ $0.0015 pro typischem Gespräch (800 Tokens)
Input- vs. Output-Preis (pro 1M Tokens)
pro 1M Input-Tokens$1.50
pro 1M Output-Tokens$2.99
Abschnitt 04

Tokens pro Sekunde

Durchsatz in Tokens pro Sekunde, abgeleitet aus gemessener P50-Latenz. Höhere Werte sind besser; Schwankungen spiegeln die Provider-seitige Last wider.

Durchsatz (Tokens / s)202 / avg 197
53854

Geschätzt aus P50-Latenz × 200 Output-Tokens — die absolute Zahl hängt von dieser Annahme ab; entscheidend ist der Trend.

Abschnitt 05

Stärken & Schwächen

Basierend auf Benchmark-Ergebnissen und aggregiertem Community-Feedback zu realen Anwendungsfällen.

Stärken

Verbesserte InstruktionsbefolgungMehrsprachige KonversationsfähigkeitKontexterhaltung über mehrere TurnsBreite DomänenkompetenzEtablierte API-IntegrationVielseitige NLP-AufgabenZuverlässige TexterzeugungMehrsprachiger Support

Schwächen

Wissenstand von 2023Begrenzte Reasoning-Fähigkeiten vs. GPT-4Nur Text, keine MultimodalitätNeuere Modelle verfügbar
Abschnitt 06

Fähigkeiten

toolssource: litellmparallel toolsprompt cachingmax output tokens: 4096
Abschnitt 07

Häufig gestellte Fragen

Die 1106-Version bietet verbesserte Instruktionsbefolgung und optimierte Performance bei verschiedenen NLP-Aufgaben. Es wurde im November 2023 veröffentlicht und repräsentiert eine iterative Verbesserung der GPT-3.5-Familie.

Für produktionsreife Anwendungen mit moderaten Anforderungen bietet dieses Modell ein bewährtes Fundament, auch wenn neuere Alternativen in spezifischen Bereichen überlegen sein können. Es bleibt eine praktikable Option für Projekte, die etablierte Stabilität priorisieren.

Tokonomix Redaktion
Abschnitt 08

Verfügbarkeit

Verfügbarkeit

Noch keine Messdaten

Es wurden noch nicht genug API-Aufrufe aufgezeichnet, um Verfügbarkeitsstatistiken für dieses Modell anzuzeigen. Daten erscheinen, sobald das Modell Live-Traffic erhält.

Abschnitt 09

Tokonomix-Benchmark-Urteile

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-582/100 · 146 runs
98 correct23 partial25 wrong67% accuracy
2026-09-13

Quality drops 20 points with increased latency and narrow test coverage

The GPT-3.5-Turbo-1106 model shows significant performance degradation in this benchmark window. Overall quality has declined from 85.9 to 66.2, a drop of nearly 20 points, while median latency has increased by 50 percent from 1373ms to 2062ms. The current test window reveals a concerning pattern with only three categories evaluated compared to the previous window's broader coverage. Reasoning performance achieved a perfect score of 100, and coding capability remained strong at 85, down slightly from the previous 95. However, factual accuracy has collapsed to just 14 points, representing a critical weakness that was not measured in the prior window. The absence of multilingual and creative writing assessments in the current window makes direct comparison difficult, but the available data suggests potential instability or regression in the model's capabilities. Users should exercise caution particularly in factual retrieval tasks and be prepared for slower response times. The dramatic shift in measured performance may indicate either actual model changes or inconsistencies in the evaluation methodology across windows.

Qualität

66.2

Latenz p50

2,062 ms

Testläufe

5

Quality dropped 20 points Latency increased 50% Factual accuracy critically low Perfect reasoning score maintained
Abschnitt 10

Vollständiges Modellprofil

gpt-3.5-turbo-1106 — illustration 1

⚠️ Veraltetes Modell. OpenAI hat dieses Modell außer Betrieb genommen. Für neue Projekte siehe GPT-4o mini für kosteneffiziente allgemeine Nutzung oder GPT-4.1 für stärkeres Reasoning. Bestehende Integrationen sollten die Migration planen, bevor der API-Endpunkt eingestellt wird.

gpt-3.5-turbo-1106: der Snapshot, der JSON-Modus einführte

gpt-3.5-turbo-1106 ist der datierte Snapshot von GPT-3.5 Turbo, der am 6. November 2023 veröffentlicht wurde. Es war die OpenAI-DevDay-Veröffentlichung — das Modell, das JSON-Modus, paralleles Function Calling und Reproduzierbarkeits-Seed-Parameter in die 3.5-Linie brachte.

Das Modell ist jetzt veraltet. Die gepinnte Kennung löst immer noch auf, aber neue Builds sollten auf ein aktuelles Modell abzielen.

Was in dieser Version ausgeliefert wurde

Die Veröffentlichung vom 6. November 2023 ging weniger um Verbesserungen der Modellgewichte und mehr um API-Oberflächenfunktionen. Die 3.5-Linie erreichte eine Art Reife; OpenAI nutzte diese Veröffentlichung, um die Deployment-Zeit-Kontrollen hinzuzufügen, nach denen Produktionsteams gefragt hatten.

JSON-Modus. Vor 1106 bedeutete das Erhalten von zuverlässigem JSON aus 3.5 Turbo Prompt-Engineering und einen defensiven Parser. Die 1106-Veröffentlichung fügte ein Flag hinzu, das die Generierung auf gültiges JSON beschränkte. Die Beschränkung war keine strikte Schema-Durchsetzung — das kam später —, aber sie reichte aus, um JSON-förmige Ausgaben zuverlässig zu machen, ohne Prompt-Layer-Tricks. Für Datenextraktions-Pipelines, die das ältere Verhalten umgangen hatten, war dies eine echte Vereinfachung.

Paralleles Function Calling. Die frühere Function-Calling-Unterstützung auf 3.5 war sequenziell — das Modell konnte einen Tool-Aufruf nach dem anderen anfordern, und man musste für den nächsten zurück zum Modell gehen. Die 1106-Veröffentlichung fügte die Fähigkeit hinzu, dass das Modell mehrere Tool-Aufrufe in einer einzigen Antwort anfordern konnte. Agent-Loops, die zuvor N Roundtrips für N Tool-Aufrufe benötigten, konnten auf einen einzigen kollabieren.

Reproduzierbarkeit. Der seed-Parameter landete in dieser Version. Übergebe denselben Seed und denselben Prompt, erhalte dieselbe Ausgabe meistens. Der Teil „meistens" ist wichtig — der Parameter verbesserte die Reproduzierbarkeit, ohne sie zu garantieren, weil Nicht-Determinismus im Inference-Stack immer noch durchsickerte. Aber für Evaluierungsarbeit und Debugging war der Seed nützlich genug, dass die meisten Produktionsteams begannen, ihn zu verwenden.

Was gleich blieb

Das zugrundeliegende Modellverhalten. 1106 war die 3.5-Generation unter der Haube. Reasoning-Tiefe, Faktentreue, Ablehnungs-Kalibrierung — alles ungefähr dasselbe wie bei den Snapshots unmittelbar davor. Die Veröffentlichung drehte sich um Deployment-Ergonomie, nicht darum, das Modell intelligenter zu machen.

Kontextfenster. 16.385 Token. Lang genug für den meisten Chat-Traffic, kurz genug, dass Workloads mit langen Dokumenten regelmäßig an die Grenze stießen.

Kostenprofil. Die Preisgestaltung der 3.5-Familie verankerte weiterhin das günstige Ende der OpenAI-Produktpalette.

Warum Teams auf 1106 pinnten

Für Workloads, die von den API-Funktionen abhingen, die dieser Snapshot einführte, war 1106 der richtige Pin Ende 2023 und bis ins Jahr 2024 hinein.

JSON-Modus-abhängige Pipelines. Jedes Team, das um den neuen JSON-Modus im November 2023 herum baute, wollte Reproduzierbarkeit gegen den spezifischen Snapshot, der ihn einführte. Das Verhalten unterschied sich leicht von späteren Versionen, und nachgelagerte Parser, die auf 1106 abgestimmt waren, konnten beim Bump regressieren.

Multi-Tool-Agent-Loops. Frühe Agent-Frameworks, die paralleles Function Calling nutzten, pinnten auf 1106, weil das spezifische Verhalten des Aufrufmusters — wann das Modell Aufrufe bündelte, wie es sie ordnete, welche Argumente es produzierte — empfindlich auf den Snapshot reagierte.

Reproduzierbarkeits-abhängige Evaluierung. Forschungs- und CI-Workflows, die den Seed-Parameter im November 2023 zu verwenden begannen, pinnten oft auf 1106, weil das Verhalten des Parameters neu genug war, dass das Team nicht auch den Modell-Snapshot im selben Experiment variieren wollte.

Der 0125-Snapshot, der zweieinhalb Monate später veröffentlicht wurde, war eine polierte Version desselben Feature-Sets. Der meiste Produktions-Traffic, der auf 1106 begann, migrierte innerhalb eines Quartals zu 0125.

Migrationsziele

Für JSON-Modus-abhängige Workloads ist die strikte Structured-Outputs-Funktion, die im GPT-4o-Snapshot vom August 2024 und über die GPT-4.1-Familie hinweg landete, das bessere Ziel als ein weiterer 3.5-Snapshot. Schema-Durchsetzung auf der Inference-Ebene ist materiell zuverlässiger als JSON-Modus-mit-defensivem-Parsing.

Für Agent-Loop-Workloads, die auf parallelem Function Calling aufgebaut sind, funktioniert dasselbe Aufrufmuster auf GPT-4o, GPT-4.1 und der 4.1-Mini-Variante. Das Verhaltens-Delta ist klein genug, dass die Migration normalerweise ein Tag-Swap plus eine Re-Evaluierung ist.

Für Reproduzierbarkeits-abhängige Eval-Workflows wird der Seed-Parameter über die aktuelle OpenAI-Produktpalette hinweg unterstützt. Der Wechsel von 1106 zu einem aktuellen Modell bedeutet, die geseedeten Eval-Ausgaben gegen das neue Modell neu zu basieren; der Parameter selbst ändert sich nicht.

Was heute zu tun ist

Wenn 1106 immer noch in Ihrem Stack gepinnt ist, spiegeln die Aktionspunkte den Rest der 3.5-Familie wider. Prüfen Sie den Workload, um zu bestätigen, dass der Pin sich immer noch lohnt. Führen Sie eine gemessene Evaluierung gegen das Kandidaten-Migrationsziel durch. Planen Sie den Übergang für ein Release-Fenster Ihrer Wahl und nicht unter Deprecation-Druck.

Der spezifische 1106-Fall, auf den man achten sollte, ist nachgelagerter Code, der vom frühen Parallel-Function-Calling-Verhalten abhängt. Einige Agent-Frameworks, die gegen diesen Snapshot gewachsen sind, haben Grenzfälle darin, wie sie Multi-Tool-Antworten parsen, die technisch gegen spätere Modelle gültig sind, aber sich verhaltenstechnisch unterscheiden. Testen Sie die Loops erneut, nicht nur das Modell.

Für den kategorieübergreifenden Vergleich siehe /benchmarks/leaderboard. Für den Kontext des schwebenden 3.5-Tags siehe GPT-3.5 Turbo.

Auswahl dieses Modells

Wählen Sie diesen Snapshot nicht für neue Builds. Die 3.5-Familie ist veraltet.

Für bestehende 1106-Integrationen sind die natürlichen Nachfolger GPT-4o mini für allgemeinen Chat-Traffic und GPT-4.1 mini oder volles GPT-4.1 für Workloads, bei denen die Reasoning-Obergrenze der 3.5-Generation bereits eine Einschränkung war. Planen Sie die Migration, bevor das Deprecation-Datum eintrifft.

Letzte technische Überprüfung: 2026-05-22 — Tokonomix.ai

gpt-3.5-turbo-1106 — illustration 2gpt-3.5-turbo-1106 — illustration 3
Letzter automatisierter Test
15. Sept. 2026 · 02:05 UTC · Geschwindigkeits-Benchmark
P50-Latenz
989 ms
P95-Latenz
2367 ms
Fehler
0 / 6 Läufe
Zuletzt geprüft von Tokonomix-Team·26. Mai 2026