Zum Inhalt
Tier C — Spezialist
Läuft in:USErstellt in:United States
OpenAI

gpt-4o-mini-2024-07-18

Tier C — Spezialist

Tokonomix-Redaktionsteam·Geprüft von Mes Kalkan··

GPT-4o-mini-2024-07-18 ist ein kompaktes Sprachmodell von OpenAI, das im Juli 2024 als Teil der GPT-4o-Modellfamilie veröffentlicht wurde. Es stellt eine kleinere, effizientere Variante der GPT-4o-Architektur dar und wurde entwickelt, um leistungsfähige Textgenerierung bei geringerem Rechenaufwand als die größeren Pendants zu ermöglichen. Das Modell behält die multimodale Architekturbasis der GPT-4o-Reihe bei, konzentriert sich in dieser Variante jedoch vorrangig auf textbasierte Aufgaben. Das Modell ist für Anwendungen konzipiert, die Standardfunktionen zur Textgenerierung bei reduzierter Latenz und geringerem Ressourcenbedarf erfordern. Es bewältigt Aufgaben wie Inhaltserstellung, Fragebeantwortung, Zusammenfassung, Codegenerierung und dialogbasierte Interaktionen. Die Bezeichnung „mini" weist auf seine Positionierung als leichtgewichtige Option hin, die für Anwendungsfälle geeignet ist, in denen die vollständigen Fähigkeiten größerer Modelle nicht zwingend erforderlich sind – also für Anwendungen mit hohem Volumen oder Einsatzszenarien mit Ressourcenbeschränkungen. Innerhalb des Modellportfolios von OpenAI ist GPT-4o-mini hinsichtlich Leistungsfähigkeit und Kapazität unterhalb der Flaggschiffmodelle GPT-4o und GPT-4 Turbo angesiedelt und bietet eine Balance zwischen Leistung und Effizienz. Es löste frühere kompakte Modelle im Portfolio von OpenAI ab und bietet verbesserte Leistungsmerkmale gegenüber GPT-3.5-basierten Alternativen, bleibt dabei jedoch für ein breiteres Anwendungsspektrum zugänglich. Das Modell steht für OpenAIs fortlaufende Bemühungen, vielfältige Optionen über unterschiedliche Leistungs- und Effizienzprofile hinweg bereitzustellen.

GPT-4o-mini positioniert sich als pragmatische Arbeitsmaschine für Anwendungen, bei denen Durchsatz und Antwortlatenz wichtiger sind als die volle Modelltiefe der Flaggschiff-Varianten.

Tokonomix Redaktionsnotiz
Abschnitt 01

Geschwindigkeitsanalyse

Latenz über alle Benchmark-Läufe gemessen. P50 (Median) und P95 (95. Perzentil) zeigen ein realistisches Bild der Antwortgeschwindigkeit bei normaler und Spitzenlast.

P50-Latenz (Median)P95-Latenz96 runs
372185133294808628608-2209-14ms
Abschnitt 02

Qualitätswerte

Wie sich dieses Modell je Prompt-Kategorie zum übrigen Feld verhält, aus einem paarweisen Fit über dieselben Prompts. Die rohe Jury-Wertung steht unter jeder Zahl.

61%
Codegenerierung
Jury-Mittel 98
70%
Kreativ
Jury-Mittel 94
44%
Faktisch
Jury-Mittel 67
58%
Mehrsprachig
Jury-Mittel 95
65%
Schlussfolgern
Jury-Mittel 95
49%
Gesundheit
Jury-Mittel 67

Gewinnrate je Kategorie: wie oft dieses Modell ein durchschnittliches Modell bei einem Prompt dieser Kategorie schlägt. 50% ist der Durchschnitt, keine schlechte Note. Es ist kein Prozentsatz richtiger Antworten.

Abschnitt 03

Preise

Was Sie pro Million Tokens zahlen, wenn Sie dieses Modell über Tokonomix nutzen, plus eine Schätzung für ein typisches Gespräch.

💰
API-Tarife — gpt-4o-mini-2024-07-18
$0.3000 pro 1M Input-Tokens
$1.17 pro 1M Output-Tokens
≈ $0.0004 pro typischem Gespräch (800 Tokens)
Input- vs. Output-Preis (pro 1M Tokens)
pro 1M Input-Tokens$0.3000
pro 1M Output-Tokens$1.17
Abschnitt 04

Tokens pro Sekunde

Durchsatz in Tokens pro Sekunde, abgeleitet aus gemessener P50-Latenz. Höhere Werte sind besser; Schwankungen spiegeln die Provider-seitige Last wider.

Durchsatz (Tokens / s)361 / avg 385
532154

Geschätzt aus P50-Latenz × 200 Output-Tokens — die absolute Zahl hängt von dieser Annahme ab; entscheidend ist der Trend.

Abschnitt 05

Stärken & Schwächen

Basierend auf Benchmark-Ergebnissen und aggregiertem Community-Feedback zu realen Anwendungsfällen.

Stärken

Niedrige Latenz bei TextaufgabenGünstig pro AnfrageSkaliert für hohes AnfragevolumenSolide für Klassifikation und ExtraktionStabile KonversationsqualitätGute Integration ins OpenAI-ÖkosystemBrauchbar für Zusammenfassungen und DraftsFunction Calling und Tool-Use unterstützt

Schwächen

Schwächer bei komplexem ReasoningWissensstand begrenzt auf 2024Multimodale Tiefe eingeschränktWeniger robust in seltenen Sprachen
Abschnitt 06

Fähigkeiten

toolssource: litellmvisionjson modepdf inputjson schemaparallel toolsprompt cachingmax output tokens: 16384
Abschnitt 07

Häufig gestellte Fragen

Immer dann, wenn Latenz, Kosten pro Aufruf oder Skalierung wichtiger sind als die maximale Modellqualität. Für Routineaufgaben wie Klassifikation, Extraktion oder kurze Antworten ist die Mini-Variante meist ausreichend.

Für Standard-Textaufgaben in hoher Frequenz ist das Modell eine solide Wahl, sobald man die Grenzen bei komplexem Reasoning und multimodalen Spezialfällen akzeptiert.

Tokonomix Bewertungsfazit
Abschnitt 08

Verfügbarkeit

Verfügbarkeit

Noch keine Messdaten

Es wurden noch nicht genug API-Aufrufe aufgezeichnet, um Verfügbarkeitsstatistiken für dieses Modell anzuzeigen. Daten erscheinen, sobald das Modell Live-Traffic erhält.

Abschnitt 09

Tokonomix-Benchmark-Urteile

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-588/100 · 146 runs
118 correct14 partial14 wrong81% accuracy
2026-09-13

Significant quality decline with increased latency and narrowed test coverage

The gpt-4o-mini model shows concerning degradation in this benchmark window, with overall quality dropping 19.2 points to 67.7 from the previous 86.9. Latency has worsened considerably, increasing 47% from 1689ms to 2479ms at the median, suggesting possible infrastructure or optimization issues. The current testing window reveals a dramatically different performance profile, with only three categories evaluated compared to the previous window's broader assessment. Reasoning performance stands at a perfect 100 and coding remains strong at 92, indicating the model maintains capabilities in technical domains. However, factual accuracy has collapsed to just 11, representing a critical weakness that users should be aware of. The absence of multilingual and creative category scores in the current window makes direct comparison difficult, though the previous window showed these at 92 and 74 respectively. The substantial quality drop combined with increased response times suggests either a model regression, changes in evaluation methodology, or infrastructure challenges. Users relying on factual accuracy should exercise particular caution, while those focused on coding and reasoning tasks may still find adequate performance despite the slower responses.

Qualität

67.7

Latenz p50

2,479 ms

Testläufe

5

Quality dropped 19.2 points Latency increased 47% Factual accuracy at 11 Reasoning performance remains perfect
Abschnitt 10

Vollständiges Modellprofil

gpt-4o-mini-2024-07-18 — illustration 1
gpt-4o-mini-2024-07-18: der ursprüngliche Mini-Freeze

gpt-4o-mini-2024-07-18 ist der datierte Snapshot vom Juli 2024 des kleinen GPT-4o-Modells von OpenAI. Der erste stabile Freeze der Mini-Linie. Derjenige, der ausgeliefert wurde, als OpenAI gpt-3.5-turbo aus dem Standard-Slot für günstige Modelle zurückgezogen und Mini an dessen Stelle gesetzt hat.

Das ist der Snapshot, den man pinnt, wenn "gpt-4o-mini" weitergerollt ist und dabei etwas bei Ihnen kaputtgemacht hat, oder wenn ein nachgelagerter Vertrag exakt das Verhalten des ursprünglichen Releases verlangt.

Was dieser Snapshot ist

Der Freeze vom Juli 2024 ist der erste Mini-Snapshot überhaupt. Mit diesem Release hatte das Modell:

  • Das 128k-Kontextfenster festgelegt, das über die gesamte Linie hinweg konstant geblieben ist.
  • Vision-Input-Unterstützung als Standardfähigkeit verankert, statt sie als separaten Endpunkt zu führen.
  • Die Tool-Use-Ergonomie etabliert, die spätere Mini-Snapshots geerbt haben.

Was er im Vergleich zum rollenden Alias mit Stand Mitte 2026 nicht hat:

  • Den Feinschliff beim Instruction-Following, den nachfolgende Mini-Snapshots ergänzt haben.
  • Die Verbesserungen bei der Zuverlässigkeit strukturierter Ausgaben, die über die Revisionen im Jahr 2025 hinweg eingeflossen sind.
  • Die Verfeinerungen der Refusal-Haltung, die die gelegentliche Übervorsicht des Ursprungsreleases geglättet haben.

Für ein Produktionsdeployment, das gegen genau diesen Snapshot gebaut und validiert wurde, können diese Lücken die falsche Art von "Verbesserung" sein — Sie haben sich auf spezifisches Verhalten stabilisiert, und ein Vorwärtsrollen bedeutet, alles erneut zu validieren.

Wann sich das datierte Pinning lohnt

Das Argument, beim 2024-07-18 zu bleiben statt beim rollenden gpt-4o-mini-Alias, ist dasselbe wie bei jedem datierten Snapshot: Sie tauschen Zugriff auf Verbesserungen gegen Verhaltensvorhersagbarkeit.

Konkrete Situationen, in denen sich das Pinning auszahlt:

  • Regulierte Workloads mit Modellversionsnachweis im Audit-Trail. Der Compliance-Verantwortliche möchte morgen dasselbe Modellverhalten, das die Dokumentation heute beschreibt. Der datierte Snapshot ist das, was dieses Versprechen ehrlich macht.
  • Produktions-Pipelines mit Prompt-Templates, die auf spezifische Modell-Eigenheiten abgestimmt sind. Neuere Snapshots verarbeiten denselben Prompt möglicherweise leicht anders — im Durchschnitt besser, in den Edge Cases, auf die Ihre Prompts getuned wurden, schlechter.
  • Langlaufende A/B-Tests, bei denen der Kontrollarm über Monate konstant bleiben muss.
  • Kundenseitige Produkte, bei denen die Konsistenz von Tonalität und Refusal-Sprache wichtiger ist als inkrementelle Qualitätsgewinne.

Für die meisten anderen Anwendungsfälle ist das Mitlaufen mit dem Alias die bessere Standardentscheidung.

Wann man weg migrieren sollte

Der ehrliche Migrationspfad ist nach vorn — zu einem aktuelleren Mini-Snapshot oder zu einem ganz anderen Modell.

So sieht die Entscheidung aus:

  • Die vollständige Evaluations-Suite gegen den aktuellen rollenden Alias und gegen den jüngsten datierten Snapshot erneut ausführen.
  • Anhand der Metriken vergleichen, die für Ihr Produkt zählen, nicht anhand der Metriken aus OpenAIs Release Notes.
  • Migrieren, wenn der neuere Snapshot in Ihrer Evaluation gewinnt. Bleiben, wenn nicht.

OpenAIs Deprecation-Policy gibt eine Vorankündigung, bevor datierte Snapshots zurückgezogen werden, aber diese Policy ist die Untergrenze, nicht die Obergrenze. Behandeln Sie das datierte Pinning als Übergangsvertrag, nicht als dauerhafte Heimat.

Wo das Modell auf der Strecke bleibt

Dieselben Beschränkungen wie für den Rest der Mini-Linie.

Hartes Reasoning an der Spitze. Mini muss hier Boden gegen das größere GPT-4o und die GPT-5-Familie abgeben. Der Vergleich auf Kategorieebene findet sich unter /benchmarks/leaderboard.

Audio, Echtzeit-Stimme oder Video. Das ist die Domäne der spezialisierten Geschwistermodelle.

Self-hosted-Deployment. Keine Weights, keine On-Prem-Option. Die Übersicht unter /usecases/local ist die richtige Referenz, wenn diese Anforderungen greifen.

Robustheit gegen Angriffe. Kleine Modelle sind leichtere Ziele für Prompt Injection als große. Mini-Klasse-Modelle jedes Anbieters teilen sich diese Schwäche.

Wann genau diesen Snapshot pinnen

Wählen Sie gpt-4o-mini-2024-07-18, wenn:

  • Sie ein Produkt auf dem Mini-Verhalten vom Juli 2024 ausgeliefert haben und die Kosten einer erneuten Validierung gegen einen neueren Snapshot den Nutzen überwiegen.
  • Ein regulierter Workflow das Version-Pinning auf Modellebene zu Auditzwecken vorschreibt.
  • Ein A/B-Test oder Forschungsprotokoll eine über die Zeit fixierte Modellreferenz benötigt.

Verzichten Sie darauf, wenn:

  • Sie neu starten — pinnen Sie stattdessen den jüngsten Mini-Snapshot.
  • Die Verbesserungen späterer Snapshots in Ihrem Evaluations-Harness nachweislich gewinnen.
  • Das Deployment den rollenden Alias verträgt und von automatischen Upgrades profitiert.

Deployment-Hinweise

Standard-Chat-Completions-API. Das Verhalten von Tool-Use und strukturierter Ausgabe ist unverändert seit dem Tag, an dem der Snapshot eingefroren wurde. Vision-Input funktioniert über alle Mini-Snapshots hinweg identisch.

Hosted Fine-Tuning wird unterstützt, was diesen Snapshot zu einer vernünftigen Basis für eine feinabgestimmte Mini-Variante macht, wenn Sie Qualität in einem engen Fachgebiet brauchen, ohne die Inferenzkosten der Frontier-Modelle zu bezahlen.

Die pragmatische Lesart. Das ist der erste stabile Freeze der Mini-Linie. Nutzen Sie ihn weiter, wenn Verhaltensstabilität Priorität hat. Wechseln Sie zu einem neueren Snapshot, wenn Ihre Evaluation es Ihnen sagt — nicht weil OpenAI eine Release Note veröffentlicht hat. Vergleichen Sie unter /live-test Seite an Seite, bevor Sie migrieren.

Letzte technische Prüfung: 22.05.2026 — Tokonomix.ai

gpt-4o-mini-2024-07-18 — illustration 2
Letzter automatisierter Test
14. Sept. 2026 · 20:04 UTC · Geschwindigkeits-Benchmark
P50-Latenz
554 ms
P95-Latenz
593 ms
Fehler
0 / 6 Läufe
Zuletzt geprüft von Tokonomix-Team·26. Mai 2026