Naar inhoud
Tier C — Specialist
Draait in:USGemaakt in:United States
$10.00
output · per 1M tokens (inkoopbasis)
Kosten
1,003 ms
Antwoordsnelheid
100 / 100
Intelligentie

Verdict — samenvattingLIVE

LIVE
nu · 2026-07-26

Quality decline and slower responses across tested categories

Quality dropped 6.8 points Latency increased 46% Multilingual remains at 100 Creative performance declined

This benchmark window reveals a significant performance regression for gpt-4o-2024-11-20. Overall quality dropped 6.8 points from 99.3 to 92.5, while latency increased by 46% with median response times rising from 1253ms to 1825ms. The category composition changed between windows, making direct comparisons limited, but the available data shows mixed results. Multilingual capabilities remained exceptional at 100 in both windows, demonstrating consistent strength in language handling. However, creative tasks scored 87 compared to the previous 98, indicating a notable decline in this area. Reasoning achieved a perfect 100 score, while factual performance registered at 83. The previous window's perfect coding score of 100 cannot be compared as coding was not tested in the current window. The substantial latency increase is particularly concerning for real-time applications, representing nearly half a second of additional wait time per request. Users should be aware that this version shows reduced creative capability and slower response times compared to the previous benchmark period, though multilingual and reasoning performance remain strong areas.

Quality

92.5

Latency p50

1,825 ms

Test runs

5

1 van 15

Beeld & uitlegLIVE

OpenAI

gpt-4o-2024-11-20

Tier C — Specialist

Tokonomix-redactie·Gecontroleerd door Mes Kalkan··

GPT-4o-2024-11-20 is een groot taalmodel ontwikkeld door OpenAI, uitgebracht in november 2024 als onderdeel van de GPT-4o-serie. Dit model vertegenwoordigt een iteratie van OpenAI's multimodale architectuur, hoewel het in deze implementatie primair functioneert voor standaard tekstgeneratietaken. Het is ontworpen voor algemene taalbegrips- en generatietaken, waaronder contentcreatie, het beantwoorden van vragen, codegeneratie, analyse en conversationele toepassingen. Het model bouwt voort op de GPT-4-architectuur met verfijningen gericht op het verbeteren van de kwaliteit van antwoorden, coherentie en het vermogen om instructies op te volgen. Hoewel specifieke technische details over het aantal parameters en trainingsdata door OpenAI niet worden vrijgegeven, toont het model prestatiekenmerken die consistent zijn met taalmodellen in de frontlinie. Het verwerkt tekstinvoer en genereert tekstuitvoer met capaciteiten die meerdere talen en kennisdomeinen omvatten, met een afsluitdatum voor trainingsdata medio 2023. Binnen OpenAI's modelaanbod staat GPT-4o-2024-11-20 als standaardoptie in de GPT-4o-familie, gepositioneerd tussen de eerdere GPT-4-modellen en OpenAI's recentere releases. De "o"-aanduiding in GPT-4o duidt op optimalisaties voor praktische implementatiescenario's. Deze specifieke snapshot vertegenwoordigt de staat van het model op de releasedatum in november 2024, en het dient als OpenAI's aanbevolen model voor algemene doeleinden voor toepassingen die betrouwbare tekstgeneratie vereisen zonder gespecialiseerde multimodale verwerkingsvereisten in deze configuratie.

gpt-4o-2024-11-20 van OpenAI is een veelzijdig taalmodel voor uiteenlopende zakelijke en creatieve toepassingen.

Tokonomix benchmark-samenvatting

Mogelijkheden

toolssource: litellmvisionjson modepdf inputjson schemaparallel toolsprompt cachingmax output tokens: 16384
gpt-4o-2024-11-20 — illustration 1
gpt-4o-2024-11-20: de late-2024 snapshot van 4o

gpt-4o-2024-11-20 is OpenAI's laatste grote snapshot van GPT-4o vóór de komst van de GPT-4.1-familie. Uitgebracht op 20 november 2024, vertegenwoordigt het het model in zijn volgroeide vorm — hetzelfde multimodale oppervlak als het lanceringsmodel, met de verbeteringen op het gebied van redeneren, schrijfkwaliteit en weigeringskalibratie die in de tweede helft van 2024 zijn doorgevoerd.

Voor teams die nog altijd 4o in productie draaien, is dit doorgaans de juiste pin. Voor nieuwe builds is het gesprek inmiddels verder.

Wat de release van november veranderde

De augustus-2024-snapshot kreeg de meeste structurele aandacht omdat die strict structured outputs introduceerde. De release van november was een stillere reeks wijzigingen die in productie minstens zo veel uitmaakte.

Redeneerkwaliteit. November is zichtbaar sterker op meerstaps-prompts dan zowel het lanceringsmodel als de augustus-snapshot. Chain-of-thought-achtig werk, planningsprompts, nieuwe codesynthese vanuit een vage specificatie — allemaal vertonen meetbare verbeteringen. Het model haalt niet het niveau van de op redeneren afgestemde opvolgers uit de GPT-5-familie, maar binnen de 4o-klasse was dit het hoogtepunt.

Schrijfkwaliteit. Long-form proza uit deze snapshot is merkbaar minder stijf dan uit de augustus-release. De zinsstructuur varieert meer, het model nuanceert minder wanneer de prompt dat niet rechtvaardigt, en het register is consistenter over alinea's heen. Teams die blogconcepten, executive summaries of andere productiematige tekstgeneratie op 4o draaien, pinnen alleen al om deze reden vaak op deze snapshot.

Weigeringskalibratie. Iets minder agressief dan augustus op grensgevallen. Sommige legitieme edge-case-verzoeken die de augustus-snapshot weigerde, gaan probleemloos door bij november.

Wat er in de snapshot zit

Het volledige GPT-4o-feature-oppervlak zoals dat in november 2024 stond. Tekst- en beeldinvoer met een contextvenster van 128k tokens. Audio wordt aangeboden via de realtime API en gelijktijdige endpoints. Strict structured outputs overgeërfd van augustus. JSON-modus. Function calling. Streaming op het Chat Completions-oppervlak.

Wat niet in deze snapshot zit, is iets uit de GPT-4.1-familie. De miljoen-token-context, de verdere redeneerverbeteringen, de bijgewerkte tokeniser-afhandeling — alles blijft bij de nieuwere familie. Als jouw workload daar werkelijk profijt van heeft, gaat het upgradegesprek over modelfamilie, niet alleen over snapshotdatum.

Waarom teams specifiek op november pinnen

De meeste 4o-pins die vandaag in productie staan, landen op deze datum of op de floating tag. De redenen zijn de gebruikelijke.

Compliance-regimes die deze identifier hebben goedgekeurd. De november-snapshot is recent genoeg dat tegen deze versie afgeronde auditcycli nog relevant zijn, wat hem tot de meest goedgekeurde gepinde 4o in gereguleerde omgevingen maakt.

Downstream-pipelines die zijn afgestemd op het novembergedrag. Teams die hun systemen rond de schrijf- of redeneerkwaliteit van deze snapshot hebben gebouwd — contentgeneratie, samenvattingsdiensten, agent-loops die afhankelijk zijn van de specifieke beslispatronen van november — pinnen om dat gedrag vast te leggen.

Uitstel van migratie. Voor teams die de overstap naar GPT-4.1 of GPT-5 nog niet hebben afgerond, biedt pinnen op november een stabiel doelwit terwijl het migratiewerk loopt. Floaten in productie tijdens een migratie is een recept voor bewegende doelen in de eval-rapporten.

Hoe het zich verhoudt tot waar het veld nu staat

GPT-4o op de november-snapshot zit niet langer aan de frontier. GPT-4.1, GPT-5 en de families Claude Opus 4.x en Gemini 3 Pro liggen allemaal duidelijk voor op redeneren, long-context-werk en structured-output-edge-cases.

Wat 4o nog wel in zijn voordeel heeft, is een deployment-verhaal dat goed begrepen wordt, een prijspunt dat vriendelijker is dan de frontier-tier, en een audio-oppervlak via gpt-4o-audio en de realtime API dat door geen enkele opvolger volledig is vervangen voor productie-spraakwerk.

Voor de cross-categorische vergelijking, zie /benchmarks/leaderboard. Snelheids- en intelligentie-uitsplitsingen op /benchmarks/speed en /benchmarks/intelligence.

Sunset-risico

Deze snapshot is de meest recente 4o-pin en daarmee het verst verwijderd van sunset, maar de deprecation-horizon is eindig. OpenAI's gebruikelijke cyclus van twaalf tot achttien maanden is van toepassing. Plan dienovereenkomstig.

De natuurlijke opvolger aan de 4o-familiekant is de floating tag, die het grootste deel van het novembergedrag voortzet met de kleine daaropvolgende verbeteringen erin verwerkt. De toekomstgerichte stap is GPT-4.1 of GPT-5, afhankelijk van de workload. Zorg dat de eval-cyclus klaarstaat voordat de deprecation-datum wordt aangekondigd.

Pin-patroon

Het patroon dat standhoudt:

  • Pin in eval, CI en geaudite workflows.
  • Float in productieverkeer, waar de kleine doorlopende verbeteringen meer waard zijn dan reproduceerbaarheid.
  • Vergelijk wekelijks de gepinde en floating versie tegen een vaste promptset om gedragsdrift op te sporen.

Specifiek voor november is de drift van de floating tag ten opzichte van deze snapshot vandaag klein genoeg dat de diff vaak schoon terugkomt. Dat verandert naarmate de tijd verstrijkt; laat de diff-job niet van de agenda glippen.

Voor het floating 4o-oppervlak, zie GPT-4o. Voor de familie die 4o vervangt voor nieuwe builds, zie GPT-4.1.

Wanneer kiezen

Gebruik gpt-4o-2024-11-20 wanneer:

  • Een compliance-regime deze identifier heeft goedgekeurd en dit jouw meest recente auditcyclus is.
  • Downstream-pipelines afhankelijk zijn van de schrijf- of redeneerkwaliteit van deze specifieke release.
  • Je 4o in productie draait en een stabiele pin wilt terwijl een migratie naar GPT-4.1 loopt.

Voor nieuwe builds: richt je op de nieuwere familie. November was een goede plek om te landen. Het staat niet langer vooraan in de rij.

Laatste technische review: 2026-05-22 — Tokonomix.ai

gpt-4o-2024-11-20 — illustration 2

Provider-vergelijkingLIVE

Provider-vergelijking
Vergelijk elke aanbieder van dit model — kostenbasis, kwaliteit, latency en uptime.
Azure OpenAI (EU - Sweden)EU
Invoerkosten$2.75
Uitvoerkosten$11.00
KwaliteitNog niet getest
Latency (p50)Nog niet getest
UptimeNog niet getest
Kosten per 1M tokens (kostenbasis)
OpenAIVSDit aanbod
Invoerkostenbeste$2.50
Uitvoerkosten$10.00
Kwaliteitbeste100.0
Latency (p50)beste1,003 ms
UptimeNog niet getest
Kosten per 1M tokens (kostenbasis)

Consensus-intelligentie

MODEL-BREED

Consensus-signalen zijn model-breed — nog niet per provider gesplitst.

8.0

Agent-bruikbaarheid (1–10)

Precisie-score

0

Unieke bevindingen

0

Gevalideerde verzoeken

Ernst van bevindingen

Hoog 100%Middel 0%Laag 0%

Community-stemmenLIVE

Community-stemmen
Wat echte bezoekers vinden — per provider.
Azure OpenAI (EU - Sweden)EU

Nog geen community-stemmen.

OpenAIVS

Nog geen community-stemmen.

Meer resultaten — per provider

Kwaliteit per categorie

CreatiefFeitelijkMeertaligheidRedeneren

Game-rubriek

Nog geen data.

Jury-oordeel

OK 95%Deels 5%Fout 0%

Games & arena

Nog geen data.

Snelheid & gezondheid

1,003 ms

Latency (p50)

Uptime

Vraag & antwoord — bladerenLIVE

1 van 80
🧠 intelligentieOpenAImultilingual · 2026-07-26score: 100

Bir mağazada %20 indirim uygulanıyor. 150 TL olan bir ürün indirimden sonra kaç TL olur?

Bir ürünün indirimli fiyatını hesaplamak için şu adımları izleyebiliriz: 1. **Ürünün indirime tabi olan miktarını hesaplayalım:** %20 indirim demek, ürün fiyatının %20'si kadar bir miktarın fiyatından düşüleceği anlamına gelir. 150 TL'nin %20'si: \( 150 \times 0,20 = 30 \, TL \) 2. **Ürünün indirimli fiyatını bulalım:** \( 150 - 30 = 120 \, TL \) Sonuç: İndirimden sonra ürünün fiyatı **120 TL** olur. 🙂

Test-historie — alle providersLIVE

Kwaliteitsscore over tijdlaatste 91
05-1507-26
Snelheid — p50-latentie over tijd

Een trend verschijnt zodra dit model op een paar verschillende dagen is getest.