Naar inhoud
Tier C — Specialist
Draait in:USGemaakt in:United States

Einddatum

De aanbieder stopt op 23 oktober 2026 met dit model. Tot die tijd werkt het gewoon.

OpenAI

gpt-4

Tier C — Specialist

Tokonomix-redactie·Gecontroleerd door Mes Kalkan··

GPT-4 is een grootschalig multimodaal taalmodel ontwikkeld door OpenAI, uitgebracht in maart 2023. Het vertegenwoordigt de vierde generatie in OpenAI's GPT (Generative Pre-trained Transformer) serie en accepteert zowel tekst- als beeldinvoer terwijl het tekstuitvoer produceert. Het model is gebouwd op transformer-architectuur en getraind op divers internettekst en andere gegevensbronnen, hoewel OpenAI geen specifieke details heeft vrijgegeven over de grootte van de trainingsdataset, architectuurparameters of exacte trainingsmethodologie. Het model is ontworpen voor een breed scala aan natural language processing-taken, waaronder tekstgeneratie, het beantwoorden van vragen, samenvatten, vertalen en complex redeneren. GPT-4 laat verbeterde prestaties zien ten opzichte van zijn voorganger GPT-3.5 op gebieden zoals feitelijke nauwkeurigheid, redeneercapaciteiten en het volgen van complexe instructies. Het toont verbeterd vermogen om genuanceerde prompts te verwerken en coherente context te behouden tijdens langere gesprekken. Het model vertoont ook betere prestaties op professionele en academische benchmarks, waaronder gestandaardiseerde tests en programmeeruitdagingen. Binnen OpenAI's modelaanbod staat GPT-4 in de hoogste categorie als het meest capabele aanbod, als opvolger van GPT-3.5 en de eerdere GPT-3 varianten. Het is beschikbaar via OpenAI's API en drijft de ChatGPT Plus-abonnementsdienst aan. Het model heeft een contextvenster dat varieert per versie, waarbij standaardimplementaties enkele duizenden tokens verwerken. OpenAI heeft sinds de initiële lancering meerdere varianten van GPT-4 uitgebracht met verschillende mogelijkheden en contextlengtes.

gpt-4 van OpenAI is een veelzijdig taalmodel voor uiteenlopende zakelijke en creatieve toepassingen.

Tokonomix benchmark-samenvatting
Sectie 01

Snelheidsanalyse

Latency gemeten over alle benchmark-runs. P50 (mediaan) en P95 (95e percentiel) geven een realistisch beeld van de responssnelheid onder normale en piekbelasting.

P50 latency (mediaan)P95 latency96 runs
43994214451947245008-2209-14ms
Sectie 02

Kwaliteitsscores

Hoe dit model zich per promptcategorie verhoudt tot de rest van het veld, uit een paarsgewijze berekening over dezelfde prompts. Het ruwe jurycijfer staat onder elk getal.

58%
Code generatie
jurygemiddelde 95
33%
Creatief
jurygemiddelde 86
41%
Feitelijk
jurygemiddelde 81
54%
Meertaligheid
jurygemiddelde 94
60%
Redeneren
jurygemiddelde 88
43%
Zorg
jurygemiddelde 76

Winstpercentage per categorie: hoe vaak dit model een gemiddeld model verslaat op een prompt uit die categorie. 50% is gemiddeld, geen onvoldoende. Het is geen percentage goede antwoorden.

Sectie 03

Prijzen

Wat je per miljoen tokens betaalt als je dit model via Tokonomix gebruikt, plus een schatting voor een gemiddeld gesprek.

💰
API-tarieven — gpt-4
$39.00 per 1M input-tokens
$78.00 per 1M output-tokens
≈ $0.0390 per typisch gesprek (800 tokens)
Input vs output prijs (per 1M tokens)
per 1M input-tokens$39.00
per 1M output-tokens$78.00
Sectie 04

Tokens per seconde

Doorvoersnelheid in tokens per seconde, afgeleid uit gemeten P50-latency. Hogere waarden zijn beter; fluctuaties weerspiegelen serverbelasting bij de provider.

Doorvoer (tokens / s)201 / avg 256
45193

Geschat uit P50-latency × 200 output-tokens — het absolute getal hangt af van deze aanname; de trend is wat telt.

Sectie 05

Sterke & zwakke punten

Gebaseerd op benchmark-resultaten en geaggregeerde community-feedback over echte use-cases.

Sterke punten

Sterke algehele taalvaardigheidHeldere, coherente schrijfstijlBetrouwbare codeondersteuningUitstekende instructieopvolgingContextvenster van standaardGoede balans snelheid en kwaliteitMeertalige verwerking

Zwakke punten

Minder sterk dan topmodellenBeperkter bij zeer complexe takenNiet de goedkoopste optie
Sectie 06

Mogelijkheden

toolssource: litellmprompt cachingmax output tokens: 4096
Sectie 07

Veelgestelde vragen

gpt-4 is een veelzijdig model geschikt voor schrijven, samenvatten, coderen, Q&A en gespreksassistentie. Het biedt een goede balans tussen kwaliteit en snelheid.

Een betrouwbare, goed afgeronde keuze voor teams die schaalbaar willen werken met AI.

Tokonomix benchmark-samenvatting
Sectie 08

Beschikbaarheid

Beschikbaarheid

Nog geen meetdata

Er zijn nog niet genoeg API-aanroepen geregistreerd om beschikbaarheidsstatistieken voor dit model te tonen. Data verschijnt zodra het model live verkeer ontvangt.

Sectie 09

Tokonomix benchmark-oordelen

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-589/100 · 145 runs
116 correct22 partial7 wrong80% accuracy
2026-09-13

GPT-4 adds tool use and prompt caching, performance metrics unchanged

GPT-4 has introduced two significant capabilities in this benchmark window: tool use and prompt caching. These additions expand the model's practical utility for developers building applications that require function calling or need to optimize costs through caching repeated prompt elements. No performance benchmark data is available for either the current or previous window, so we cannot assess changes in accuracy, speed, or output quality metrics. The absence of benchmark scores means users should rely on their own testing to validate performance for specific use cases. The tool use capability enables GPT-4 to interact with external functions and APIs, allowing for more dynamic applications. Prompt caching helps reduce latency and costs when portions of prompts are reused across multiple requests. These features align GPT-4 with capabilities already present in competing models. Without concrete performance data, the practical impact of these additions remains to be demonstrated through real-world usage. Users evaluating GPT-4 should conduct their own benchmarks specific to their applications, particularly if migrating from other models or comparing tool use implementations.

Kwaliteit

Latency p50

Testruns

0

Tool use capability added Prompt caching now supported
Sectie 10

Volledig modelprofiel

gpt-4 — illustration 1
GPT-4: het model dat de lat legde

GPT-4 is de oorspronkelijke frontier-release uit de GPT-4-familie van OpenAI — het model dat bij lancering in maart 2023 het ijkpunt werd waaraan elk volgend groot taalmodel werd afgemeten. De architectuurdetails werden toen achtergehouden en blijven tot op heden achtergehouden. De capaciteiten, het kostenprofiel en het deploymentverhaal zijn allemaal goed gedocumenteerd door jarenlang productiegebruik.

Het is niet langer de aanbevolen standaardkeuze voor nieuwe ontwikkelingen. Het is ook niet uitgefaseerd. De middenweg is de juiste framing.

Waarom dit model ertoe deed

De komst van GPT-4 resette wat teams verwachtten van een taalmodel dat in productie kon worden ingezet. Drie specifieke verschuivingen.

Redeneren. GPT-4 kon multi-step inferentie aan elkaar schakelen op een manier die de 3.5-generatie niet kon. Juridische contractanalyse, multi-documentsynthese, code-generatie voor nieuwe functionaliteit vanuit vage specificaties — dit alles verschoof van "interessante demo, fragiele output" naar "productie-inzetbaar met passende reviewlagen." De kwalitatieve kloof met 3.5 was van het soort dat je binnen het eerste testuur in evalresultaten voelde.

Meertaligheid. Multi-language coverage was een stapsgewijze verandering. Europees administratief proza, medische terminologie, juridische taal over meerdere jurisdicties — allemaal materieel beter verwerkt dan de vorige generatie. Voor Europese enterprise-teams in het bijzonder was dit de ontgrendeling die grensoverschrijdende productfuncties inzetbaar maakte.

Tool use. Function calling rijpte tot iets waarop productieteams daadwerkelijk agent-loops bovenop konden bouwen. De schemadiscipline was niet zo strak als wat latere generaties zouden leveren, maar het was strak genoeg dat de eerste golf agent-frameworks eromheen kon worden gewikkeld.

Wat volgde doorheen 2024 en 2025 — GPT-4 Turbo, GPT-4o, GPT-4.1, GPT-5 — waren allemaal verfijningen en uitbreidingen van capaciteiten die GPT-4 eerst vestigde.

Wat het mist tegenover huidige modellen

Het contextvenster van 8.192 tokens is de meest zichtbare beperking. Na een jaar waarin contexten van een miljoen tokens standaard werden in de frontier-laag, is 8k genoeg voor chatverkeer maar niet voor enige documentzware workload. Documentverwerking op dit model betekende typisch chunking-strategieën die huidige modellen overbodig maken.

Geen vision input. De vision-capable varianten kwamen later. Het basis-GPT-4-model is alleen tekst.

Geen audio-oppervlak. Hetzelfde verhaal. De audiocapaciteiten arriveerden met de 4o-generatie.

Redenerendiepte. De zwaarste planning- en syntheseprompts die huidige frontier-modellen gracieus behandelen — GPT-5, Claude Opus 4.7, de deep-research varianten — liggen zichtbaar buiten de comfortzone van GPT-4. Het model behandelt ze, maar de outputkwaliteit daalt merkbaar.

Snelheid. Verbeteringen in de inference-stack over de afgelopen twee jaar hebben het latentieprofiel van nieuwere modellen ver onder het punt getrokken waar de oorspronkelijke GPT-4 zit. Voor interactieve use cases wordt het verschil onmiddellijk gevoeld.

Waarom teams het nog steeds draaien

Twee redenen naast historische traagheid.

Ten eerste, compliance-regimes die deze specifieke identifier goedkeurden. GPT-4 is het model dat door de meeste auditcycli kwam in 2023 en 2024 omdat het de beschikbare frontier-optie was voor die periode. Sommige gereguleerde workflows draaien nog steeds GPT-4 omdat de kosten van heraudit op een nieuwer model aanzienlijk zijn en de workload nog niets nieuwers nodig heeft.

Ten tweede, eval-stabiliteit voor downstream-pipelines. Teams die parsers, classifiers of testsuites strak tegen de specifieke outputstijl van GPT-4 hebben gebouwd, pinnen soms voor stabiliteit terwijl ze de downstream-tooling in hun eigen tempo migreren.

Beide redenen hebben een houdbaarheidsdatum. Nieuwe auditcycli defaulten naar huidige modellen; nieuwe pipelines worden niet meer gebouwd tegen GPT-4.

Migratiepaden

Het juiste migratiedoel hangt af van de workload-vorm.

Voor workloads waar GPT-4 de frontier-keuze was en huidige frontier-capaciteit ertoe doet, is GPT-4.1 of GPT-5 de natuurlijke upgrade. Beide brengen veel langere context, materieel sterker redeneren en strakkere structured-output-gedrag. De kosten zijn lager, niet hoger.

Voor workloads die op GPT-4 draaiden omdat niets goedkopers destijds goed genoeg was, is gpt-4.1-mini vaak de juiste bestemming. De kwaliteit op de meeste productieprompts is vergelijkbaar; het kosten- en latentieprofiel zijn materieel beter.

Voor multimodale workloads die de 4o-generatie voorafgingen en momenteel het gebrek aan vision of audio omzeilen door externe services, is de natuurlijke stap consolideren naar GPT-4o of GPT-4.1 met native multimodale ondersteuning. De architecturale vereenvoudiging alleen al is meestal de migratiekosten waard.

Deployment-notities

Het API-oppervlak is Chat Completions, dezelfde vorm die elk volgend OpenAI-model gebruikt. Streaming, function calling, structured JSON-mode output waar het schema redelijk is — alles gedraagt zich ruwweg zoals het doet op nieuwere modellen.

Prompt caching is niet zo ontwikkeld op GPT-4 als op nieuwere modellen. De hergebruik-efficiëntiewinsten die zichzelf terugbetalen op GPT-4.1 met stabiele long-context prefixes zijn hier kleiner.

Regionale residency is hetzelfde OpenAI-verhaal: directe API draait op Azure-infrastructuur zonder region pinning, Azure OpenAI Service biedt regionale deployments onder een apart contract. Voor teams met harde EU-residency-eisen is een OVH-gehoste Mistral- of Llama 3-instantie een ander gesprek; zie /usecases/local.

Het kiezen

Gebruik GPT-4 vandaag wanneer:

  • Een compliance-regime deze specifieke identifier goedkeurde en de heraudit-cyclus bezig is.
  • Een downstream-pipeline strak genoeg is afgestemd op de outputstijl van het model dat de migratiekosten het upgrade-voordeel overtreffen, en het team een plan heeft om dat te fixen.
  • Historisch vergelijkingswerk het oorspronkelijke GPT-4-referentiepunt vereist.

Voor nieuwe builds, richt op GPT-4.1, GPT-4.1 mini, of een van de GPT-5-familiemodellen afhankelijk van de workload-vorm. De 4-generatie legde de lat. Het is niet meer de lat.

Voor de cross-category vergelijking zie /benchmarks/leaderboard. Voor de bredere OpenAI-lineup richting, zie GPT-4.1.

Laatste technische review: 2026-05-22 — Tokonomix.ai

gpt-4 — illustration 2gpt-4 — illustration 3
Laatste automatische test
14 sep 2026 · 20:03 UTC · Snelheidstest
P50 latency
993 ms
P95 latency
1006 ms
Fouten
0 / 6 runs
Laatst beoordeeld door Tokonomix-team·26 mei 2026