Naar inhoud
Tier B — Productie
Draait in:USGemaakt in:United States

Gearchiveerd

Dit model is door de aanbieder uit productie genomen. Historische data blijft bewaard.

Niet meer beschikbaar sinds 11 december 2026.

OpenAI

gpt-5-2025-08-07

Tier B — Productie

Tokonomix-redactie·Gecontroleerd door Mes Kalkan··

GPT-5-2025-08-07 is OpenAI's nieuwste generatie taalmodel, uitgebracht in augustus 2025. Dit model vertegenwoordigt een significante architecturale vooruitgang ten opzichte van de GPT-4-serie, met verbeterde redeneercapaciteiten, verhoogde feitelijke nauwkeurigheid en robuustere prestaties over diverse natuurlijke taalverwerkingstaken. Het is ontworpen voor algemene tekstgeneratie, inclusief complexe analyse, creatief schrijven, technische documentatie, codegeneratie en meertraps probleemoplossing. Het model beschikt over standaard tekstgeneratiecapaciteiten met een niet-openbaar gemaakte contextvenstergrootte. GPT-5 toont opmerkelijke verbeteringen in logische consistentie, verminderde hallucinatiepercentages en beter instructievolgen vergeleken met zijn voorgangers. Het is getraind op een recentere kennisafsnijdatum dan eerdere versies, hoewel OpenAI geen specifieke trainingsdata-samenstelling of parameteraantallen heeft bekendgemaakt. Het model toont bijzondere sterkte in het behouden van coherentie tijdens uitgebreide gesprekken en het hanteren van genuanceerde instructies die het interpreteren van impliciete gebruikersintenties vereisen. Binnen OpenAI's modellijn staat GPT-5-2025-08-07 in de hoogste categorie als het meest capabele algemeen beschikbare model. Het volgt de GPT-4-familie op, die varianten zoals GPT-4 Turbo en GPT-4o omvatte. Dit model is gepositioneerd als OpenAI's vlaggenschipproduct voor gebruikers die state-of-the-art taalbegrip en generatiecapaciteiten vereisen. De datumgestempelde versie-identificatie duidt dit specifieke snapshot aan van augustus 2025, volgens OpenAI's conventie van versioned releases voor consistentie en reproduceerbaarheid in productietoepassingen.

GPT-5-2025-08-07 markeert een nieuwe generatie in taalmodellen, met aanzienlijke verbeteringen in redeneervermogens en feitelijke nauwkeurigheid ten opzichte van de GPT-4-serie.

Tokonomix model-analyse augustus 2025
Sectie 01

Snelheidsanalyse

Latency gemeten over alle benchmark-runs. P50 (mediaan) en P95 (95e percentiel) geven een realistisch beeld van de responssnelheid onder normale en piekbelasting.

P50 latency (mediaan)P95 latency72 runs
476144424113379434608-2209-08ms
Sectie 02

Kwaliteitsscores

Hoe dit model zich per promptcategorie verhoudt tot de rest van het veld, uit een paarsgewijze berekening over dezelfde prompts. Het ruwe jurycijfer staat onder elk getal.

55%
Code generatie
jurygemiddelde 64
3%
Creatief
jurygemiddelde 35
24%
Feitelijk
jurygemiddelde 71
37%
Meertaligheid
jurygemiddelde 48
54%
Redeneren
jurygemiddelde 57

Winstpercentage per categorie: hoe vaak dit model een gemiddeld model verslaat op een prompt uit die categorie. 50% is gemiddeld, geen onvoldoende. Het is geen percentage goede antwoorden.

Sectie 03

Prijsgeschiedenis

Directe provider-tarieven per miljoen tokens, plus een typische gespreks-kostschatting.

💰
API-tarieven — gpt-5-2025-08-07
$1.25 per 1M input-tokens
$10.00 per 1M output-tokens
≈ $0.0028 per typisch gesprek (800 tokens)
Input vs output prijs (per 1M tokens)
per 1M input-tokens$1.25
per 1M output-tokens$10.00

Pricing over time

Input & output per 1M tokens · step-line = price changes

$1.25

input / 1M

— stable

$10.00

output / 1M

— stable

2026-06-212026-08-092026-09-06
Input
Output
Price change
⟳ synced weekly
Sectie 04

Tokens per seconde

Doorvoersnelheid in tokens per seconde, afgeleid uit gemeten P50-latency. Hogere waarden zijn beter; fluctuaties weerspiegelen serverbelasting bij de provider.

Doorvoer (tokens / s)329 / avg 268
41690

Geschat uit P50-latency × 200 output-tokens — het absolute getal hangt af van deze aanname; de trend is wat telt.

Sectie 05

Sterke & zwakke punten

Gebaseerd op benchmark-resultaten en geaggregeerde community-feedback over echte use-cases.

Sterke punten

Superieure logische consistentieSignificant lagere hallucinatie-ratioSterke instructieopvolging bij complexe takenUitstekende coherentie in lange gesprekkenBegrijpt impliciete gebruikersintentiesRecente kenniscutoff datumVeelzijdig inzetbaar voor diverse NLP-takenSterk in meerstaps probleemoplossing

Zwakke punten

Prijspunt hoger dan voorgangersContextvenstergrootte niet openbaarAlleen tekst, geen multimodale inputBeperkte transparantie over trainingsdata
Sectie 06

Mogelijkheden

toolssource: litellmvisionjson modepdf inputreasoningjson schemaparallel toolsprompt cachingmax output tokens: 128000
Sectie 07

Veelgestelde vragen

GPT-5 toont meetbare verbeteringen in logisch redeneren, feitelijke nauwkeurigheid en instructieopvolging. De exacte benchmarkscores variëren per taaktype, maar gebruikers rapporteren vooral winst bij complexe analyse en langere gesprekken.

Voor organisaties die de meest geavanceerde tekstgeneratie en complexe redeneertaken vereisen, biedt GPT-5 momenteel ongeëvenaarde prestaties binnen OpenAI's portfolio.

Tokonomix editorial team
Sectie 08

Beschikbaarheid

Beschikbaarheid

Nog geen meetdata

Er zijn nog niet genoeg API-aanroepen geregistreerd om beschikbaarheidsstatistieken voor dit model te tonen. Data verschijnt zodra het model live verkeer ontvangt.

Sectie 09

Tokonomix benchmark-oordelen

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-557/100 · 44 runs
22 correct1 partial21 wrong50% accuracy
2026-09-06

GPT-5 shows quality gains with strong coding performance

OpenAI's GPT-5 demonstrates measurable improvement in this benchmark window, with overall quality rising from 87.0 to 96.0 points. The model exhibits exceptional coding capabilities, achieving a perfect score of 100 in that category. Multilingual performance stands at 92, showing solid competency across languages. Latency has improved notably, with p50 response times decreasing from 8816ms to 7687ms, representing approximately 13% faster generation. The current window includes four test runs compared to two in the previous period, providing a more robust sample. Category coverage shifted between windows, with reasoning and factual scores from the previous period replaced by coding and multilingual metrics in current testing. The previous window showed perfect reasoning scores but weaker factual performance at 74, while current results emphasize different capability dimensions. The model maintains its vision and PDF input capabilities introduced in earlier releases. Users can expect faster responses and strong performance on coding tasks, though the shifted test categories make direct comparison challenging. The quality improvement suggests continued refinement of the underlying model.

Kwaliteit

96.0

Latency p50

7,687 ms

Testruns

4

Quality improved 9 points Latency decreased 13% Perfect coding score achieved Test category coverage changed
Sectie 10

Volledig modelprofiel

gpt-5-2025-08-07 — illustration 1
GPT-5 (2025-08-07 snapshot): het vastgepinde origineel

Dit is de gedateerde snapshot van het oorspronkelijke GPT-5 basismodel, uitgebracht op 7 augustus 2025 en op dat moment bevroren. Terwijl de zwevende gpt-5 slug is blijven bewegen onder teams die ernaar verwezen, legt deze gedateerde versie één specifieke set gewichten vast, één specifiek gedragsprofiel, één reproduceerbaar artefact. Dat maakt het bruikbaar voor een smalle maar belangrijke set taken: vergelijkingsbaselines, gereguleerde workflows, en elk product dat over zes maanden naar hetzelfde model moet kunnen verwijzen en hetzelfde antwoord moet krijgen.

Waarom gedateerde snapshots bestaan

OpenAI levert elke generatie in twee varianten. De zwevende naam (gpt-5) volgt welke snapshot momenteel wordt aanbevolen. De gedateerde naam (gpt-5-2025-08-07) pint één specifieke versie van de gewichten vast. De zwevende slug profiteert van stille verbeteringen; de gedateerde slug profiteert van het feit dat hij je nooit verrast.

Voor evaluatievergelijkingen over tijd is de gedateerde slug de enige eerlijke keuze. Als je benchmarkrapport uit december zegt "GPT-5 scoorde X op onze testsuite," en iemand voert het in mei opnieuw uit tegen de zwevende slug, dan vergelijken ze niet hetzelfde model. De gedateerde snapshot lost dat op. Het gedrag op 7 augustus 2025 is het gedrag dat je krijgt wanneer je dit eindpunt aanroept, tot OpenAI het uiteindelijk opruimt.

Wat deze snapshot is

GPT-5 was het eerste model in de GPT-5 familie, uitgebracht als een multimodaal tekst-en-vision frontier-model. De 2025-08-07 snapshot weerspiegelt het lanceringgedrag: trainingsdata tot welke afkapgrens OpenAI ook gebruikte medio 2025, de oorspronkelijke veiligheidspassage, de oorspronkelijke vision-encoder kalibratie, het oorspronkelijke tool-use gedrag.

Opvolgende floating-slug updates hebben deze karakteristieken verschoven. Gedocumenteerde wijzigingen over de bredere 5.x lijn hebben verfijnde instructieopvolging op randgevallen, aangepast weigergedrag op bepaalde contentcategorieën, en incrementele verbeteringen aan vision OCR omvat. Geen van die wijzigingen raakt deze snapshot. Wat je in augustus 2025 kreeg is wat je vandaag krijgt.

Onder de motorkap

Het model is een transformer decoder die interleaved tekst- en beeldinvoer accepteert en alleen tekstuitvoer produceert. Parameteraantal, expert routing details, en exacte architecturale keuzes zijn niet openbaar. Tokenisatie gebruikt het GPT-5 BPE vocabulaire. Beeldinvoer wordt tile-gecodeerd tegen een vaste tokenprijs per tile, wat snel oploopt bij multi-page document workloads.

Training cutoff voor deze snapshot ligt medio 2025. Het model kent mainstream taalstandaarden en frameworkversies die actueel waren in die periode en zal vrolijk verzinnen over alles wat recenter is. Voor workflows die recente gebeurtenissen of nieuwe library API's betreffen, doet dit ertoe — pin de snapshot, accepteer dat kennis veroudert, en route current-events queries door retrieval of web search in plaats van te vertrouwen op de parametrische kennis van het model.

Waar het vandaag staat

Tegen het bredere frontier model landschap gemeten, zit de augustus 2025 snapshot van GPT-5 in de bovenste tier op algemene taken en de bovengemiddelde tier op vision-zwaar werk. De nieuwere 5.1, 5.2, en latere snapshots zijn erop voorbijgegaan op de meeste metrics. Het intelligence leaderboard volgt de vergelijkende rangschikking.

Voor een snapshot die in augustus 2025 is vastgepind is dit het verwachte patroon. Het punt is niet om in mei 2026 het absoluut beste beschikbare model te zijn; het punt is om in mei 2026 hetzelfde model te zijn als in augustus 2025, zodat vergelijkingen en audits geldig blijven.

Wanneer pinnen naar deze snapshot

Grijp naar gpt-5-2025-08-07 wanneer reproduceerbaarheid waardevoller is dan piekkwaliteit. De duidelijke use cases:

Evaluatievergelijkingen over tijd. Als je benchmarksuite tegen deze snapshot draaide toen hij verscheen, draai hem dan opnieuw tegen deze snapshot in plaats van de zwevende slug. Anders meet je modelevolutie in plaats van je eigen verandering.

Gereguleerde beslissingen waarbij audittrails het exacte model moeten identificeren dat een gegeven output produceerde. "We gebruikten gpt-5" is een ontoereikend antwoord wanneer een auditor vraagt welke versie. "We gebruikten gpt-5-2025-08-07" is toereikend.

Klantgerichte features met kwaliteits-SLA's die waren gekalibreerd tegen een specifiek modelgedrag. Als je prompts en few-shot voorbeelden waren afgestemd op deze snapshot, brengt verhuizen naar een nieuwere zonder opnieuw afstemmen het risico van subtiele regressies met zich mee.

Langlopende A/B experimenten waarbij de controle echt gefixeerd moet blijven voor de duur van de test.

Wanneer niet pinnen naar deze snapshot

Vermijd het voor ontwikkeling van nieuwe features. Gebruik in plaats daarvan de zwevende slug of de nieuwste gedateerde snapshot; je wilt het meest capabele model dat beschikbaar is terwijl je bouwt, niet het oudste dat nog werkt.

Vermijd het voor algemene chat- en content workflows waarbij de winsten in nieuwere snapshots reëel zijn en de kosten van gedragsdrift laag. De 5.1, 5.2, en latere snapshots zijn beter op dezelfde workloads. Pin alleen aan geschiedenis wanneer geschiedenis ertoe doet.

Vermijd het als je een prompt draait die afhankelijk is van kennis van gebeurtenissen na medio 2025. Het model weet het niet. Het zal gissen. De gissingen zullen soms correct klinken en soms volledig verkeerd zijn.

Operationele opmerkingen

OpenAI publiceert deprecation timelines voor gedateerde snapshots. Oudere snapshots worden uiteindelijk opgeruimd. Wanneer dat met deze gebeurt, zal je code die deze slug pint foutmeldingen beginnen te retourneren. Plan vooruit: abonneer je op de deprecation aankondigingen, en onderhoud een forward path naar welke snapshot je vervolgens zult pinnen.

Voor data extraction workflows waarbij vision capability zwaar weegt, is de augustus 2025 snapshot competent maar is hij overtroffen door latere vision-encoder verfijningen. Als het werk het toelaat, draai dezelfde documenten parallel door deze snapshot en een nieuwere voor een paar weken voordat je beslist of je de pin migreert.

Alternatieven

Voor workflows die dezelfde soort vastgepinde reproduceerbaarheid nodig hebben maar om een ander model geven, levert elke frontier provider nu gedateerde snapshots naast hun zwevende slugs. Het patroon is industriestandaard. Kies het model dat past bij je kwaliteits- en modaliteitsvereisten, pin dan zijn gedateerde versie in plaats van zijn zwevende.

Voor pure kostenoptimalisatie op routine workloads dekken de kleinere leden van de 5.x familie (de mini en nano tiers) het grootste deel van wat algemene chat daadwerkelijk nodig heeft tegen een fractie van de kosten. Pin die snapshots ook als reproduceerbaarheid daar voor je van belang is.

Laatste technische review: 2026-05-22 — Tokonomix.ai

gpt-5-2025-08-07 — illustration 2gpt-5-2025-08-07 — illustration 3
Laatste automatische test
8 sep 2026 · 20:05 UTC · Snelheidstest
P50 latency
608 ms
P95 latency
756 ms
Fouten
0 / 6 runs
Laatst beoordeeld door Tokonomix-team·26 mei 2026