Naar inhoud
Tier B — Productie
Draait in:USGemaakt in:United States
OpenAI

gpt-5.2-2025-12-11

Tier B — Productie

Tokonomix-redactie·Gecontroleerd door Mes Kalkan··

GPT-5.2-2025-12-11 is een groot taalmodel ontwikkeld door OpenAI, uitgebracht in december 2025 als onderdeel van de GPT-5-serie. Dit model vertegenwoordigt een iteratieve update binnen OpenAI's vijfde generatie taalmodelfamilie, ontworpen voor algemene tekstgeneratietaken waaronder conversationele AI, contentcreatie, codegeneratie, analyse en redeneren. Het model verwerkt en genereert mensachtige tekst gebaseerd op patronen geleerd uit zijn trainingsdata, hoewel de specifieke grootte van het contextvenster niet publiekelijk is vrijgegeven door de aanbieder. Het model is gebouwd voor standaard tekstgeneratiecapaciteiten en ondersteunt gesprekken met meerdere beurten, vraagbeantwoording, samenvatting, vertaling en andere natuurlijke taalverwerkingstaken. Als een december 2025-release weerspiegelt het OpenAI's voortdurende verfijning van de GPT-5-architectuur, mogelijk met verbeteringen in antwoordkwaliteit, redeneercapaciteiten en instructievolging vergeleken met eerdere iteraties in de serie. Binnen OpenAI's modelaanbod staat GPT-5.2-2025-12-11 tussen de meest geavanceerde publiekelijk beschikbare modellen van de aanbieder, als opvolger van de GPT-4-serie en eerdere GPT-5-versies. De specifieke versieaanduiding suggereert dat dit de tweede grote iteratie van GPT-5 is, met de datumstempel die de release of training cutoff van 11 december 2025 aangeeft. Gebruikers dienen te beseffen dat, zoals bij alle taalmodellen, de mogelijkheden beperkt worden door de afkapdatum van de trainingsdata, en dat het model beperkingen kan hebben in nauwkeurigheid voor gebeurtenissen of informatie die na dat punt verschijnt.

gpt-5.2-2025-12-11 van OpenAI is een veelzijdig taalmodel voor uiteenlopende zakelijke en creatieve toepassingen.

Tokonomix benchmark-samenvatting
Sectie 01

Kwaliteitsscores

Evaluatieresultaten van judge-model beoordelingen over diverse taakcategorieën. Scores weerspiegelen coherentie, accuratesse en instructieopvolging.

99
Creatief
57
Feitelijk
100
Meertaligheid
100
Redeneren
Sectie 02

Prijsgeschiedenis

Directe provider-tarieven per miljoen tokens, plus een typische gespreks-kostschatting.

💰
API-tarieven — gpt-5.2-2025-12-11
$1.75 per 1M input-tokens
$14.00 per 1M output-tokens
≈ $0.0039 per typisch gesprek (800 tokens)
Input vs output prijs (per 1M tokens)
per 1M input-tokens$1.75
per 1M output-tokens$14.00

Pricing over time

Input & output per 1M tokens · step-line = price changes

$1.75

input / 1M

— stable

$14.00

output / 1M

— stable

2026-05-242026-07-052026-07-26
Input
Output
Price change
⟳ synced weekly
Sectie 03

Sterke & zwakke punten

Gebaseerd op benchmark-resultaten en geaggregeerde community-feedback over echte use-cases.

Sterke punten

Sterke algehele taalvaardigheidHeldere, coherente schrijfstijlBetrouwbare codeondersteuningUitstekende instructieopvolgingContextvenster van standaardGoede balans snelheid en kwaliteitMeertalige verwerking

Zwakke punten

Minder sterk dan topmodellenBeperkter bij zeer complexe takenNiet de goedkoopste optie
Sectie 04

Mogelijkheden

toolssource: litellmvisionjson modepdf inputreasoningjson schemaparallel toolsprompt cachingmax output tokens: 128000
Sectie 05

Veelgestelde vragen

gpt-5.2-2025-12-11 is een veelzijdig model geschikt voor schrijven, samenvatten, coderen, Q&A en gespreksassistentie. Het biedt een goede balans tussen kwaliteit en snelheid.

Een betrouwbare, goed afgeronde keuze voor teams die schaalbaar willen werken met AI.

Tokonomix benchmark-samenvatting
Sectie 06

Beschikbaarheid

Beschikbaarheid

Nog geen meetdata

Er zijn nog niet genoeg API-aanroepen geregistreerd om beschikbaarheidsstatistieken voor dit model te tonen. Data verschijnt zodra het model live verkeer ontvangt.

Sectie 07

Tokonomix benchmark-oordelen

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-597/100 · 20 runs
19 correct1 partial0 wrong95% accuracy
2026-07-26

Quality regression with factual performance drop, multilingual maintained

This benchmark window reveals a significant performance regression for gpt-5.2-2025-12-11, with the overall quality score declining from 99.3 to 88.9, a drop of 10.5 points. The most concerning change is in factual accuracy, which scored just 57 out of 100, indicating substantial reliability issues with information retrieval and factual responses. This represents a marked departure from the model's previously strong performance profile. Positively, multilingual capabilities remain exceptional at 100, maintaining parity with the previous window. Creative and reasoning tasks both achieved perfect or near-perfect scores at 99 and 100 respectively, suggesting the model's advanced cognitive capabilities are intact. However, the absence of coding scores in this window prevents comparison with the previous window's perfect 100 coding performance. Latency has also degraded, with p50 response times increasing 35 percent from 1922ms to 2595ms. This slower performance combined with the quality regression suggests potential infrastructure changes or model adjustments that have negatively impacted both speed and accuracy. Users should exercise caution with factual queries and verify information from this model version, while continuing to leverage its strong performance in creative, multilingual, and reasoning tasks.

Quality

88.9

Latency p50

2,595 ms

Test runs

5

Quality dropped 10.5 points Factual accuracy critically low Latency increased 35% Multilingual excellence maintained
Sectie 08

Volledig modelprofiel

gpt-5.2-2025-12-11 — illustration 1
GPT-5.2 (snapshot 2025-12-11): het vastleggen van het 5.2-lanceringsgedrag

Let op — toekomstgericht profiel. Deze pagina beschrijft een model dat zich in een vroege preview bevindt, is aangekondigd maar niet algemeen beschikbaar is, of geprojecteerd is op basis van roadmapsignalen. Specificaties en mogelijkheden kunnen verschuiven vóór de publieke lancering. Live benchmarkgegevens op deze pagina weerspiegelen welk endpoint onze testharnas vandaag kan bereiken.

Dit is de gedateerde snapshot van GPT-5.2, bevroren op de release van 11 december 2025. De zwevende gpt-5.2-slug zal blijven bewegen naarmate OpenAI volgende point-updates uitbrengt. Deze vastgezette versie blijft stil staan — dezelfde gewichten, hetzelfde gedrag, dezelfde outputs voor dezelfde inputs, tot de dag waarop het endpoint uiteindelijk wordt uitgefaseerd.

Waarom deze snapshot apart bestaat van de zwevende slug

Elke modelgeneratie wordt geleverd in twee smaken: een bewegend doelwit en een vaste referentie. Het bewegende doelwit krijgt stille verbeteringen. De vaste referentie krijgt niets — zelfs geen bugfixes — maar er wordt ook niets weggenomen. Voor evaluatie, gereguleerde beslissingen en elk product waarvan de acceptatietests zijn gekalibreerd tegen één specifiek gedrag, is de vaste referentie de enige verstandige keuze.

De splitsing tussen gpt-5.2 en gpt-5.2-2025-12-11 is het operationele antwoord op een reëel probleem. Teams die in eerdere generaties naar zwevende slugs verwezen, hebben een werkend productiegedrag verloren aan een stille snapshotrotatie vaker dan iemand publiekelijk toegeeft. Het vastleggen van de gedateerde snapshot in productie lost dat op. Het lezen van de zwevende slug in pre-release geeft je het nieuwe gedrag om te evalueren voordat je het adopteert.

Wat deze snapshot vastlegt

De snapshot van december 2025 is GPT-5.2 bij lancering. De training-cutoff ligt in het late 2025. Vision-encoder-kalibratie weerspiegelt de lanceringsconfiguratie. Veiligheidstraining, weigeringspatronen, instructievolgende randgevallen — al deze zijn bevroren op dit punt. Elke daaropvolgende zwevende-slug-update is gebeurd bij andere snapshots, niet bij deze.

Wat je bij lancering hebt getest, is wat vandaag in productie draait. Dat is het contract.

Onder de motorkap

GPT-5.2 is een transformer-decoder die doorlopende tekst- en afbeeldingsinvoer accepteert, met alleen tekstuitvoer. OpenAI heeft geen parameteraantallen of expert-routingdetails gepubliceerd. Het model verwerkt documenten, grafieken, screenshots, foto's en diagrammen als afbeeldingsinvoer; uitvoer is beperkt tot tekst, inclusief gestructureerde formaten zoals JSON en markdown.

Tokenisatie gebruikt het GPT-5 BPE-vocabulaire. Afbeeldingsinvoer wordt tile-gecodeerd naar vaste tokenkosten per tile. Het exacte tilebudget hangt af van resolutie en beeldverhouding; voor typische documentworkloads komt dit uit op enkele honderden tot een paar duizend afbeeldingstokens per pagina, wat snel het totale tokenaantal domineert.

Het model ondersteunt de standaard OpenAI-functieset op deze snapshot: gestructureerde uitvoer, functieaanroepen, parallelle toolaanroepen, vision-invoer en het lange-contextgedrag van de GPT-5.2-release. Alles wat na december 2025 aan de zwevende slug is toegevoegd, is hier mogelijk niet beschikbaar.

Waar het vandaag staat

Voor algemene werkzaamheden en vision-ondersteunde analyse bevindt de snapshot van december 2025 van GPT-5.2 zich in de bovenste laag van frontiermodellen uit die periode. Het intelligenceleaderboard volgt hoe het zich verhoudt tot huidige modellen; verwacht dat de kloof naar een huidige zwevende slug in de loop van de tijd groeit naarmate zowel OpenAI als concurrenten nieuwere snapshots uitbrengen.

Voor contentgeneratieworkflows produceert het model betrouwbare middellange uitvoer. Voor data-extractie uit documenten is de vision-mogelijkheid een echt voordeel ten opzichte van alleen-tekstextractors, met name bij lay-outrijke invoer zoals facturen, formulieren en gestructureerde rapporten.

Wanneer deze snapshot vast te leggen

De duidelijke gevallen zijn reproducibiliteitsgedreven. Gebruik de snapshot van december 2025 wanneer:

Je een evaluatiesuite draait die vergelijkbaar moet zijn over tijd. Als je benchmarkcijfers verwijzen naar deze snapshot, meet het vergelijken van toekomstige runs tegen de zwevende slug modeldrift, niet je eigen wijziging.

Je opereert in een gereguleerd domein waar het model dat een gegeven beslissing heeft geproduceerd identificeerbaar moet zijn in auditlogs. "GPT-5.2 zwevend" is geen identificator. "gpt-5.2-2025-12-11" wel.

Je een klantgerichte functie hebt waarvan de prompts en few-shot-voorbeelden zijn afgestemd op het gedrag van deze snapshot, en waarbij hernieuwde afstemming over een snapshotmigratie duur of riskant zou zijn.

Je een gecontroleerd experiment draait dat vereist dat de controlearm gedurende de duur van de test echt vast blijft.

Wanneer deze snapshot niet vast te leggen

Vermijd de gedateerde slug voor nieuwe feature-ontwikkeling. Gebruik de zwevende slug of welke gedateerde snapshot ook actueel is; je wilt toegang tot het nieuwste gedrag terwijl je aan het ontwerpen bent, niet het lanceringsgedrag van een zes maanden oude release.

Vermijd het voor workflows waarvan de kwaliteit wordt begrensd door het model in plaats van door de prompt. Als een nieuwere snapshot aanzienlijk beter is bij de taak en de kosten van gedragsdrift laag zijn, neem dan de nieuwere snapshot.

Vermijd het zodra OpenAI de afschaffingstijdlijn voor deze snapshot aankondigt. Plan de migratie vóór de sunsetdatum in plaats van op de dag te ontdekken dat je productie-endpoint fouten is gaan retourneren.

Praktisch migratiepatroon

De meeste teams convergeren naar een twee-slug-patroon: de gedateerde snapshot in productie, de zwevende slug in pre-release. Nieuwe snapshots worden geëvalueerd tegen de canary-suite voordat ze worden geadopteerd. Wanneer de nieuwe snapshot de evaluatie doorstaat en eventuele klantenzichtbare regressies worden geaccepteerd of gemitigeerd, worden productiepins bijgewerkt naar de nieuwe gedateerde versie, en de cyclus herhaalt zich.

Dit patroon geeft je de operationele stabiliteit van vastgelegd gedrag met een gestructureerd pad naar het integreren van verbeteringen. Het kost een kleine hoeveelheid extra engineering — het parallel draaien van twee versies gedurende de evaluatieperiode — en bespaart een veel grotere hoeveelheid incident response van stille modelrotaties.

Alternatieven

Als reproduceerbaarheid van vision-gedrag cruciaal is en het afschaffingsschema van OpenAI niet overeenkomt met je retentie-eisen, geven de open-weights multimodale modellen je onbeperkte controle. De nauwkeurigheids- en latentie-tradeoffs zijn reëel, maar de gewichten bewegen nooit onder je vandaan.

Als je hetzelfde soort vastgelegd gedrag nodig hebt maar een andere kwaliteitslaag, wordt elk ander model in de GPT-5.2-familie — en elke zwevende slug over de bredere 5.x-lijn — geleverd met een gedateerde tegenhanger. Kies het kwaliteits- en modaliteitsprofiel dat bij de workload past, leg dan de gedateerde versie vast.

Laatste technische beoordeling: 2026-05-22 — Tokonomix.ai

gpt-5.2-2025-12-11 — illustration 2
Laatste automatische test
26 jul 2026 · 05:38 UTC · Benchmark
P50 latency
1507 ms
P95 latency
Fouten
0 / 6 runs
Laatst beoordeeld door Tokonomix-team·26 mei 2026