Naar inhoud
Tier A — Frontier
Draait in:USGemaakt in:United States

Einddatum

De aanbieder noemt 24 juli 2027 als voorlopige einddatum voor dit model. Het model is nu gewoon beschikbaar.

Anthropic

Claude Opus 5

Tier A — Frontier · 1M tokens

Tokonomix-redactie·Gecontroleerd door Mes Kalkan·
Sectie 01

Snelheidsanalyse

Latency gemeten over alle benchmark-runs. P50 (mediaan) en P95 (95e percentiel) geven een realistisch beeld van de responssnelheid onder normale en piekbelasting.

P50 latency (mediaan)P95 latency100 runs
97141197267104141356208-2109-14ms
Sectie 02

Kwaliteitsscores

Hoe dit model zich per promptcategorie verhoudt tot de rest van het veld, uit een paarsgewijze berekening over dezelfde prompts. Het ruwe jurycijfer staat onder elk getal.

31%
Code generatie
jurygemiddelde 69
86%
Creatief
jurygemiddelde 92
53%
Feitelijk
jurygemiddelde 86
41%
Meertaligheid
jurygemiddelde 88
55%
Redeneren
jurygemiddelde 88

Winstpercentage per categorie: hoe vaak dit model een gemiddeld model verslaat op een prompt uit die categorie. 50% is gemiddeld, geen onvoldoende. Het is geen percentage goede antwoorden.

Sectie 03

Prijzen

Wat je per miljoen tokens betaalt als je dit model via Tokonomix gebruikt, plus een schatting voor een gemiddeld gesprek.

💰
API-tarieven — Claude Opus 5
$6.50 per 1M input-tokens
$32.50 per 1M output-tokens
≈ $0.0104 per typisch gesprek (800 tokens)
Input vs output prijs (per 1M tokens)
per 1M input-tokens$6.50
per 1M output-tokens$32.50
Sectie 04

Tokens per seconde

Doorvoersnelheid in tokens per seconde, afgeleid uit gemeten P50-latency. Hogere waarden zijn beter; fluctuaties weerspiegelen serverbelasting bij de provider.

Doorvoer (tokens / s)107 / avg 133
20419

Geschat uit P50-latency × 200 output-tokens — het absolute getal hangt af van deze aanname; de trend is wat telt.

Sectie 05

Mogelijkheden

toolssource: manualvisionjson modepdf inputreasoningjson schemaprompt cachingmax output tokens: 128000
Sectie 06

Beschikbaarheid

Beschikbaarheid

Hoe vaak dit model antwoordt als we het aanroepen — gemeten over echte API-aanvragen en live-tests in de afgelopen 30 dagen. Dit staat los van kwaliteit: deze cijfers laten alleen zien of het model reageert, niet hoe goed het antwoord is.

Afgelopen 7 dagen

88.6%

n=44

Afgelopen 30 dagen

91.7%

n=72

Mediane responstijd

25,106ms

n=66

Gebaseerd op 457 metingen in de afgelopen 30 dagen.

Technische details

Alleen echte API-aanroepen en live-testverzoeken tellen mee — interne probes en benchmarkruns zijn uitgesloten.

Aanroepen met een eigen API-sleutel (BYOK) zijn uitgesloten: die fouten zijn sleutelspecifiek en geen teken van modelneergang.

Mislukte aanroepen worden NIET meegeteld in kwaliteitsscores — kwaliteit wordt gemeten op geslaagde responses. Beschikbaarheid en kwaliteit zijn onafhankelijke signalen.

Mediane responstijd (p50) over geslaagde aanroepen met een vastgelegde duur. Uitschieters trekken de mediaan minder dan het gemiddelde.

Totaal aanroepen (30d)

72

OK-reacties (30d)

66

Totaal aanroepen (7d)

44

OK-reacties (7d)

39

Sectie 07

Tokonomix benchmark-oordelen

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-583/100 · 38 runs
29 correct4 partial5 wrong76% accuracy
2026-09-13

Claude Opus 5 shows quality decline, particularly in coding performance

Claude Opus 5's overall quality score has dropped to 85.3 from 92.0 in the previous benchmark window, representing a 6.7 point decline. The most significant regression appears in coding performance, which fell from 92 to 64, a substantial 28-point decrease that suggests potential issues with code generation or analysis capabilities. Factual accuracy remains a bright spot, achieving a perfect 100 score, while reasoning performance stayed strong at 92. The model's latency has increased slightly from 8541ms to 9811ms at the median, representing about 15% slower response times. The current benchmark window includes fewer test runs (4 versus 5), though this should not materially affect score validity. The previous window included creative and multilingual category testing, which were not evaluated in the current window, making direct comparison limited to the available categories. Users relying on Claude Opus 5 for coding tasks should exercise additional caution and validation, while those focused on factual retrieval and reasoning can expect continued strong performance. The quality decline warrants monitoring in subsequent benchmark windows to determine if this represents a temporary anomaly or a sustained trend.

Kwaliteit

85.3

Latency p50

9,811 ms

Testruns

4

Coding score dropped 28 points Overall quality down 6.7 points Latency increased 15 percent Factual accuracy remains perfect
Sectie 08

Volledig modelprofiel

Claude Opus 5 — model deep-dive

Claude Opus 5 is het nieuwe vlaggenschip in Anthropic's Opus-lijn, uitgebracht op 24 juli 2026 als opvolger van Opus 4.8. Anthropic positioneert het model "voor complexe agentic coding en enterprise-werk" en het is nu de standaard in Claude Code, Anthropics eigen coding-agent. Het model is beschikbaar via de Claude API (model-ID claude-opus-5), Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry en Claude Platform on AWS.

Prijs en context-venster

Opus 5 behoudt dezelfde prijs als zijn voorganger: $5 per miljoen input-tokens en $25 per miljoen output-tokens — ongewijzigd ten opzichte van Opus 4.8, en de helft van wat Fable 5 kost ($10/$50 per miljoen tokens). Volgens Anthropic "evenaart Opus 5 veel van Fable 5's capaciteiten tegen de helft van de prijs" — een claim van Anthropic zelf, niet onafhankelijk geverifieerd. Het model heeft een context-venster van 1.000.000 tokens en kan tot 128k tokens output teruggeven per synchrone aanroep, genoeg voor het overzien van grote codebases of lange documentsets in één keer.

Adaptive thinking en kennis-cutoff

In plaats van de handmatige budget_tokens-instelling van extended thinking werkt Opus 5 met adaptive thinking, gestuurd via een effort-parameter met vijf standen: low, medium, high, xhigh en max (standaard: high). De trainingsdata is betrouwbaar tot mei 2026 — volgens Anthropic de meest recente cutoff van alle huidige Claude-modellen.

Langdurig zelfstandig werken

Anthropic's belangrijkste claim voor Opus 5 gaat over volhouden op lange, onbewaakte taken: urenlang zelfstandig doorwerken, herstellen van eigen fouten, om blokkades heen routeren in plaats van vastlopen, en tussentijds het eigen werk controleren. Anthropic onderbouwt dit met eigen cijfers: 43,3% op Frontier-Bench v0.1 (tegen 18,7% voor Opus 4.8) en 68,8% op DeepSWE v1.1 (tegen 59,0% voor Opus 4.8). Dit zijn Anthropic's eigen gepubliceerde resultaten, niet onafhankelijk gereproduceerd door Tokonomix.

Beter oordeelsvermogen

Anthropic noemt daarnaast beter oordeelsvermogen: het model stelt vaker een verduidelijkende vraag vóórdat het gokt bij een ambigue instructie, geeft eerder tegengas bij een gebrekkige of onderbepaalde opdracht in plaats van die letterlijk uit te voeren, en overweegt vaker de gevolgen van een wijziging vóór implementatie. Er is geen kwantitatieve meting bij deze claim — het is een kwalitatieve beschrijving van het ontwerpdoel.

Wanneer Opus 5 kiezen

Anthropic positioneert Opus 5 als de nieuwe standaardkeuze voor complexe, agentic coding- en enterprise-taken, en als het goedkopere alternatief voor Fable 5 met naar eigen zeggen vergelijkbare capaciteiten op veel vlakken. Voor eenvoudiger werk — korte chats, classificatie, lichte extractie — blijft een kleiner en goedkoper model doorgaans de efficiëntere keuze; Opus 5 is gebouwd voor langdurige, complexe taken met hoge inzet, niet voor hoogvolume eenvoudig werk.

Beschikbaarheid op Tokonomix

Claude Opus 5 staat op Tokonomix onder de slug claude-opus-5, tier A, US-hosted via Anthropic direct. Onafhankelijke benchmarkscores van Tokonomix' eigen testrunners zijn nog niet beschikbaar en verschijnen automatisch op deze pagina zodra het model meedraait in de eerstvolgende testcyclus.

Laatste automatische test
14 sep 2026 · 20:02 UTC · Snelheidstest
P50 latency
1862 ms
P95 latency
2597 ms
Fouten
0 / 6 runs
Laatst beoordeeld door Tokonomix-team·24 juli 2026