Naar inhoud
Tier A — Frontier
Draait in:USGemaakt in:United States

Gearchiveerd

Dit model is door de aanbieder uit productie genomen. Historische data blijft bewaard.

Niet meer beschikbaar sinds 24 juli 2027.

Anthropic

Claude Opus 5

Tier A — Frontier · 1M tokens

Tokonomix-redactie·Gecontroleerd door Mes Kalkan·
Sectie 01

Snelheidsanalyse

Latency gemeten over alle benchmark-runs. P50 (mediaan) en P95 (95e percentiel) geven een realistisch beeld van de responssnelheid onder normale en piekbelasting.

P50 latency (mediaan)P95 latency102 runs
97141197267104141356208-1609-10ms
Sectie 02

Kwaliteitsscores

Hoe dit model zich per promptcategorie verhoudt tot de rest van het veld, uit een paarsgewijze berekening over dezelfde prompts. Het ruwe jurycijfer staat onder elk getal.

26%
Code generatie
jurygemiddelde 70
86%
Creatief
jurygemiddelde 92
48%
Feitelijk
jurygemiddelde 83
41%
Meertaligheid
jurygemiddelde 88
61%
Redeneren
jurygemiddelde 87

Winstpercentage per categorie: hoe vaak dit model een gemiddeld model verslaat op een prompt uit die categorie. 50% is gemiddeld, geen onvoldoende. Het is geen percentage goede antwoorden.

Sectie 03

Prijsgeschiedenis

Directe provider-tarieven per miljoen tokens, plus een typische gespreks-kostschatting.

💰
API-tarieven — Claude Opus 5
$5.00 per 1M input-tokens
$25.00 per 1M output-tokens
≈ $0.0080 per typisch gesprek (800 tokens)
Input vs output prijs (per 1M tokens)
per 1M input-tokens$5.00
per 1M output-tokens$25.00

Pricing over time

Input & output per 1M tokens · step-line = price changes

$5.00

input / 1M

— stable

$25.00

output / 1M

— stable

2026-07-262026-08-232026-09-06
Input
Output
Price change
⟳ synced weekly
Sectie 04

Tokens per seconde

Doorvoersnelheid in tokens per seconde, afgeleid uit gemeten P50-latency. Hogere waarden zijn beter; fluctuaties weerspiegelen serverbelasting bij de provider.

Doorvoer (tokens / s)90 / avg 132
20419

Geschat uit P50-latency × 200 output-tokens — het absolute getal hangt af van deze aanname; de trend is wat telt.

Sectie 05

Mogelijkheden

toolssource: manualvisionjson modepdf inputreasoningjson schemaprompt cachingmax output tokens: 128000
Sectie 06

Beschikbaarheid

Beschikbaarheid

Hoe vaak dit model antwoordt als we het aanroepen — gemeten over echte API-aanvragen en live-tests in de afgelopen 30 dagen. Dit staat los van kwaliteit: deze cijfers laten alleen zien of het model reageert, niet hoe goed het antwoord is.

Afgelopen 7 dagen

100.0%

n=10

Afgelopen 30 dagen

96.8%

n=31

Mediane responstijd

19,126ms

n=30

Gebaseerd op 411 metingen in de afgelopen 30 dagen.

Technische details

Alleen echte API-aanroepen en live-testverzoeken tellen mee — interne probes en benchmarkruns zijn uitgesloten.

Aanroepen met een eigen API-sleutel (BYOK) zijn uitgesloten: die fouten zijn sleutelspecifiek en geen teken van modelneergang.

Mislukte aanroepen worden NIET meegeteld in kwaliteitsscores — kwaliteit wordt gemeten op geslaagde responses. Beschikbaarheid en kwaliteit zijn onafhankelijke signalen.

Mediane responstijd (p50) over geslaagde aanroepen met een vastgelegde duur. Uitschieters trekken de mediaan minder dan het gemiddelde.

Totaal aanroepen (30d)

31

OK-reacties (30d)

30

Totaal aanroepen (7d)

10

OK-reacties (7d)

10

Sectie 07

Tokonomix benchmark-oordelen

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-583/100 · 34 runs
26 correct4 partial4 wrong76% accuracy
2026-09-06

Claude Opus 5 quality climbs to 92 with creative performance boost

Claude Opus 5 shows meaningful improvement in this benchmark window, with overall quality rising from 86.0 to 92.0 points. The most significant change comes in creative tasks, which jumped from 73 to 92 points, bringing it in line with the model's consistently strong coding performance. This represents a substantial enhancement in creative writing, storytelling, and other generative tasks. Coding and multilingual capabilities remain stable at 92 points, demonstrating reliable performance in these areas. However, the quality gains come with a latency trade-off: response times increased by 26 percent, with the median latency rising from 6804ms to 8541ms. This means users will experience noticeably slower responses compared to the previous window. The model continues to offer strong overall performance across diverse task types, but the increased wait times may impact user experience in time-sensitive applications. The benchmark window shows fewer test runs with some category data missing, which may reflect ongoing optimization work. Users prioritizing creative output quality will benefit from these improvements, while those requiring faster response times should factor in the latency increase when planning deployments.

Kwaliteit

92.0

Latency p50

8,541 ms

Testruns

5

Quality improved to 92 points Creative score jumped 19 points Latency increased 26 percent Response time now 8.5 seconds
Sectie 08

Volledig modelprofiel

Claude Opus 5 — model deep-dive

Claude Opus 5 is het nieuwe vlaggenschip in Anthropic's Opus-lijn, uitgebracht op 24 juli 2026 als opvolger van Opus 4.8. Anthropic positioneert het model "voor complexe agentic coding en enterprise-werk" en het is nu de standaard in Claude Code, Anthropics eigen coding-agent. Het model is beschikbaar via de Claude API (model-ID claude-opus-5), Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry en Claude Platform on AWS.

Prijs en context-venster

Opus 5 behoudt dezelfde prijs als zijn voorganger: $5 per miljoen input-tokens en $25 per miljoen output-tokens — ongewijzigd ten opzichte van Opus 4.8, en de helft van wat Fable 5 kost ($10/$50 per miljoen tokens). Volgens Anthropic "evenaart Opus 5 veel van Fable 5's capaciteiten tegen de helft van de prijs" — een claim van Anthropic zelf, niet onafhankelijk geverifieerd. Het model heeft een context-venster van 1.000.000 tokens en kan tot 128k tokens output teruggeven per synchrone aanroep, genoeg voor het overzien van grote codebases of lange documentsets in één keer.

Adaptive thinking en kennis-cutoff

In plaats van de handmatige budget_tokens-instelling van extended thinking werkt Opus 5 met adaptive thinking, gestuurd via een effort-parameter met vijf standen: low, medium, high, xhigh en max (standaard: high). De trainingsdata is betrouwbaar tot mei 2026 — volgens Anthropic de meest recente cutoff van alle huidige Claude-modellen.

Langdurig zelfstandig werken

Anthropic's belangrijkste claim voor Opus 5 gaat over volhouden op lange, onbewaakte taken: urenlang zelfstandig doorwerken, herstellen van eigen fouten, om blokkades heen routeren in plaats van vastlopen, en tussentijds het eigen werk controleren. Anthropic onderbouwt dit met eigen cijfers: 43,3% op Frontier-Bench v0.1 (tegen 18,7% voor Opus 4.8) en 68,8% op DeepSWE v1.1 (tegen 59,0% voor Opus 4.8). Dit zijn Anthropic's eigen gepubliceerde resultaten, niet onafhankelijk gereproduceerd door Tokonomix.

Beter oordeelsvermogen

Anthropic noemt daarnaast beter oordeelsvermogen: het model stelt vaker een verduidelijkende vraag vóórdat het gokt bij een ambigue instructie, geeft eerder tegengas bij een gebrekkige of onderbepaalde opdracht in plaats van die letterlijk uit te voeren, en overweegt vaker de gevolgen van een wijziging vóór implementatie. Er is geen kwantitatieve meting bij deze claim — het is een kwalitatieve beschrijving van het ontwerpdoel.

Wanneer Opus 5 kiezen

Anthropic positioneert Opus 5 als de nieuwe standaardkeuze voor complexe, agentic coding- en enterprise-taken, en als het goedkopere alternatief voor Fable 5 met naar eigen zeggen vergelijkbare capaciteiten op veel vlakken. Voor eenvoudiger werk — korte chats, classificatie, lichte extractie — blijft een kleiner en goedkoper model doorgaans de efficiëntere keuze; Opus 5 is gebouwd voor langdurige, complexe taken met hoge inzet, niet voor hoogvolume eenvoudig werk.

Beschikbaarheid op Tokonomix

Claude Opus 5 staat op Tokonomix onder de slug claude-opus-5, tier A, US-hosted via Anthropic direct. Onafhankelijke benchmarkscores van Tokonomix' eigen testrunners zijn nog niet beschikbaar en verschijnen automatisch op deze pagina zodra het model meedraait in de eerstvolgende testcyclus.

Laatste automatische test
10 sep 2026 · 14:03 UTC · Snelheidstest
P50 latency
2220 ms
P95 latency
2225 ms
Fouten
0 / 6 runs
Laatst beoordeeld door Tokonomix-team·24 juli 2026