Naar inhoud
Tier A — Frontier
Draait in:USGemaakt in:United States

Einddatum

De aanbieder noemt 28 mei 2027 als voorlopige einddatum voor dit model. Het model is nu gewoon beschikbaar.

Anthropic

Claude Opus 4.8

Tier A — Frontier · 1M tokens

Tokonomix-redactie·Gecontroleerd door Mes Kalkan··

Claude Opus 4.8 is Anthropic's zwaarste model voor taken die precisie, lange autonomie en een groot contextvenster vereisen. Met circa vier keer minder kans op onopgemerkte codefouten ten opzichte van Opus 4.7 is het gebouwd voor engineers die nauwkeurigheid boven doorlooptijd stellen.

Tokonomix model-analyse
Sectie 01

Snelheidsanalyse

Latency gemeten over alle benchmark-runs. P50 (mediaan) en P95 (95e percentiel) geven een realistisch beeld van de responssnelheid onder normale en piekbelasting.

P50 latency (mediaan)P95 latency100 runs
702138320652746342708-2109-14ms
Sectie 02

Kwaliteitsscores

Hoe dit model zich per promptcategorie verhoudt tot de rest van het veld, uit een paarsgewijze berekening over dezelfde prompts. Het ruwe jurycijfer staat onder elk getal.

48%
Code generatie
jurygemiddelde 94
44%
Creatief
jurygemiddelde 87
72%
Feitelijk
jurygemiddelde 88
58%
Meertaligheid
jurygemiddelde 98
67%
Redeneren
jurygemiddelde 99

Winstpercentage per categorie: hoe vaak dit model een gemiddeld model verslaat op een prompt uit die categorie. 50% is gemiddeld, geen onvoldoende. Het is geen percentage goede antwoorden.

Sectie 03

Prijzen

Wat je per miljoen tokens betaalt als je dit model via Tokonomix gebruikt, plus een schatting voor een gemiddeld gesprek.

💰
API-tarieven — Claude Opus 4.8
$6.50 per 1M input-tokens
$32.50 per 1M output-tokens
≈ $0.0104 per typisch gesprek (800 tokens)
Input vs output prijs (per 1M tokens)
per 1M input-tokens$6.50
per 1M output-tokens$32.50
Sectie 04

Tokens per seconde

Doorvoersnelheid in tokens per seconde, afgeleid uit gemeten P50-latency. Hogere waarden zijn beter; fluctuaties weerspiegelen serverbelasting bij de provider.

Doorvoer (tokens / s)203 / avg 185
28373

Geschat uit P50-latency × 200 output-tokens — het absolute getal hangt af van deze aanname; de trend is wat telt.

Sectie 05

Sterke & zwakke punten

Gebaseerd op benchmark-resultaten en geaggregeerde community-feedback over echte use-cases.

Sterke punten

4× minder onopgemerkte codefoutenLangere autonome runs zonder afwijkingScherpere zelfbeoordeling van voortgang1 miljoen tokens contextvensterAdaptive thinking voor complexe redeneringIngebouwde vision-ondersteuningRobuuste tool-use voor agentische pipelines

Zwakke punten

Hogere kosten dan Sonnet 4.6 of Haiku 4.5Hogere latency dan lichtere modellenKnowledge-cutoff beperkt actuele kennisGeen extended-thinking modus beschikbaar
Sectie 06

Mogelijkheden

toolssource: litellmvisionjson modepdf inputreasoningjson schemaprompt cachingmax output tokens: 128000
Sectie 07

Veelgestelde vragen

Als codebetrouwbaarheid of autonome taaklengte de bottleneck is. Opus 4.8 maakt circa vier keer minder kans op onopgemerkte codefouten en houdt langer koers zonder menselijke bijsturing. Voor kortere of minder foutgevoelige taken biedt Opus 4.7 nog steeds solide resultaten.

Opus 4.8 zet een duidelijke stap voorwaarts voor autonome codeer- en analyseworkflows, maar de hogere prijs ten opzichte van Sonnet 4.6 maakt een bewuste inzetbeslissing noodzakelijk.

Tokonomix redactie
Sectie 08

Beschikbaarheid

Beschikbaarheid

Hoe vaak dit model antwoordt als we het aanroepen — gemeten over echte API-aanvragen en live-tests in de afgelopen 30 dagen. Dit staat los van kwaliteit: deze cijfers laten alleen zien of het model reageert, niet hoe goed het antwoord is.

Afgelopen 7 dagen

100.0%

n=53

Afgelopen 30 dagen

100.0%

n=56

Mediane responstijd

8,130ms

n=56

Gebaseerd op 441 metingen in de afgelopen 30 dagen.

Technische details

Alleen echte API-aanroepen en live-testverzoeken tellen mee — interne probes en benchmarkruns zijn uitgesloten.

Aanroepen met een eigen API-sleutel (BYOK) zijn uitgesloten: die fouten zijn sleutelspecifiek en geen teken van modelneergang.

Mislukte aanroepen worden NIET meegeteld in kwaliteitsscores — kwaliteit wordt gemeten op geslaagde responses. Beschikbaarheid en kwaliteit zijn onafhankelijke signalen.

Mediane responstijd (p50) over geslaagde aanroepen met een vastgelegde duur. Uitschieters trekken de mediaan minder dan het gemiddelde.

Totaal aanroepen (30d)

56

OK-reacties (30d)

56

Totaal aanroepen (7d)

53

OK-reacties (7d)

53

Sectie 09

Tokonomix benchmark-oordelen

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-594/100 · 80 runs
74 correct4 partial2 wrong93% accuracy
2026-09-13

Claude Opus 4.8 adds seven capabilities but lacks performance benchmarks

Claude Opus 4.8 introduces a significant expansion of capabilities without accompanying performance data. The model now supports seven new features: tools, vision, JSON mode, PDF input, reasoning, JSON schema, and prompt caching. These additions represent a substantial broadening of the model's functionality, particularly with the inclusion of multimodal capabilities through vision and PDF input, as well as structured output options via JSON mode and schema support. The reasoning capability suggests enhanced analytical features, while prompt caching could improve efficiency for repetitive tasks. However, no benchmark scores are available in the current window, making it impossible to assess the model's actual performance across standard evaluation metrics or compare it to previous versions or competitors. Users gain access to a more versatile model with expanded input and output formats, but without performance data, it remains unclear whether these new capabilities come with any trade-offs in speed, accuracy, or other quality metrics. The absence of benchmarks is notable given that this appears to be a major feature release.

Kwaliteit

Latency p50

Testruns

0

Seven new capabilities added Multimodal support via vision Structured output with JSON No benchmark data available
Sectie 10

Volledig modelprofiel

Claude Opus 4.8 van Anthropic

Uitgebracht op 28 mei 2026. Anthropic's nieuwste vlaggenschip. Vergeleken met Opus 4.7: ongeveer 4× minder kans op onopgemerkte code-fouten, scherpere zelfbeoordeling van voortgang, langere autonome runs.

Volledige redactionele inhoud volgt — pagina is gevuld vanuit officiële Anthropic-release-data op 29 mei 2026. Benchmark-scores verschijnen automatisch zodra de Tokonomix-testrunners Opus 4.8 opnemen in hun volgende intelligentie- en snelheidscyclus.

Laatste automatische test
14 sep 2026 · 20:02 UTC · Snelheidstest
P50 latency
987 ms
P95 latency
1118 ms
Fouten
0 / 6 runs
Laatst beoordeeld door Tokonomix-team·15 september 2026