Naar inhoud
Tier A — Frontier
Draait in:USGemaakt in:United States

Einddatum

De aanbieder noemt 30 juni 2027 als voorlopige einddatum voor dit model. Het model is nu gewoon beschikbaar.

Anthropic

Claude Sonnet 5

Tier A — Frontier · 1M tokens

Tokonomix-redactie·Gecontroleerd door Mes Kalkan·
Sectie 01

Snelheidsanalyse

Latency gemeten over alle benchmark-runs. P50 (mediaan) en P95 (95e percentiel) geven een realistisch beeld van de responssnelheid onder normale en piekbelasting.

P50 latency (mediaan)P95 latency100 runs
8483324580082751075108-2109-14ms
Sectie 02

Kwaliteitsscores

Hoe dit model zich per promptcategorie verhoudt tot de rest van het veld, uit een paarsgewijze berekening over dezelfde prompts. Het ruwe jurycijfer staat onder elk getal.

54%
Code generatie
jurygemiddelde 93
89%
Creatief
jurygemiddelde 92
53%
Feitelijk
jurygemiddelde 73
65%
Meertaligheid
jurygemiddelde 98
59%
Redeneren
jurygemiddelde 75

Winstpercentage per categorie: hoe vaak dit model een gemiddeld model verslaat op een prompt uit die categorie. 50% is gemiddeld, geen onvoldoende. Het is geen percentage goede antwoorden.

Sectie 03

Prijzen

Wat je per miljoen tokens betaalt als je dit model via Tokonomix gebruikt, plus een schatting voor een gemiddeld gesprek.

💰
API-tarieven — Claude Sonnet 5
$2.60 per 1M input-tokens
$13.00 per 1M output-tokens
≈ $0.0042 per typisch gesprek (800 tokens)
Input vs output prijs (per 1M tokens)
per 1M input-tokens$2.60
per 1M output-tokens$13.00
Sectie 04

Tokens per seconde

Doorvoersnelheid in tokens per seconde, afgeleid uit gemeten P50-latency. Hogere waarden zijn beter; fluctuaties weerspiegelen serverbelasting bij de provider.

Doorvoer (tokens / s)187 / avg 160
23427

Geschat uit P50-latency × 200 output-tokens — het absolute getal hangt af van deze aanname; de trend is wat telt.

Sectie 05

Mogelijkheden

toolssource: manualvisionjson modepdf inputreasoningjson schemaprompt cachingmax output tokens: 128000
Sectie 06

Beschikbaarheid

Beschikbaarheid

Hoe vaak dit model antwoordt als we het aanroepen — gemeten over echte API-aanvragen en live-tests in de afgelopen 30 dagen. Dit staat los van kwaliteit: deze cijfers laten alleen zien of het model reageert, niet hoe goed het antwoord is.

Afgelopen 7 dagen

100.0%

n=13

Afgelopen 30 dagen

100.0%

n=13

Mediane responstijd

30,020ms

n=13

Gebaseerd op 398 metingen in de afgelopen 30 dagen.

Technische details

Alleen echte API-aanroepen en live-testverzoeken tellen mee — interne probes en benchmarkruns zijn uitgesloten.

Aanroepen met een eigen API-sleutel (BYOK) zijn uitgesloten: die fouten zijn sleutelspecifiek en geen teken van modelneergang.

Mislukte aanroepen worden NIET meegeteld in kwaliteitsscores — kwaliteit wordt gemeten op geslaagde responses. Beschikbaarheid en kwaliteit zijn onafhankelijke signalen.

Mediane responstijd (p50) over geslaagde aanroepen met een vastgelegde duur. Uitschieters trekken de mediaan minder dan het gemiddelde.

Totaal aanroepen (30d)

13

OK-reacties (30d)

13

Totaal aanroepen (7d)

13

OK-reacties (7d)

13

Sectie 07

Tokonomix benchmark-oordelen

⚖️
Endorsed by 1 judge
Independent LLM judges evaluated this model on our weekly intelligence tests
claude-sonnet-4-587/100 · 30 runs
26 correct1 partial3 wrong87% accuracy
2026-09-13

Claude Sonnet 5 quality drops 16 points with slower response times

Claude Sonnet 5 experienced a significant performance regression in this benchmark window. Overall quality declined from 93.2 to 77.3, representing a 15.9 point drop that affects most capabilities. The model maintained exceptional reasoning performance at a perfect 100 score, but coding ability decreased substantially from 95 to 81. Most concerning is the factual accuracy category, which scored just 52 compared to previous strong performance. Response latency also degraded, with the median increasing from 4.8 to 6.5 seconds, a 36% slowdown that will be noticeable to users. The benchmark categories shifted between windows, making direct comparison challenging for creative and multilingual tasks which were not retested. This change pattern suggests either a model update that traded accuracy for other characteristics, infrastructure issues affecting performance, or possible variations in test composition. Users relying on factual accuracy should exercise additional caution, while those prioritizing reasoning tasks may see less impact. The latency increase affects all use cases and may require timeout adjustments in production environments.

Kwaliteit

77.3

Latency p50

6,457 ms

Testruns

5

Quality dropped 16 points Factual accuracy scored only 52 Response time increased 36% Reasoning remains perfect at 100
Sectie 08

Volledig modelprofiel

Claude Sonnet 5: de middenklasse-Claude gebouwd om te handelen, niet alleen te antwoorden

Claude Sonnet 5 is het middenklassemodel van Anthropic, uitgebracht op 30 juni 2026 als opvolger van Sonnet 4.6. Anthropic positioneert het als de meest agentische Sonnet die het bedrijf ooit heeft uitgebracht: een model dat is gebouwd om een taak te plannen, tools zoals een browser of een terminal te gebruiken, en een meerstaps-opdracht voort te zetten met minder stap-voor-stap toezicht dan eerdere Sonnet-generaties nodig hadden. Anthropics eigen positionering is dat Sonnet 5 een groot deel van de kloof met de vlaggenschip-Opus-lijn dicht, terwijl het in de Sonnet-klasse blijft.

Waar het uitblinkt

Het model is gebouwd rond aanhoudend toolgebruik in plaats van single-turn chat. Het ondersteunt function calling, gestructureerde JSON-output tegen een schema, PDF-invoer en vision, en het biedt een reasoning-modus zodat het een probleem kan doorwerken voordat het antwoordt. Die combinatie past goed bij agentische workflows: een taak die vereist dat een document wordt gelezen, een tool wordt aangeroepen, het resultaat wordt gecontroleerd en wordt besloten wat de volgende stap is, is precies de vorm waarop Anthropic zegt dat deze release mikt. Anthropic rapporteert 78,5% op OSWorld-Verified, zijn computer-use-benchmark, en 46,8% op Humanity's Last Exam wanneer het model tools mag gebruiken — beide zijn Anthropics eigen gepubliceerde cijfers, geen onafhankelijk gereproduceerde getallen, dus ze beschrijven het verhaal van de leverancier over de voortgang van het model, niet een neutraal extern resultaat.

Onder de motorkap

Sonnet 5 heeft een contextvenster van 1.000.000 tokens met een maximale synchrone output van 128.000 tokens per antwoord. Output is alleen tekst — deze generatie Sonnet genereert geen afbeeldingen of audio. Prompt caching wordt ondersteund, wat van belang is voor agentische lussen die een groot, grotendeels ongewijzigd context (een codebase, een lang document, een tool-schema) over veel beurten van dezelfde sessie opnieuw versturen.

Waar het tekortschiet

Anthropics eigen aankondiging van deze release vermeldt geen kennis-cutoffdatum, dus iedereen die op het model vertrouwt voor zeer recente gebeurtenissen of nieuw uitgebrachte bibliotheken, doet er goed aan dit te verifiëren in plaats van aan te nemen dat het actueel is. De sterke punten van het model concentreren zich op tool-gebruikend, meerstaps-werk; voor korte single-turn vragen of eenvoudige classificatie is de agentische machinerie overhead in plaats van voordeel, en een lichter model in dezelfde line-up zal meestal net zo goed antwoorden. Anthropics eigen benchmarkclaims, omdat ze afkomstig zijn van de leverancier die zijn eigen model test, zijn eveneens beter te lezen als richtinggevend dan als vaststaand — de omvang van een verbetering ten opzichte van Sonnet 4.6 is Anthropics eigen karakterisering totdat het tegen onafhankelijke workloads is gecontroleerd.

Wanneer je dit kiest

Sonnet 5 past bij codeeragents, research-agents en elke workflow waarbij het model over meerdere tool-aanroepen moet blijven werken zonder dat een mens bij elke stap opnieuw moet prompten — het debuggen van een falende testsuite, het doorwerken van een meerbestands-refactor, of het end-to-end uitvoeren van een browse-en-samenvat-taak. Het past ook bij workloads die een echt groot contextvenster nodig hebben naast toolgebruik, zoals het doorlichten van een grote codebase of een lange documentenset in één sessie.

Voor werk dat die autonomie niet nodig heeft — kortvormige generatie, eenvoudige extractie, single-call classificatie — doet de agentische overhead niets nuttigs, en zal een kleiner, sneller model doorgaans de verstandigere standaardkeuze zijn.

Alternatieven om te overwegen

Binnen Anthropics eigen line-up staat Claude Opus 5 boven Sonnet 5 als vlaggenschip voor het meest complexe agentische en enterprise-werk, en Claude Fable 5 staat daarboven als Anthropics meest capabele breed uitgebrachte model — beide zijn opties als een workload meer ruimte blijkt nodig te hebben dan Sonnet 5 biedt. Anthropics eigen positionering plaatst Sonnet 5 als naderend tot Opus-klasse-prestaties op veel taken, wat het de moeite waard maakt om daar te beginnen voordat je naar een groter model grijpt, en pas op te schalen als de workload specifiek aantoont dat het de extra capaciteit nodig heeft.

Implementatienotities

Omdat Sonnet 5 gebouwd is rond lange, tool-intensieve sessies, moeten integraties rekenen op en omgaan met meerbeurts-tool-call-lussen in plaats van één enkele request/response-uitwisseling — timeouts, retry-logica en tool-resultaatopmaak moeten allemaal rekening houden met een taak die meerdere ronden kan duren om te voltooien. Het output-plafond van 128.000 tokens is ruim, maar eindig; een workflow die verwacht dat één aanroep een volledig groot gegenereerd artefact teruggeeft, moet bevestigen dat dit binnen dat plafond past voordat er in productie op wordt vertrouwd.

Laatste automatische test
14 sep 2026 · 20:02 UTC · Snelheidstest
P50 latency
1067 ms
P95 latency
1416 ms
Fouten
0 / 6 runs
Laatst beoordeeld door Tokonomix-team·14 september 2026