Naar inhoud
Tier A — Frontier
Draait in:USGemaakt in:United States

Einddatum

De aanbieder noemt 9 juni 2027 als voorlopige einddatum voor dit model. Het model is nu gewoon beschikbaar.

Anthropic

Claude Fable 5

Tier A — Frontier · 1M tokens

Tokonomix-redactie·Gecontroleerd door Mes Kalkan·

Claude Fable 5 is het vision-en-redeneermodel van Anthropic, met een variant van één miljoen tokens context. In onze eigen image-QC-pilot was het de stabielste beoordelaar die we testten — daarom maakten we het de standaard vision-proposer in ons image-consensuspanel. Dit is wat we maten, en waar niet.

Wat we van een vision-proposer wilden was geen slimheid maar stabiliteit — en op onze pilotset was Fable 5 de stabielste.

Tokonomix vision-QC-pilot, 9 juni 2026
Sectie 01

Snelheidsanalyse

Latency gemeten over alle benchmark-runs. P50 (mediaan) en P95 (95e percentiel) geven een realistisch beeld van de responssnelheid onder normale en piekbelasting.

P50 latency (mediaan)P95 latency100 runs
2251388555207154878808-2109-14ms
Sectie 02

Kwaliteitsscores

Hoe dit model zich per promptcategorie verhoudt tot de rest van het veld, uit een paarsgewijze berekening over dezelfde prompts. Het ruwe jurycijfer staat onder elk getal.

64%
Code generatie
jurygemiddelde 97
67%
Creatief
jurygemiddelde 89
59%
Feitelijk
jurygemiddelde 67
65%
Meertaligheid
jurygemiddelde 99
69%
Redeneren
jurygemiddelde 98

Winstpercentage per categorie: hoe vaak dit model een gemiddeld model verslaat op een prompt uit die categorie. 50% is gemiddeld, geen onvoldoende. Het is geen percentage goede antwoorden.

Sectie 03

Prijzen

Wat je per miljoen tokens betaalt als je dit model via Tokonomix gebruikt, plus een schatting voor een gemiddeld gesprek.

💰
API-tarieven — Claude Fable 5
$13.00 per 1M input-tokens
$65.00 per 1M output-tokens
≈ $0.0208 per typisch gesprek (800 tokens)
Input vs output prijs (per 1M tokens)
per 1M input-tokens$13.00
per 1M output-tokens$65.00
Sectie 04

Tokens per seconde

Doorvoersnelheid in tokens per seconde, afgeleid uit gemeten P50-latency. Hogere waarden zijn beter; fluctuaties weerspiegelen serverbelasting bij de provider.

Doorvoer (tokens / s)69 / avg 60
8832

Geschat uit P50-latency × 200 output-tokens — het absolute getal hangt af van deze aanname; de trend is wat telt.

Sectie 05

Sterke & zwakke punten

Gebaseerd op benchmark-resultaten en geaggregeerde community-feedback over echte use-cases.

Sterke punten

Stabielste vision-proposer in onze pilot (88% run-identiek)Laag vals-alarmpercentage (7,1% op de baseline van 300 beelden)Ving blinde vlekken die andere panelmodellen misten1M-token contextvariant voor lang, beeldrijk materiaal

Zwakke punten

Solo-recall 66,9% — een panel is nodig voor 87,5%Redeneer-/codeercijfers zijn vroeg (één run, n=1)
Sectie 06

Mogelijkheden

toolssource: manualvisionjson modepdf inputreasoningjson schemamodel class: mythosprompt cachingmax output tokens: 128000
Sectie 07

Veelgestelde vragen

In onze pilot van 9 juni 2026 was het 88% van de tijd run-identiek, veranderde het maar 3,9% van de tijd van mening en leverde het nul fout-positieven — de stabiliteit die je vooraan in een QC-pijplijn wilt. Een bewuste productbeslissing op basis van die pilot.

We geven je liever de nuance — kleine pilot, baseline van één dag, vroege redeneercijfers — dan een glad verhaal dat de volgende run niet overleeft.

Tokonomix redactie
Sectie 08

Beschikbaarheid

Beschikbaarheid

Hoe vaak dit model antwoordt als we het aanroepen — gemeten over echte API-aanvragen en live-tests in de afgelopen 30 dagen. Dit staat los van kwaliteit: deze cijfers laten alleen zien of het model reageert, niet hoe goed het antwoord is.

Afgelopen 7 dagen

62.5%

n=48

Afgelopen 30 dagen

70.5%

n=61

Mediane responstijd

16,774ms

n=43

Gebaseerd op 448 metingen in de afgelopen 30 dagen.

Technische details

Alleen echte API-aanroepen en live-testverzoeken tellen mee — interne probes en benchmarkruns zijn uitgesloten.

Aanroepen met een eigen API-sleutel (BYOK) zijn uitgesloten: die fouten zijn sleutelspecifiek en geen teken van modelneergang.

Mislukte aanroepen worden NIET meegeteld in kwaliteitsscores — kwaliteit wordt gemeten op geslaagde responses. Beschikbaarheid en kwaliteit zijn onafhankelijke signalen.

Mediane responstijd (p50) over geslaagde aanroepen met een vastgelegde duur. Uitschieters trekken de mediaan minder dan het gemiddelde.

Totaal aanroepen (30d)

61

OK-reacties (30d)

43

Totaal aanroepen (7d)

48

OK-reacties (7d)

30

Beeldkwaliteit-pilot (2026-06-10)

Recall

66.9%

n=300

Vals alarm

7.1%

n=300

Sectie 09

Tokonomix benchmark-oordelen

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 2 runs
2 correct0 partial0 wrong100% accuracy
claude-sonnet-4-589/100 · 65 runs
55 correct4 partial6 wrong85% accuracy
2026-09-13

Claude Fable 5 shows reasoning gains but latency degrades 20%

Claude Fable 5 demonstrates a modest overall quality improvement, rising from 86.9 to 88.0 across the benchmark window. The most significant development is perfect reasoning performance at 100, showing strong capabilities in logical tasks and problem-solving scenarios. Coding performance remains exceptionally stable, improving only marginally from 95 to 96, indicating consistent strength in programming tasks. However, the model faces a notable performance tradeoff. Latency has increased substantially from 7361ms to 8825ms at the median, representing a 20% slowdown in response times. This degradation may impact user experience in time-sensitive applications despite the quality improvements. Category coverage has shifted between windows, with factual question performance now measured at 68, suggesting room for improvement in knowledge retrieval tasks. Previous strengths in creative writing (66) and multilingual capabilities (100) are not reflected in current testing, making direct comparison difficult. The overall quality gain of 1.1 points suggests incremental refinement rather than transformative changes. Users should weigh the reasoning improvements against increased wait times when evaluating this model for production deployment.

Kwaliteit

88.0

Latency p50

8,825 ms

Testruns

5

Perfect reasoning score achieved Coding remains exceptionally strong Latency increased 20% Factual performance needs improvement
Sectie 10

Volledig modelprofiel

Claude Fable 5: de stabielste beoordelaar die we testten

Claude Fable 5 van Anthropic is een vision-en-redeneermodel, en de variant waar wij het meest op leunen — claude-fable-5[1m] — heeft een contextvenster van één miljoen tokens. We gaan geen specsheet opdreunen. Wat we wél kunnen bieden is iets dat de meeste stukken niet hebben: cijfers uit onze eigen metingen, mét datums en steekproefgroottes, en een eerlijke kanttekening waar het bewijs dun is.

Waarom dit onze standaard vision-proposer werd

Op 9 juni 2026 draaiden we een vision-QC-pilot — een set beelden, elk met een bekende mediakwaliteitsfout om te vangen, gevoed aan meerdere vision-modellen zodat we hun gedrag konden vergelijken. Fable 5 viel op om één eigenschap die zwaarder weegt dan pure slimheid: stabiliteit.

Over herhaalde runs op de pilotset was het 88% van de tijd run-identiek, met een flip-rate van 3,9% — het veranderde dus zelden van mening over hetzelfde beeld tussen twee passages. Op die pilotset leverde het nul fout-positieven op: het verzon geen defecten die er niet waren. Het ving ook blinde vlekken die andere modellen in het panel misten.

Stabiliteit is precies wat je van een proposer wilt. Wie vandaag een echt defect markeert en morgen hetzelfde beeld negeert, is een lastige basis voor een proces. Wie elke keer hetzelfde antwoordt — en geen vals alarm slaat — kun je vooraan in een pijplijn zetten. Dat deden we: Fable 5 is de standaard vision-proposer in ons image-consensuspanel. (Een bewuste productbeslissing, genomen op basis van de pilot.) Het zit niet in onze text-judge-pools — zijn taak hier is naar beelden kijken, niet tekst scoren.

De baseline van vandaag: 300 beelden, live gemeten

Een pilot is klein. Dus lieten we het model een grotere run draaien en publiceren we het resultaat live op onze vision-QC-benchmark.

Op 10 juni 2026, tegen de dataset mediaqc-v3-2026-06-10 van 300 beelden, scoorde Fable 5 solo:

  • 66,9% recall — het aandeel echte defecten dat het ving. Dat deelde de beste solo-score van de run.
  • 7,1% vals-alarmpercentage — hoe vaak het een schoon beeld markeerde. Een ander sterk vision-model in dezelfde run zat daar ruim twee keer zo hoog, precies het verschil dat bepaalt of een QC-stap tijd bespaart of verspilt.
  • 60,3% klasse-correct — gevallen waarin het niet alleen het defect ving maar ook de juiste categorie benoemde.

Twee derde recall, solo, is bruikbaar maar geen afgerond verhaal — daarom draaien we een panel in plaats van één model. Met Fable 5 in het consensuspanel steeg de recall naar 87,5%. De stabiliteit van de proposer geeft de raad iets betrouwbaars om op te bouwen; de raad dicht het gat dat één model openlaat.

Redeneren en code: vroeg, eerlijk signaal

Bij vision hebben we het meeste bewijs. Over algemene capaciteit minder, en dat zeggen we gewoon.

In een interne evaluatie op 9 juni 2026 — een harness van 682 tests die we over modellen draaien — scheidden de resultaten van Fable 5 zich scherp af: het scoorde 91% en 73% op de twee helften van die harness, waar de modellen waarmee we vergeleken 3% en 0% scoorden op dezelfde taken. Een groot gat, dat we behandelen als sterk signaal en niet als eindoordeel, want één harness kan een model vleien of straffen op manieren die een tweede zou corrigeren.

Onze eerste intelligentie-run op het platform, vandaag, gaf een redeneerscore van 100 en een codeerscore van 97. Voorlopig — één run, n=1. We melden ze omdat vroege cijfers verzwijgen ook een vorm van oneerlijkheid is, maar één run is één run. Volg de leaderboard terwijl de steekproef groeit.

Waar de 1M-contextvariant voor is

De variant claude-fable-5[1m] bestaat voor de gevallen waar context de bottleneck is, niet het redeneren. Zo'n breed venster laat je een lange documentset, veel referentiemateriaal of een uitgebreide interactie in één keer voor het model houden in plaats van te knippen en te hopen dat niets belangrijks uit beeld valt. Gecombineerd met vision past het bij werk waar het model over veel materiaal moet redeneren én naar de beelden erin moet kijken — lange rapporten, documentsets met figuren, screenshots in context.

Hoe je deze cijfers leest

Alles hierboven is gemeten, gedateerd en begrensd door een benoemde steekproefgrootte. De vision-QC-pilot was klein; de baseline van 300 beelden is groter maar is één dataset op één dag; de redeneer- en codeercijfers zijn vroeg. We geven je liever die nuance dan een glad verhaal, want het gladde verhaal overleeft meestal de volgende run niet.

Claude Fable 5 is beschikbaar via de Tokonomix-gateway en -catalogus. Je kunt het op je eigen beelden zetten via onze vision-QC-benchmark of het volgen over taken op de leaderboard.

Laatste automatische test
14 sep 2026 · 20:02 UTC · Snelheidstest
P50 latency
2913 ms
P95 latency
3228 ms
Fouten
0 / 6 runs
Laatst beoordeeld door Tokonomix-team·10 juni 2026