Naar inhoud
Tier A — Frontier
Draait in:USGemaakt in:United States
Anthropic

Claude Fable 5

Tier A — Frontier · 1M tokens

Tokonomix-redactie·Gecontroleerd door Mes Kalkan·

Claude Fable 5 is het vision-en-redeneermodel van Anthropic, met een variant van één miljoen tokens context. In onze eigen image-QC-pilot was het de stabielste beoordelaar die we testten — daarom maakten we het de standaard vision-proposer in ons image-consensuspanel. Dit is wat we maten, en waar niet.

Wat we van een vision-proposer wilden was geen slimheid maar stabiliteit — en op onze pilotset was Fable 5 de stabielste.

Tokonomix vision-QC-pilot, 9 juni 2026
Sectie 01

Snelheidsanalyse

Latency gemeten over alle benchmark-runs. P50 (mediaan) en P95 (95e percentiel) geven een realistisch beeld van de responssnelheid onder normale en piekbelasting.

P50 latency (mediaan)P95 latency2 runs
2691290631213336355107-2507-25ms
Sectie 02

Prijsgeschiedenis

Directe provider-tarieven per miljoen tokens, plus een typische gespreks-kostschatting.

💰
API-tarieven — Claude Fable 5
$10.00 per 1M input-tokens
$50.00 per 1M output-tokens
≈ $0.0160 per typisch gesprek (800 tokens)
Input vs output prijs (per 1M tokens)
per 1M input-tokens$10.00
per 1M output-tokens$50.00

Pricing over time

Input & output per 1M tokens · step-line = price changes

$10.00

input / 1M

— stable

$50.00

output / 1M

— stable

2026-06-102026-06-142026-06-14
Input
Output
Price change
⟳ synced weekly
Sectie 03

Tokens per seconde

Doorvoersnelheid in tokens per seconde, afgeleid uit gemeten P50-latency. Hogere waarden zijn beter; fluctuaties weerspiegelen serverbelasting bij de provider.

Doorvoer (tokens / s)65 / avg 66
7455

Geschat uit P50-latency × 200 output-tokens — het absolute getal hangt af van deze aanname; de trend is wat telt.

Sectie 04

Sterke & zwakke punten

Gebaseerd op benchmark-resultaten en geaggregeerde community-feedback over echte use-cases.

Sterke punten

Stabielste vision-proposer in onze pilot (88% run-identiek)Laag vals-alarmpercentage (7,1% op de baseline van 300 beelden)Ving blinde vlekken die andere panelmodellen misten1M-token contextvariant voor lang, beeldrijk materiaal

Zwakke punten

Solo-recall 66,9% — een panel is nodig voor 87,5%Redeneer-/codeercijfers zijn vroeg (één run, n=1)
Sectie 05

Mogelijkheden

toolssource: manualvisionjson modepdf inputreasoningjson schemamodel class: mythosprompt cachingmax output tokens: 128000
Sectie 06

Veelgestelde vragen

In onze pilot van 9 juni 2026 was het 88% van de tijd run-identiek, veranderde het maar 3,9% van de tijd van mening en leverde het nul fout-positieven — de stabiliteit die je vooraan in een QC-pijplijn wilt. Een bewuste productbeslissing op basis van die pilot.

We geven je liever de nuance — kleine pilot, baseline van één dag, vroege redeneercijfers — dan een glad verhaal dat de volgende run niet overleeft.

Tokonomix redactie
Sectie 07

Beschikbaarheid

Beschikbaarheid

Hoe vaak dit model antwoordt als we het aanroepen — gemeten over echte API-aanvragen en live-tests in de afgelopen 30 dagen. Dit staat los van kwaliteit: deze cijfers laten alleen zien of het model reageert, niet hoe goed het antwoord is.

Afgelopen 7 dagen

100.0%

n=1

Afgelopen 30 dagen

100.0%

n=1

Mediane responstijd

3,294ms

n=1

Gebaseerd op 7 metingen in de afgelopen 30 dagen.

Technische details

Alleen echte API-aanroepen en live-testverzoeken tellen mee — interne probes en benchmarkruns zijn uitgesloten.

Aanroepen met een eigen API-sleutel (BYOK) zijn uitgesloten: die fouten zijn sleutelspecifiek en geen teken van modelneergang.

Mislukte aanroepen worden NIET meegeteld in kwaliteitsscores — kwaliteit wordt gemeten op geslaagde responses. Beschikbaarheid en kwaliteit zijn onafhankelijke signalen.

Mediane responstijd (p50) over geslaagde aanroepen met een vastgelegde duur. Uitschieters trekken de mediaan minder dan het gemiddelde.

Totaal aanroepen (30d)

1

OK-reacties (30d)

1

Totaal aanroepen (7d)

1

OK-reacties (7d)

1

Beeldkwaliteit-pilot (2026-06-10)

Recall

66.9%

n=300

Vals alarm

7.1%

n=300

Sectie 08

Tokonomix benchmark-oordelen

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-591/100 · 25 runs
22 correct1 partial2 wrong88% accuracy
2026-06-14

Claude Fable 5 shows improved coding, but reasoning and factual decline

Claude Fable 5 demonstrates a mixed performance shift from the previous window. The overall quality score decreased from 88.4 to 85.7, driven primarily by notable declines in reasoning and factual accuracy. Reasoning performance dropped significantly from a perfect 100 to 83, representing the most substantial category decline. Factual accuracy also fell from 68 to 60, continuing weakness in this area. However, coding performance improved from 97 to 98, maintaining strength in technical tasks. Latency showed marginal improvement, with p50 decreasing from 8318ms to 7986ms, though this remains relatively slow for real-time applications. The test sample size increased from 5 to 8 runs, providing somewhat greater statistical confidence. No new capabilities were detected in this window, suggesting a focus on performance tuning rather than feature expansion. Users should be aware that while coding tasks remain highly reliable, applications requiring strong reasoning or factual retrieval may see degraded results compared to the previous benchmark period. The overall trend indicates some regression in core capabilities that may warrant attention from development teams relying on this model for production workloads.

Quality

Latency p50

Test runs

0

Reasoning dropped from 100 to 83 Factual accuracy declined to 60 Coding improved slightly to 98 Latency improved to 7986ms
Sectie 09

Volledig modelprofiel

Claude Fable 5: de stabielste beoordelaar die we testten

Claude Fable 5 van Anthropic is een vision-en-redeneermodel, en de variant waar wij het meest op leunen — claude-fable-5[1m] — heeft een contextvenster van één miljoen tokens. We gaan geen specsheet opdreunen. Wat we wél kunnen bieden is iets dat de meeste stukken niet hebben: cijfers uit onze eigen metingen, mét datums en steekproefgroottes, en een eerlijke kanttekening waar het bewijs dun is.

Waarom dit onze standaard vision-proposer werd

Op 9 juni 2026 draaiden we een vision-QC-pilot — een set beelden, elk met een bekende mediakwaliteitsfout om te vangen, gevoed aan meerdere vision-modellen zodat we hun gedrag konden vergelijken. Fable 5 viel op om één eigenschap die zwaarder weegt dan pure slimheid: stabiliteit.

Over herhaalde runs op de pilotset was het 88% van de tijd run-identiek, met een flip-rate van 3,9% — het veranderde dus zelden van mening over hetzelfde beeld tussen twee passages. Op die pilotset leverde het nul fout-positieven op: het verzon geen defecten die er niet waren. Het ving ook blinde vlekken die andere modellen in het panel misten.

Stabiliteit is precies wat je van een proposer wilt. Wie vandaag een echt defect markeert en morgen hetzelfde beeld negeert, is een lastige basis voor een proces. Wie elke keer hetzelfde antwoordt — en geen vals alarm slaat — kun je vooraan in een pijplijn zetten. Dat deden we: Fable 5 is de standaard vision-proposer in ons image-consensuspanel. (Een bewuste productbeslissing, genomen op basis van de pilot.) Het zit niet in onze text-judge-pools — zijn taak hier is naar beelden kijken, niet tekst scoren.

De baseline van vandaag: 300 beelden, live gemeten

Een pilot is klein. Dus lieten we het model een grotere run draaien en publiceren we het resultaat live op onze vision-QC-benchmark.

Op 10 juni 2026, tegen de dataset mediaqc-v3-2026-06-10 van 300 beelden, scoorde Fable 5 solo:

  • 66,9% recall — het aandeel echte defecten dat het ving. Dat deelde de beste solo-score van de run.
  • 7,1% vals-alarmpercentage — hoe vaak het een schoon beeld markeerde. Een ander sterk vision-model in dezelfde run zat daar ruim twee keer zo hoog, precies het verschil dat bepaalt of een QC-stap tijd bespaart of verspilt.
  • 60,3% klasse-correct — gevallen waarin het niet alleen het defect ving maar ook de juiste categorie benoemde.

Twee derde recall, solo, is bruikbaar maar geen afgerond verhaal — daarom draaien we een panel in plaats van één model. Met Fable 5 in het consensuspanel steeg de recall naar 87,5%. De stabiliteit van de proposer geeft de raad iets betrouwbaars om op te bouwen; de raad dicht het gat dat één model openlaat.

Redeneren en code: vroeg, eerlijk signaal

Bij vision hebben we het meeste bewijs. Over algemene capaciteit minder, en dat zeggen we gewoon.

In een interne evaluatie op 9 juni 2026 — een harness van 682 tests die we over modellen draaien — scheidden de resultaten van Fable 5 zich scherp af: het scoorde 91% en 73% op de twee helften van die harness, waar de modellen waarmee we vergeleken 3% en 0% scoorden op dezelfde taken. Een groot gat, dat we behandelen als sterk signaal en niet als eindoordeel, want één harness kan een model vleien of straffen op manieren die een tweede zou corrigeren.

Onze eerste intelligentie-run op het platform, vandaag, gaf een redeneerscore van 100 en een codeerscore van 97. Voorlopig — één run, n=1. We melden ze omdat vroege cijfers verzwijgen ook een vorm van oneerlijkheid is, maar één run is één run. Volg de leaderboard terwijl de steekproef groeit.

Waar de 1M-contextvariant voor is

De variant claude-fable-5[1m] bestaat voor de gevallen waar context de bottleneck is, niet het redeneren. Zo'n breed venster laat je een lange documentset, veel referentiemateriaal of een uitgebreide interactie in één keer voor het model houden in plaats van te knippen en te hopen dat niets belangrijks uit beeld valt. Gecombineerd met vision past het bij werk waar het model over veel materiaal moet redeneren én naar de beelden erin moet kijken — lange rapporten, documentsets met figuren, screenshots in context.

Hoe je deze cijfers leest

Alles hierboven is gemeten, gedateerd en begrensd door een benoemde steekproefgrootte. De vision-QC-pilot was klein; de baseline van 300 beelden is groter maar is één dataset op één dag; de redeneer- en codeercijfers zijn vroeg. We geven je liever die nuance dan een glad verhaal, want het gladde verhaal overleeft meestal de volgende run niet.

Claude Fable 5 is beschikbaar via de Tokonomix-gateway en -catalogus. Je kunt het op je eigen beelden zetten via onze vision-QC-benchmark of het volgen over taken op de leaderboard.

Laatste automatische test
25 jul 2026 · 08:03 UTC · Snelheidstest
P50 latency
3089 ms
P95 latency
3381 ms
Fouten
0 / 6 runs
Laatst beoordeeld door Tokonomix-team·10 juni 2026