Zum Inhalt
Tier A — Frontier
Läuft in:USErstellt in:United States

Einstellungsdatum

Der Anbieter nennt den 9. Juni 2027 als vorläufiges Einstellungsdatum. Das Modell ist derzeit wie gewohnt verfügbar.

Anthropic

Claude Fable 5

Tier A — Frontier · 1M Tokens

Tokonomix-Redaktionsteam·Geprüft von Mes Kalkan·

Claude Fable 5 ist Anthropics Vision-und-Reasoning-Modell mit einer Kontextvariante von einer Million Token. In unserem eigenen Bild-QC-Piloten war es der stabilste Prüfer, den wir getestet haben — deshalb haben wir es zum Standard-Vision-Proposer in unserem Bild-Konsenspanel gemacht. Das ist, was wir gemessen haben, und was nicht.

Was wir von einem Vision-Proposer wollten, war nicht Cleverness, sondern Stabilität — und auf unserem Pilot-Set war Fable 5 der stabilste.

Tokonomix Vision-QC-Pilot, 9. Juni 2026
Abschnitt 01

Geschwindigkeitsanalyse

Latenz über alle Benchmark-Läufe gemessen. P50 (Median) und P95 (95. Perzentil) zeigen ein realistisches Bild der Antwortgeschwindigkeit bei normaler und Spitzenlast.

P50-Latenz (Median)P95-Latenz100 runs
2251388555207154878808-2109-14ms
Abschnitt 02

Qualitätswerte

Wie sich dieses Modell je Prompt-Kategorie zum übrigen Feld verhält, aus einem paarweisen Fit über dieselben Prompts. Die rohe Jury-Wertung steht unter jeder Zahl.

64%
Codegenerierung
Jury-Mittel 97
67%
Kreativ
Jury-Mittel 89
59%
Faktisch
Jury-Mittel 67
65%
Mehrsprachig
Jury-Mittel 99
69%
Schlussfolgern
Jury-Mittel 98

Gewinnrate je Kategorie: wie oft dieses Modell ein durchschnittliches Modell bei einem Prompt dieser Kategorie schlägt. 50% ist der Durchschnitt, keine schlechte Note. Es ist kein Prozentsatz richtiger Antworten.

Abschnitt 03

Preise

Was Sie pro Million Tokens zahlen, wenn Sie dieses Modell über Tokonomix nutzen, plus eine Schätzung für ein typisches Gespräch.

💰
API-Tarife — Claude Fable 5
$13.00 pro 1M Input-Tokens
$65.00 pro 1M Output-Tokens
≈ $0.0208 pro typischem Gespräch (800 Tokens)
Input- vs. Output-Preis (pro 1M Tokens)
pro 1M Input-Tokens$13.00
pro 1M Output-Tokens$65.00
Abschnitt 04

Tokens pro Sekunde

Durchsatz in Tokens pro Sekunde, abgeleitet aus gemessener P50-Latenz. Höhere Werte sind besser; Schwankungen spiegeln die Provider-seitige Last wider.

Durchsatz (Tokens / s)69 / avg 60
8832

Geschätzt aus P50-Latenz × 200 Output-Tokens — die absolute Zahl hängt von dieser Annahme ab; entscheidend ist der Trend.

Abschnitt 05

Stärken & Schwächen

Basierend auf Benchmark-Ergebnissen und aggregiertem Community-Feedback zu realen Anwendungsfällen.

Stärken

Stabilster Vision-Proposer im Piloten (88% lauf-identisch)Niedrige Fehlalarmrate (7,1% auf der 300-Bilder-Baseline)Fing blinde Flecken, die andere Panel-Modelle übersahen1M-Token-Kontextvariante für lange, bildreiche Inhalte

Schwächen

Solo-Recall 66,9% — ein Panel braucht es für 87,5%Reasoning-/Coding-Zahlen sind früh (ein Lauf, n=1)
Abschnitt 06

Fähigkeiten

toolssource: manualvisionjson modepdf inputreasoningjson schemamodel class: mythosprompt cachingmax output tokens: 128000
Abschnitt 07

Häufig gestellte Fragen

In unserem Piloten vom 9. Juni 2026 war es zu 88% lauf-identisch, änderte nur in 3,9% der Fälle seine Antwort und produzierte null Falsch-Positive — die Stabilität, die man am Anfang einer QC-Pipeline will. Eine bewusste Produktentscheidung auf Basis dieses Piloten.

Wir geben Ihnen lieber die Textur — kleiner Pilot, Eintages-Baseline, frühe Reasoning-Zahlen — als eine glatte Geschichte, die den nächsten Lauf nicht übersteht.

Tokonomix Redaktion
Abschnitt 08

Verfügbarkeit

Verfügbarkeit

Wie oft dieses Modell antwortet, wenn wir es aufrufen — gemessen anhand echter API-Anfragen und Live-Tests der letzten 30 Tage. Dies ist unabhängig von der Qualität: Diese Zahlen zeigen nur, ob das Modell antwortet, nicht wie gut die Antwort ist.

Letzte 7 Tage

62.5%

n=48

Letzte 30 Tage

70.5%

n=61

Mediane Antwortzeit

16,774ms

n=43

Basierend auf 448 Messungen in den letzten 30 Tagen.

Technische Details

Nur echte API-Aufrufe und Live-Test-Anfragen werden gezählt — interne Proben und Benchmark-Läufe sind ausgeschlossen.

Aufrufe mit einem eigenen API-Schlüssel (BYOK) sind ausgeschlossen: Diese Fehler sind schlüsselspezifisch und kein Zeichen für Modellausfälle.

Fehlgeschlagene Aufrufe werden NICHT in Qualitätswerten berücksichtigt — Qualität wird nur für erfolgreiche Antworten gemessen. Verfügbarkeit und Qualität sind unabhängige Signale.

Mediane Antwortzeit (p50) über erfolgreiche Aufrufe mit aufgezeichneter Dauer. Ausreißer beeinflussen den Median weniger als den Durchschnitt.

Gesamte Aufrufe (30d)

61

OK-Antworten (30d)

43

Gesamte Aufrufe (7d)

48

OK-Antworten (7d)

30

Bildqualitäts-Pilot (2026-06-10)

Recall

66.9%

n=300

Fehlalarmrate

7.1%

n=300

Abschnitt 09

Tokonomix-Benchmark-Urteile

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 2 runs
2 correct0 partial0 wrong100% accuracy
claude-sonnet-4-589/100 · 65 runs
55 correct4 partial6 wrong85% accuracy
2026-09-13

Claude Fable 5 shows reasoning gains but latency degrades 20%

Claude Fable 5 demonstrates a modest overall quality improvement, rising from 86.9 to 88.0 across the benchmark window. The most significant development is perfect reasoning performance at 100, showing strong capabilities in logical tasks and problem-solving scenarios. Coding performance remains exceptionally stable, improving only marginally from 95 to 96, indicating consistent strength in programming tasks. However, the model faces a notable performance tradeoff. Latency has increased substantially from 7361ms to 8825ms at the median, representing a 20% slowdown in response times. This degradation may impact user experience in time-sensitive applications despite the quality improvements. Category coverage has shifted between windows, with factual question performance now measured at 68, suggesting room for improvement in knowledge retrieval tasks. Previous strengths in creative writing (66) and multilingual capabilities (100) are not reflected in current testing, making direct comparison difficult. The overall quality gain of 1.1 points suggests incremental refinement rather than transformative changes. Users should weigh the reasoning improvements against increased wait times when evaluating this model for production deployment.

Qualität

88.0

Latenz p50

8,825 ms

Testläufe

5

Perfect reasoning score achieved Coding remains exceptionally strong Latency increased 20% Factual performance needs improvement
Abschnitt 10

Vollständiges Modellprofil

Claude Fable 5: der stabilste Prüfer, den wir getestet haben

Anthropics Claude Fable 5 ist ein Vision-und-Reasoning-Modell, und die Variante, auf die wir uns am meisten stützen — claude-fable-5[1m] — hat ein Kontextfenster von einer Million Token. Wir werden kein Datenblatt herunterbeten. Stattdessen bieten wir, was die meisten Texte nicht haben: Zahlen aus unseren eigenen Messungen, mit Datum und Stichprobengröße, und einen ehrlichen Hinweis darauf, wo die Belege dünn werden.

Warum es unser Standard-Vision-Proposer wurde

Am 9. Juni 2026 führten wir einen Bild-QC-Piloten durch — eine Reihe von Bildern mit jeweils einem bekannten Medienqualitätsfehler, die mehreren Vision-Modellen vorgelegt wurden, um ihr Verhalten zu vergleichen. Fable 5 stach durch eine Eigenschaft hervor, die schwerer wiegt als reine Cleverness: Stabilität.

Über wiederholte Läufe auf dem Pilot-Set war es zu 88% lauf-identisch, bei einer Flip-Rate von 3,9% — es änderte also selten seine Meinung über dasselbe Bild von einem Durchlauf zum nächsten. Auf diesem Set produzierte es null Falsch-Positive: keine erfundenen Defekte. Es fing auch blinde Flecken, die andere Modelle im Panel übersahen.

Stabilität ist genau das, was man von einem Proposer will. Ein Modell, das heute einen echten Defekt meldet und morgen dasselbe Bild ignoriert, taugt schlecht als Prozessgrundlage. Eines, das jedes Mal gleich antwortet — und keinen Fehlalarm schlägt — kann man an den Anfang einer Pipeline stellen. Genau das taten wir: Fable 5 ist der Standard-Vision-Proposer in unserem Bild-Konsenspanel. (Eine bewusste Produktentscheidung auf Basis des Piloten.) Es ist nicht in unseren Text-Judge-Pools — seine Aufgabe hier ist, Bilder anzusehen, nicht Text zu bewerten.

Die heutige Baseline: 300 Bilder, live gemessen

Ein Pilot ist klein. Also ließen wir das Modell einen größeren Lauf absolvieren und veröffentlichen das Ergebnis live auf unserem Vision-QC-Benchmark.

Am 10. Juni 2026, gegen den Datensatz mediaqc-v3-2026-06-10 mit 300 Bildern, erreichte Fable 5 solo:

  • 66,9% Recall — der Anteil echter Defekte, den es fing. Das war das beste Einzelmodell-Ergebnis des Laufs (gleichauf).
  • 7,1% Fehlalarmrate — wie oft es ein sauberes Bild markierte. Ein anderes starkes Vision-Modell im selben Lauf lag dabei mehr als doppelt so hoch — genau der Unterschied, der entscheidet, ob ein QC-Schritt Zeit spart oder verschwendet.
  • 60,3% klassenkorrekt — Fälle, in denen es nicht nur den Defekt fing, sondern auch die richtige Kategorie benannte.

Zwei Drittel Recall solo ist brauchbar, aber keine fertige Geschichte — deshalb betreiben wir ein Panel statt eines einzelnen Modells. Mit Fable 5 im Konsenspanel stieg der Recall auf 87,5%. Die Stabilität des Proposers gibt dem Rat etwas Verlässliches; der Rat schließt die Lücke, die ein Modell allein offenlässt.

Reasoning und Coding: frühes, ehrliches Signal

Bei Vision haben wir die meisten Belege. Zur allgemeinen Fähigkeit weniger — und das sagen wir offen.

In einer internen Evaluierung am 9. Juni 2026 — ein Harness aus 682 Tests, das wir über Modelle laufen lassen — trennten sich Fable 5s Ergebnisse scharf vom Feld: es erreichte 91% und 73% auf den beiden Hälften, wo die Vergleichsmodelle 3% und 0% auf identischen Aufgaben erzielten. Ein großer Abstand, den wir als starkes Signal behandeln, nicht als endgültiges Urteil, denn ein einzelnes Harness kann ein Modell schmeicheln oder bestrafen.

Unser erster Intelligenz-Lauf auf der Plattform, heute, ergab eine Reasoning-Punktzahl von 100 und eine Coding-Punktzahl von 97. Vorläufig — ein einziger Lauf, n=1. Wir berichten sie, weil das Verschweigen früher Zahlen seine eigene Unehrlichkeit ist, aber ein Lauf bleibt ein Lauf. Verfolgen Sie die Bestenliste, während die Stichprobe wächst.

Wofür die 1M-Kontextvariante da ist

Die Variante claude-fable-5[1m] existiert für Fälle, in denen der Kontext der Engpass ist, nicht das Reasoning. Ein so breites Fenster lässt einen langen Dokumentsatz, viel Referenzmaterial oder eine ausgedehnte Interaktion auf einmal vor das Modell legen, statt zu zerstückeln. Kombiniert mit Vision passt es zu Arbeit, bei der das Modell über viel Material schließen und die eingebetteten Bilder ansehen muss — lange Berichte, Dokumentsätze mit Abbildungen, Screenshots im Kontext.

Wie diese Zahlen zu lesen sind

Alles oben ist gemessen, datiert und durch eine benannte Stichprobengröße begrenzt. Der Vision-QC-Pilot war klein; die 300-Bilder-Baseline ist größer, aber ein Datensatz an einem Tag; die Reasoning- und Coding-Zahlen sind früh. Wir geben Ihnen lieber diese Textur als eine glatte Geschichte, denn die glatte überlebt meist den nächsten Lauf nicht.

Claude Fable 5 ist über das Tokonomix-Gateway und den Katalog verfügbar. Sie können es auf Ihren eigenen Bildern testen über unseren Vision-QC-Benchmark oder über Aufgaben hinweg auf der Bestenliste verfolgen.

Letzter automatisierter Test
14. Sept. 2026 · 20:02 UTC · Geschwindigkeits-Benchmark
P50-Latenz
2913 ms
P95-Latenz
3228 ms
Fehler
0 / 6 Läufe
Zuletzt geprüft von Tokonomix-Team·10. Juni 2026