Aller au contenu
Tier A — Frontier
Fonctionne en :USCréé en :United States
Anthropic

Claude Fable 5

Tier A — Frontier · 1M tokens

Équipe éditoriale Tokonomix·Relu par Mes Kalkan·

Claude Fable 5 est le modèle vision-et-raisonnement d'Anthropic, avec une variante de contexte d'un million de tokens. Dans notre propre pilote de contrôle qualité d'images, c'était l'évaluateur le plus stable que nous ayons testé — nous en avons donc fait le proposeur vision par défaut de notre panel de consensus visuel. Voici ce que nous avons mesuré, et ce que nous n'avons pas mesuré.

Ce que nous attendions d'un proposeur vision n'était pas l'intelligence mais la stabilité — et sur notre jeu pilote, Fable 5 était le plus stable.

Pilote vision-QC Tokonomix, 9 juin 2026
Section 01

Historique des tarifs

Tarifs directs du fournisseur par million de tokens, plus une estimation du coût d'une conversation typique.

💰
Tarifs API — Claude Fable 5
$10.00 par 1M de tokens d'entrée
$50.00 par 1M de tokens de sortie
≈ $0.0160 par conversation typique (800 tokens)
Prix entrée vs sortie (par 1M de tokens)
par 1M de tokens d'entrée$10.00
par 1M de tokens de sortie$50.00

Pricing over time

Input & output per 1M tokens · step-line = price changes

$10.00

input / 1M

— stable

$50.00

output / 1M

— stable

2026-06-102026-06-142026-06-14
Input
Output
Price change
⟳ synced weekly
Section 02

Forces & faiblesses

Basé sur les résultats de benchmarks et les retours communautaires agrégés sur des cas d'usage réels.

Forces

Proposeur vision le plus stable du pilote (88% identique)Faible taux de fausses alertes (7,1% sur la base de 300 images)A détecté des angles morts manqués par d'autres modèlesVariante contexte 1M pour contenus longs et riches en images

Faiblesses

Rappel solo 66,9% — un panel est nécessaire pour 87,5%Chiffres raisonnement/code précoces (un seul run, n=1)
Section 03

Capacités

toolssource: manualvisionjson modepdf inputreasoningjson schemamodel class: mythosprompt cachingmax output tokens: 128000
Section 04

Questions fréquentes

Sur notre pilote du 9 juin 2026, il était identique à 88%, ne changeait d'avis que dans 3,9% des cas et produisait zéro faux positif — la stabilité voulue en tête d'un pipeline de QC. Une décision produit délibérée fondée sur ce pilote.

Nous préférons vous livrer la texture — petit pilote, référence d’un jour, chiffres de raisonnement précoces — plutôt qu’une histoire lisse qui ne survit pas au run suivant.

Rédaction Tokonomix
Section 05

Disponibilité

Disponibilité

La fréquence à laquelle ce modèle répond lorsqu'on l'appelle — mesurée sur de vraies requêtes API et des tests en direct au cours des 30 derniers jours. C'est indépendant de la qualité : ces chiffres indiquent seulement si le modèle répond, pas la qualité de sa réponse.

7 derniers jours

100.0%

n=1

30 derniers jours

100.0%

n=1

Temps de réponse médian

3,294ms

n=1

Basé sur 4 mesures au cours des 30 derniers jours.

Détails techniques

Seuls les vrais appels API et les requêtes de test en direct sont comptés — les sondes internes et les benchmarks sont exclus.

Les appels avec une clé API personnalisée (BYOK) sont exclus : ces échecs sont spécifiques à la clé, pas un signe de défaillance du modèle.

Les appels échoués ne sont PAS inclus dans les scores de qualité — la qualité est mesurée uniquement sur les réponses réussies. Disponibilité et qualité sont des signaux indépendants.

Temps de réponse médian (p50) sur les appels réussis avec une durée enregistrée. Les valeurs extrêmes influencent moins la médiane que la moyenne.

Total des appels (30d)

1

Réponses OK (30d)

1

Total des appels (7d)

1

Réponses OK (7d)

1

Pilote contrôle qualité image (2026-06-10)

Rappel

66.9%

n=300

Faux positifs

7.1%

n=300

Section 06

Verdicts benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-591/100 · 25 runs
22 correct1 partial2 wrong88% accuracy
2026-06-14

Claude Fable 5 shows improved coding, but reasoning and factual decline

Claude Fable 5 demonstrates a mixed performance shift from the previous window. The overall quality score decreased from 88.4 to 85.7, driven primarily by notable declines in reasoning and factual accuracy. Reasoning performance dropped significantly from a perfect 100 to 83, representing the most substantial category decline. Factual accuracy also fell from 68 to 60, continuing weakness in this area. However, coding performance improved from 97 to 98, maintaining strength in technical tasks. Latency showed marginal improvement, with p50 decreasing from 8318ms to 7986ms, though this remains relatively slow for real-time applications. The test sample size increased from 5 to 8 runs, providing somewhat greater statistical confidence. No new capabilities were detected in this window, suggesting a focus on performance tuning rather than feature expansion. Users should be aware that while coding tasks remain highly reliable, applications requiring strong reasoning or factual retrieval may see degraded results compared to the previous benchmark period. The overall trend indicates some regression in core capabilities that may warrant attention from development teams relying on this model for production workloads.

Quality

Latency p50

Test runs

0

Reasoning dropped from 100 to 83 Factual accuracy declined to 60 Coding improved slightly to 98 Latency improved to 7986ms
Section 07

Profil complet du modèle

Claude Fable 5 : l'évaluateur le plus stable que nous ayons testé

Le Claude Fable 5 d'Anthropic est un modèle vision-et-raisonnement, et la variante sur laquelle nous nous appuyons le plus — claude-fable-5[1m] — dispose d'une fenêtre de contexte d'un million de tokens. Nous n'allons pas réciter une fiche technique. Ce que nous offrons à la place, c'est ce que la plupart des articles n'ont pas : des chiffres issus de nos propres mesures, avec les dates et les tailles d'échantillon, et une note honnête là où les preuves se font minces.

Pourquoi il est devenu notre proposeur vision par défaut

Le 9 juin 2026, nous avons mené un pilote de contrôle qualité d'images — un ensemble d'images, chacune avec un défaut de qualité média connu à détecter, soumis à plusieurs modèles vision pour comparer leur comportement. Fable 5 s'est distingué par une qualité qui compte plus que l'intelligence brute : la stabilité.

Sur des passages répétés du jeu pilote, il était identique à 88% d'un passage à l'autre, avec un taux de revirement de 3,9% — il changeait donc rarement d'avis sur une même image. Sur ce jeu, il a produit zéro faux positif : pas de défauts inventés. Il a aussi détecté des angles morts que d'autres modèles du panel ont manqués.

La stabilité est exactement ce que l'on attend d'un proposeur. Un modèle qui signale un vrai défaut aujourd'hui et ignore la même image demain est une mauvaise base de processus. Un modèle qui répond toujours pareil — sans crier au loup — peut être placé en tête d'un pipeline. C'est ce que nous avons fait : Fable 5 est le proposeur vision par défaut de notre panel de consensus visuel. (Une décision produit délibérée, prise sur la foi du pilote.) Il n'est pas dans nos pools de juges de texte — son rôle ici est de regarder des images, pas de noter du texte.

La référence du jour : 300 images, mesurées en direct

Un pilote, c'est petit. Nous avons donc fait passer au modèle un run plus grand et nous en publions le résultat, en direct, sur notre benchmark vision-QC.

Le 10 juin 2026, face au jeu de données mediaqc-v3-2026-06-10 de 300 images, Fable 5 en solo a obtenu :

  • 66,9% de rappel — la part de défauts réels détectés. C'était le meilleur résultat individuel du run (à égalité).
  • 7,1% de taux de fausses alertes — la fréquence à laquelle il signalait une image propre. Un autre modèle vision solide, sur le même run, était plus de deux fois au-dessus — précisément la différence qui décide si une étape de QC fait gagner ou perdre du temps.
  • 60,3% de catégorie correcte — cas où il a non seulement détecté le défaut mais nommé la bonne catégorie.

Deux tiers de rappel en solo, c'est utile mais pas une histoire achevée — d'où l'intérêt d'un panel plutôt que d'un seul modèle. Avec Fable 5 dans le panel de consensus, le rappel est monté à 87,5%. La stabilité du proposeur donne au conseil une base fiable ; le conseil comble l'écart qu'un seul modèle laisse ouvert.

Raisonnement et code : un signal précoce et honnête

C'est sur la vision que nous avons le plus de preuves. Sur la capacité générale, moins — et nous le disons franchement.

Lors d'une évaluation interne le 9 juin 2026 — un harnais de 682 tests que nous passons sur plusieurs modèles — les résultats de Fable 5 se sont nettement détachés : il a obtenu 91% et 73% sur les deux moitiés du harnais, là où les modèles de comparaison obtenaient 3% et 0% sur les mêmes tâches. Un grand écart, que nous traitons comme un signal fort et non comme un verdict définitif, car un seul harnais peut flatter ou pénaliser un modèle.

Notre premier run d'intelligence sur la plateforme, aujourd'hui, a renvoyé un score de raisonnement de 100 et un score de code de 97. Préliminaires — un seul run, n=1. Nous les rapportons parce que cacher des chiffres précoces est aussi une forme de malhonnêteté, mais un run reste un run. Suivez le classement à mesure que l'échantillon grandit.

À quoi sert la variante contexte 1M

La variante claude-fable-5[1m] existe pour les cas où le goulot d'étranglement est le contexte, pas le raisonnement. Une fenêtre aussi large permet de tenir devant le modèle un long ensemble de documents, un large corpus de référence ou une interaction prolongée, plutôt que de découper en espérant ne rien perdre d'important. Couplée à la vision, elle convient au travail où le modèle doit raisonner sur beaucoup de matière et regarder les images qui y sont intégrées — longs rapports, jeux de documents avec figures, captures d'écran en contexte.

Comment lire ces chiffres

Tout ce qui précède est mesuré, daté et borné par une taille d'échantillon que nous avons nommée. Le pilote vision-QC était petit ; la référence de 300 images est plus grande mais reste un jeu de données un jour donné ; les chiffres de raisonnement et de code sont précoces. Nous préférons vous livrer cette texture plutôt qu'une histoire lisse, car l'histoire lisse ne survit généralement pas au run suivant.

Claude Fable 5 est disponible via la passerelle et le catalogue Tokonomix. Vous pouvez le confronter à vos propres images sur notre benchmark vision-QC ou le suivre sur diverses tâches dans le classement.

Dernier test automatisé
25 juil. 2026 · 02:02 UTC · Benchmark de vitesse
Latence P50
2990 ms
Latence P95
3377 ms
Erreurs
0 / 6 exécutions
Dernière revue par Équipe Tokonomix·10 juin 2026