Aller au contenu
Tier A — Frontier
Fonctionne en :USCréé en :United States

Date de retrait

Le fournisseur indique le 9 juin 2027 comme date de retrait provisoire. Le modèle reste disponible normalement pour l’instant.

Anthropic

Claude Fable 5

Tier A — Frontier · 1M tokens

Équipe éditoriale Tokonomix·Relu par Mes Kalkan·

Claude Fable 5 est le modèle vision-et-raisonnement d'Anthropic, avec une variante de contexte d'un million de tokens. Dans notre propre pilote de contrôle qualité d'images, c'était l'évaluateur le plus stable que nous ayons testé — nous en avons donc fait le proposeur vision par défaut de notre panel de consensus visuel. Voici ce que nous avons mesuré, et ce que nous n'avons pas mesuré.

Ce que nous attendions d'un proposeur vision n'était pas l'intelligence mais la stabilité — et sur notre jeu pilote, Fable 5 était le plus stable.

Pilote vision-QC Tokonomix, 9 juin 2026
Section 01

Analyse de vitesse

Latence mesurée sur toutes les exécutions de benchmark. P50 (médiane) et P95 (95e percentile) donnent une image réaliste de la vitesse de réponse en charge normale et de pointe.

Latence P50 (médiane)Latence P95100 runs
2251388555207154878808-2109-14ms
Section 02

Scores de qualité

Comment ce modèle se situe par rapport au reste du champ sur chaque catégorie de prompts, à partir d'un ajustement par paires sur les mêmes prompts. La note brute du juge figure sous chaque nombre.

64%
Génération de code
moyenne du juge 97
67%
Créatif
moyenne du juge 89
59%
Factuel
moyenne du juge 67
65%
Multilingue
moyenne du juge 99
69%
Raisonnement
moyenne du juge 98

Taux de victoire par catégorie : la fréquence à laquelle ce modèle bat un modèle moyen sur un prompt de cette catégorie. 50% est la moyenne, pas un échec. Ce n'est pas un pourcentage de bonnes réponses.

Section 03

Tarifs

Ce que vous payez par million de tokens en utilisant ce modèle sur Tokonomix, avec une estimation pour une conversation type.

💰
Tarifs API — Claude Fable 5
$13.00 par 1M de tokens d'entrée
$65.00 par 1M de tokens de sortie
≈ $0.0208 par conversation typique (800 tokens)
Prix entrée vs sortie (par 1M de tokens)
par 1M de tokens d'entrée$13.00
par 1M de tokens de sortie$65.00
Section 04

Tokens par seconde

Débit en tokens par seconde, dérivé de la latence P50 mesurée. Plus haut est mieux ; les fluctuations reflètent la charge côté fournisseur.

Débit (tokens / s)69 / avg 60
8832

Estimé à partir de la latence P50 × 200 tokens de sortie — le chiffre absolu dépend de cette hypothèse ; c'est la tendance qui compte.

Section 05

Forces & faiblesses

Basé sur les résultats de benchmarks et les retours communautaires agrégés sur des cas d'usage réels.

Forces

Proposeur vision le plus stable du pilote (88% identique)Faible taux de fausses alertes (7,1% sur la base de 300 images)A détecté des angles morts manqués par d'autres modèlesVariante contexte 1M pour contenus longs et riches en images

Faiblesses

Rappel solo 66,9% — un panel est nécessaire pour 87,5%Chiffres raisonnement/code précoces (un seul run, n=1)
Section 06

Capacités

toolssource: manualvisionjson modepdf inputreasoningjson schemamodel class: mythosprompt cachingmax output tokens: 128000
Section 07

Questions fréquentes

Sur notre pilote du 9 juin 2026, il était identique à 88%, ne changeait d'avis que dans 3,9% des cas et produisait zéro faux positif — la stabilité voulue en tête d'un pipeline de QC. Une décision produit délibérée fondée sur ce pilote.

Nous préférons vous livrer la texture — petit pilote, référence d’un jour, chiffres de raisonnement précoces — plutôt qu’une histoire lisse qui ne survit pas au run suivant.

Rédaction Tokonomix
Section 08

Disponibilité

Disponibilité

La fréquence à laquelle ce modèle répond lorsqu'on l'appelle — mesurée sur de vraies requêtes API et des tests en direct au cours des 30 derniers jours. C'est indépendant de la qualité : ces chiffres indiquent seulement si le modèle répond, pas la qualité de sa réponse.

7 derniers jours

62.5%

n=48

30 derniers jours

70.5%

n=61

Temps de réponse médian

16,774ms

n=43

Basé sur 448 mesures au cours des 30 derniers jours.

Détails techniques

Seuls les vrais appels API et les requêtes de test en direct sont comptés — les sondes internes et les benchmarks sont exclus.

Les appels avec une clé API personnalisée (BYOK) sont exclus : ces échecs sont spécifiques à la clé, pas un signe de défaillance du modèle.

Les appels échoués ne sont PAS inclus dans les scores de qualité — la qualité est mesurée uniquement sur les réponses réussies. Disponibilité et qualité sont des signaux indépendants.

Temps de réponse médian (p50) sur les appels réussis avec une durée enregistrée. Les valeurs extrêmes influencent moins la médiane que la moyenne.

Total des appels (30d)

61

Réponses OK (30d)

43

Total des appels (7d)

48

Réponses OK (7d)

30

Pilote contrôle qualité image (2026-06-10)

Rappel

66.9%

n=300

Faux positifs

7.1%

n=300

Section 09

Verdicts benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 2 runs
2 correct0 partial0 wrong100% accuracy
claude-sonnet-4-589/100 · 65 runs
55 correct4 partial6 wrong85% accuracy
2026-09-13

Claude Fable 5 shows reasoning gains but latency degrades 20%

Claude Fable 5 demonstrates a modest overall quality improvement, rising from 86.9 to 88.0 across the benchmark window. The most significant development is perfect reasoning performance at 100, showing strong capabilities in logical tasks and problem-solving scenarios. Coding performance remains exceptionally stable, improving only marginally from 95 to 96, indicating consistent strength in programming tasks. However, the model faces a notable performance tradeoff. Latency has increased substantially from 7361ms to 8825ms at the median, representing a 20% slowdown in response times. This degradation may impact user experience in time-sensitive applications despite the quality improvements. Category coverage has shifted between windows, with factual question performance now measured at 68, suggesting room for improvement in knowledge retrieval tasks. Previous strengths in creative writing (66) and multilingual capabilities (100) are not reflected in current testing, making direct comparison difficult. The overall quality gain of 1.1 points suggests incremental refinement rather than transformative changes. Users should weigh the reasoning improvements against increased wait times when evaluating this model for production deployment.

Qualité

88.0

Latence p50

8,825 ms

Exécutions de test

5

Perfect reasoning score achieved Coding remains exceptionally strong Latency increased 20% Factual performance needs improvement
Section 10

Profil complet du modèle

Claude Fable 5 : l'évaluateur le plus stable que nous ayons testé

Le Claude Fable 5 d'Anthropic est un modèle vision-et-raisonnement, et la variante sur laquelle nous nous appuyons le plus — claude-fable-5[1m] — dispose d'une fenêtre de contexte d'un million de tokens. Nous n'allons pas réciter une fiche technique. Ce que nous offrons à la place, c'est ce que la plupart des articles n'ont pas : des chiffres issus de nos propres mesures, avec les dates et les tailles d'échantillon, et une note honnête là où les preuves se font minces.

Pourquoi il est devenu notre proposeur vision par défaut

Le 9 juin 2026, nous avons mené un pilote de contrôle qualité d'images — un ensemble d'images, chacune avec un défaut de qualité média connu à détecter, soumis à plusieurs modèles vision pour comparer leur comportement. Fable 5 s'est distingué par une qualité qui compte plus que l'intelligence brute : la stabilité.

Sur des passages répétés du jeu pilote, il était identique à 88% d'un passage à l'autre, avec un taux de revirement de 3,9% — il changeait donc rarement d'avis sur une même image. Sur ce jeu, il a produit zéro faux positif : pas de défauts inventés. Il a aussi détecté des angles morts que d'autres modèles du panel ont manqués.

La stabilité est exactement ce que l'on attend d'un proposeur. Un modèle qui signale un vrai défaut aujourd'hui et ignore la même image demain est une mauvaise base de processus. Un modèle qui répond toujours pareil — sans crier au loup — peut être placé en tête d'un pipeline. C'est ce que nous avons fait : Fable 5 est le proposeur vision par défaut de notre panel de consensus visuel. (Une décision produit délibérée, prise sur la foi du pilote.) Il n'est pas dans nos pools de juges de texte — son rôle ici est de regarder des images, pas de noter du texte.

La référence du jour : 300 images, mesurées en direct

Un pilote, c'est petit. Nous avons donc fait passer au modèle un run plus grand et nous en publions le résultat, en direct, sur notre benchmark vision-QC.

Le 10 juin 2026, face au jeu de données mediaqc-v3-2026-06-10 de 300 images, Fable 5 en solo a obtenu :

  • 66,9% de rappel — la part de défauts réels détectés. C'était le meilleur résultat individuel du run (à égalité).
  • 7,1% de taux de fausses alertes — la fréquence à laquelle il signalait une image propre. Un autre modèle vision solide, sur le même run, était plus de deux fois au-dessus — précisément la différence qui décide si une étape de QC fait gagner ou perdre du temps.
  • 60,3% de catégorie correcte — cas où il a non seulement détecté le défaut mais nommé la bonne catégorie.

Deux tiers de rappel en solo, c'est utile mais pas une histoire achevée — d'où l'intérêt d'un panel plutôt que d'un seul modèle. Avec Fable 5 dans le panel de consensus, le rappel est monté à 87,5%. La stabilité du proposeur donne au conseil une base fiable ; le conseil comble l'écart qu'un seul modèle laisse ouvert.

Raisonnement et code : un signal précoce et honnête

C'est sur la vision que nous avons le plus de preuves. Sur la capacité générale, moins — et nous le disons franchement.

Lors d'une évaluation interne le 9 juin 2026 — un harnais de 682 tests que nous passons sur plusieurs modèles — les résultats de Fable 5 se sont nettement détachés : il a obtenu 91% et 73% sur les deux moitiés du harnais, là où les modèles de comparaison obtenaient 3% et 0% sur les mêmes tâches. Un grand écart, que nous traitons comme un signal fort et non comme un verdict définitif, car un seul harnais peut flatter ou pénaliser un modèle.

Notre premier run d'intelligence sur la plateforme, aujourd'hui, a renvoyé un score de raisonnement de 100 et un score de code de 97. Préliminaires — un seul run, n=1. Nous les rapportons parce que cacher des chiffres précoces est aussi une forme de malhonnêteté, mais un run reste un run. Suivez le classement à mesure que l'échantillon grandit.

À quoi sert la variante contexte 1M

La variante claude-fable-5[1m] existe pour les cas où le goulot d'étranglement est le contexte, pas le raisonnement. Une fenêtre aussi large permet de tenir devant le modèle un long ensemble de documents, un large corpus de référence ou une interaction prolongée, plutôt que de découper en espérant ne rien perdre d'important. Couplée à la vision, elle convient au travail où le modèle doit raisonner sur beaucoup de matière et regarder les images qui y sont intégrées — longs rapports, jeux de documents avec figures, captures d'écran en contexte.

Comment lire ces chiffres

Tout ce qui précède est mesuré, daté et borné par une taille d'échantillon que nous avons nommée. Le pilote vision-QC était petit ; la référence de 300 images est plus grande mais reste un jeu de données un jour donné ; les chiffres de raisonnement et de code sont précoces. Nous préférons vous livrer cette texture plutôt qu'une histoire lisse, car l'histoire lisse ne survit généralement pas au run suivant.

Claude Fable 5 est disponible via la passerelle et le catalogue Tokonomix. Vous pouvez le confronter à vos propres images sur notre benchmark vision-QC ou le suivre sur diverses tâches dans le classement.

Dernier test automatisé
14 sept. 2026 · 20:02 UTC · Benchmark de vitesse
Latence P50
2913 ms
Latence P95
3228 ms
Erreurs
0 / 6 exécutions
Dernière revue par Équipe Tokonomix·10 juin 2026