Le Claude Fable 5 d'Anthropic est un modèle vision-et-raisonnement, et la variante sur laquelle nous nous appuyons le plus — claude-fable-5[1m] — dispose d'une fenêtre de contexte d'un million de tokens. Nous n'allons pas réciter une fiche technique. Ce que nous offrons à la place, c'est ce que la plupart des articles n'ont pas : des chiffres issus de nos propres mesures, avec les dates et les tailles d'échantillon, et une note honnête là où les preuves se font minces.
Pourquoi il est devenu notre proposeur vision par défaut
Le 9 juin 2026, nous avons mené un pilote de contrôle qualité d'images — un ensemble d'images, chacune avec un défaut de qualité média connu à détecter, soumis à plusieurs modèles vision pour comparer leur comportement. Fable 5 s'est distingué par une qualité qui compte plus que l'intelligence brute : la stabilité.
Sur des passages répétés du jeu pilote, il était identique à 88% d'un passage à l'autre, avec un taux de revirement de 3,9% — il changeait donc rarement d'avis sur une même image. Sur ce jeu, il a produit zéro faux positif : pas de défauts inventés. Il a aussi détecté des angles morts que d'autres modèles du panel ont manqués.
La stabilité est exactement ce que l'on attend d'un proposeur. Un modèle qui signale un vrai défaut aujourd'hui et ignore la même image demain est une mauvaise base de processus. Un modèle qui répond toujours pareil — sans crier au loup — peut être placé en tête d'un pipeline. C'est ce que nous avons fait : Fable 5 est le proposeur vision par défaut de notre panel de consensus visuel. (Une décision produit délibérée, prise sur la foi du pilote.) Il n'est pas dans nos pools de juges de texte — son rôle ici est de regarder des images, pas de noter du texte.
La référence du jour : 300 images, mesurées en direct
Un pilote, c'est petit. Nous avons donc fait passer au modèle un run plus grand et nous en publions le résultat, en direct, sur notre benchmark vision-QC.
Le 10 juin 2026, face au jeu de données mediaqc-v3-2026-06-10 de 300 images, Fable 5 en solo a obtenu :
- 66,9% de rappel — la part de défauts réels détectés. C'était le meilleur résultat individuel du run (à égalité).
- 7,1% de taux de fausses alertes — la fréquence à laquelle il signalait une image propre. Un autre modèle vision solide, sur le même run, était plus de deux fois au-dessus — précisément la différence qui décide si une étape de QC fait gagner ou perdre du temps.
- 60,3% de catégorie correcte — cas où il a non seulement détecté le défaut mais nommé la bonne catégorie.
Deux tiers de rappel en solo, c'est utile mais pas une histoire achevée — d'où l'intérêt d'un panel plutôt que d'un seul modèle. Avec Fable 5 dans le panel de consensus, le rappel est monté à 87,5%. La stabilité du proposeur donne au conseil une base fiable ; le conseil comble l'écart qu'un seul modèle laisse ouvert.
Raisonnement et code : un signal précoce et honnête
C'est sur la vision que nous avons le plus de preuves. Sur la capacité générale, moins — et nous le disons franchement.
Lors d'une évaluation interne le 9 juin 2026 — un harnais de 682 tests que nous passons sur plusieurs modèles — les résultats de Fable 5 se sont nettement détachés : il a obtenu 91% et 73% sur les deux moitiés du harnais, là où les modèles de comparaison obtenaient 3% et 0% sur les mêmes tâches. Un grand écart, que nous traitons comme un signal fort et non comme un verdict définitif, car un seul harnais peut flatter ou pénaliser un modèle.
Notre premier run d'intelligence sur la plateforme, aujourd'hui, a renvoyé un score de raisonnement de 100 et un score de code de 97. Préliminaires — un seul run, n=1. Nous les rapportons parce que cacher des chiffres précoces est aussi une forme de malhonnêteté, mais un run reste un run. Suivez le classement à mesure que l'échantillon grandit.
À quoi sert la variante contexte 1M
La variante claude-fable-5[1m] existe pour les cas où le goulot d'étranglement est le contexte, pas le raisonnement. Une fenêtre aussi large permet de tenir devant le modèle un long ensemble de documents, un large corpus de référence ou une interaction prolongée, plutôt que de découper en espérant ne rien perdre d'important. Couplée à la vision, elle convient au travail où le modèle doit raisonner sur beaucoup de matière et regarder les images qui y sont intégrées — longs rapports, jeux de documents avec figures, captures d'écran en contexte.
Comment lire ces chiffres
Tout ce qui précède est mesuré, daté et borné par une taille d'échantillon que nous avons nommée. Le pilote vision-QC était petit ; la référence de 300 images est plus grande mais reste un jeu de données un jour donné ; les chiffres de raisonnement et de code sont précoces. Nous préférons vous livrer cette texture plutôt qu'une histoire lisse, car l'histoire lisse ne survit généralement pas au run suivant.
Claude Fable 5 est disponible via la passerelle et le catalogue Tokonomix. Vous pouvez le confronter à vos propres images sur notre benchmark vision-QC ou le suivre sur diverses tâches dans le classement.