Aller au contenu
Tier A — Frontier
Fonctionne en :USCréé en :United States

Date de retrait

Le fournisseur indique le 30 juin 2027 comme date de retrait provisoire. Le modèle reste disponible normalement pour l’instant.

Anthropic

Claude Sonnet 5

Tier A — Frontier · 1M tokens

Équipe éditoriale Tokonomix·Relu par Mes Kalkan·
Section 01

Analyse de vitesse

Latence mesurée sur toutes les exécutions de benchmark. P50 (médiane) et P95 (95e percentile) donnent une image réaliste de la vitesse de réponse en charge normale et de pointe.

Latence P50 (médiane)Latence P95100 runs
8483324580082751075108-2109-14ms
Section 02

Scores de qualité

Comment ce modèle se situe par rapport au reste du champ sur chaque catégorie de prompts, à partir d'un ajustement par paires sur les mêmes prompts. La note brute du juge figure sous chaque nombre.

54%
Génération de code
moyenne du juge 93
89%
Créatif
moyenne du juge 92
53%
Factuel
moyenne du juge 73
65%
Multilingue
moyenne du juge 98
59%
Raisonnement
moyenne du juge 75

Taux de victoire par catégorie : la fréquence à laquelle ce modèle bat un modèle moyen sur un prompt de cette catégorie. 50% est la moyenne, pas un échec. Ce n'est pas un pourcentage de bonnes réponses.

Section 03

Tarifs

Ce que vous payez par million de tokens en utilisant ce modèle sur Tokonomix, avec une estimation pour une conversation type.

💰
Tarifs API — Claude Sonnet 5
$2.60 par 1M de tokens d'entrée
$13.00 par 1M de tokens de sortie
≈ $0.0042 par conversation typique (800 tokens)
Prix entrée vs sortie (par 1M de tokens)
par 1M de tokens d'entrée$2.60
par 1M de tokens de sortie$13.00
Section 04

Tokens par seconde

Débit en tokens par seconde, dérivé de la latence P50 mesurée. Plus haut est mieux ; les fluctuations reflètent la charge côté fournisseur.

Débit (tokens / s)187 / avg 160
23427

Estimé à partir de la latence P50 × 200 tokens de sortie — le chiffre absolu dépend de cette hypothèse ; c'est la tendance qui compte.

Section 05

Capacités

toolssource: manualvisionjson modepdf inputreasoningjson schemaprompt cachingmax output tokens: 128000
Section 06

Disponibilité

Disponibilité

La fréquence à laquelle ce modèle répond lorsqu'on l'appelle — mesurée sur de vraies requêtes API et des tests en direct au cours des 30 derniers jours. C'est indépendant de la qualité : ces chiffres indiquent seulement si le modèle répond, pas la qualité de sa réponse.

7 derniers jours

100.0%

n=13

30 derniers jours

100.0%

n=13

Temps de réponse médian

30,020ms

n=13

Basé sur 398 mesures au cours des 30 derniers jours.

Détails techniques

Seuls les vrais appels API et les requêtes de test en direct sont comptés — les sondes internes et les benchmarks sont exclus.

Les appels avec une clé API personnalisée (BYOK) sont exclus : ces échecs sont spécifiques à la clé, pas un signe de défaillance du modèle.

Les appels échoués ne sont PAS inclus dans les scores de qualité — la qualité est mesurée uniquement sur les réponses réussies. Disponibilité et qualité sont des signaux indépendants.

Temps de réponse médian (p50) sur les appels réussis avec une durée enregistrée. Les valeurs extrêmes influencent moins la médiane que la moyenne.

Total des appels (30d)

13

Réponses OK (30d)

13

Total des appels (7d)

13

Réponses OK (7d)

13

Section 07

Verdicts benchmark Tokonomix

⚖️
Endorsed by 1 judge
Independent LLM judges evaluated this model on our weekly intelligence tests
claude-sonnet-4-587/100 · 30 runs
26 correct1 partial3 wrong87% accuracy
2026-09-13

Claude Sonnet 5 quality drops 16 points with slower response times

Claude Sonnet 5 experienced a significant performance regression in this benchmark window. Overall quality declined from 93.2 to 77.3, representing a 15.9 point drop that affects most capabilities. The model maintained exceptional reasoning performance at a perfect 100 score, but coding ability decreased substantially from 95 to 81. Most concerning is the factual accuracy category, which scored just 52 compared to previous strong performance. Response latency also degraded, with the median increasing from 4.8 to 6.5 seconds, a 36% slowdown that will be noticeable to users. The benchmark categories shifted between windows, making direct comparison challenging for creative and multilingual tasks which were not retested. This change pattern suggests either a model update that traded accuracy for other characteristics, infrastructure issues affecting performance, or possible variations in test composition. Users relying on factual accuracy should exercise additional caution, while those prioritizing reasoning tasks may see less impact. The latency increase affects all use cases and may require timeout adjustments in production environments.

Qualité

77.3

Latence p50

6,457 ms

Exécutions de test

5

Quality dropped 16 points Factual accuracy scored only 52 Response time increased 36% Reasoning remains perfect at 100
Section 08

Profil complet du modèle

Claude Sonnet 5 : le Claude milieu de gamme conçu pour agir, pas seulement répondre

Claude Sonnet 5 est le modèle milieu de gamme d'Anthropic, sorti le 30 juin 2026 en tant que successeur de Sonnet 4.6. Anthropic le présente comme le Sonnet le plus agentique que l'entreprise ait livré : un modèle conçu pour planifier une tâche, utiliser des outils comme un navigateur ou un terminal, et faire avancer une tâche à plusieurs étapes avec moins de supervision pas à pas que les générations Sonnet précédentes n'en nécessitaient. Le positionnement propre d'Anthropic est que Sonnet 5 comble une grande partie de l'écart avec la gamme phare Opus, tout en restant dans la catégorie Sonnet.

Là où il excelle

Le modèle est conçu autour d'un usage soutenu des outils plutôt que d'un chat en un seul échange. Il prend en charge l'appel de fonctions, la sortie JSON structurée conforme à un schéma, l'entrée PDF et la vision, et il expose un mode de raisonnement lui permettant de travailler un problème avant de répondre. Cette combinaison convient bien aux workflows agentiques : une tâche qui nécessite de lire un document, d'appeler un outil, de vérifier le résultat et de décider de la suite correspond exactement à la forme visée par cette version, selon Anthropic. Anthropic rapporte 78,5 % sur OSWorld-Verified, son benchmark d'usage d'ordinateur, et 46,8 % sur Humanity's Last Exam lorsque le modèle est autorisé à utiliser des outils — ce sont là des chiffres publiés par Anthropic lui-même, non des résultats reproduits de façon indépendante ; ils décrivent donc le récit du fournisseur sur la progression du modèle plutôt qu'un résultat tiers neutre.

Sous le capot

Sonnet 5 dispose d'une fenêtre de contexte de 1 000 000 de tokens, avec une sortie synchrone maximale de 128 000 tokens par réponse. La sortie est uniquement textuelle — cette génération de Sonnet ne génère ni images ni audio. La mise en cache des prompts est prise en charge, ce qui compte pour les boucles agentiques qui renvoient un contexte volumineux et largement inchangé (une base de code, un long document, un schéma d'outil) à travers de nombreux tours d'une même session.

Là où il montre ses limites

L'annonce propre d'Anthropic pour cette version ne précise pas de date de coupure des connaissances ; quiconque s'appuie sur le modèle pour des événements très récents ou des bibliothèques nouvellement publiées devrait donc vérifier plutôt que supposer l'actualité des données. Les points forts du modèle se concentrent sur le travail à plusieurs étapes utilisant des outils ; pour des questions courtes en un seul tour ou une classification simple, la mécanique agentique est plus un coût qu'un bénéfice, et un modèle plus léger de la même gamme répondra généralement tout aussi bien. Les affirmations de benchmark propres à Anthropic, venant du fournisseur qui teste son propre modèle, méritent elles aussi d'être considérées comme indicatives plutôt qu'établies — l'ampleur de l'amélioration par rapport à Sonnet 4.6 reste la caractérisation d'Anthropic tant qu'elle n'a pas été vérifiée sur des charges de travail indépendantes.

Quand le choisir

Sonnet 5 convient aux agents de codage, aux agents de recherche, et à tout workflow où le modèle doit continuer à travailler à travers plusieurs appels d'outils sans qu'un humain ne le relance à chaque étape — déboguer une suite de tests défaillante, mener un refactoring multi-fichiers, ou exécuter de bout en bout une tâche de navigation et de synthèse. Il convient aussi aux workloads qui ont besoin d'une fenêtre de contexte véritablement large en plus de l'usage d'outils, comme la revue d'une grande base de code ou d'un long ensemble de documents en une seule session.

Pour un travail qui n'a pas besoin de cette autonomie — génération courte, extraction simple, classification en un seul appel — la mécanique agentique n'apporte rien d'utile, et un modèle plus petit et plus rapide sera généralement le choix par défaut le plus sensé.

Alternatives à comparer

Au sein de la propre gamme d'Anthropic, Claude Opus 5 se situe au-dessus de Sonnet 5 comme modèle phare pour le travail agentique et professionnel le plus complexe, et Claude Fable 5 se situe encore au-dessus comme le modèle le plus capable qu'Anthropic ait largement diffusé — les deux sont des options si un workload se révèle avoir besoin de plus de marge que ce que Sonnet 5 offre. Le positionnement propre d'Anthropic présente Sonnet 5 comme approchant les performances de classe Opus sur de nombreuses tâches, ce qui justifie de commencer par lui avant de se tourner vers un modèle plus grand, et de ne monter en gamme que si le workload démontre spécifiquement qu'il en a besoin.

Notes de déploiement

Comme Sonnet 5 est conçu autour de sessions longues et riches en outils, les intégrations doivent s'attendre à des boucles d'appels d'outils sur plusieurs tours et les gérer, plutôt qu'un simple échange requête/réponse — les délais d'expiration, la logique de nouvelle tentative et le formatage des résultats d'outils doivent tous tenir compte d'une tâche pouvant nécessiter plusieurs cycles pour aboutir. Le plafond de sortie de 128 000 tokens est généreux mais fini ; un workflow qui s'attend à ce qu'un seul appel renvoie un artefact généré volumineux dans son intégralité doit vérifier qu'il tient sous ce plafond avant de s'y fier en production.

Dernier test automatisé
14 sept. 2026 · 20:02 UTC · Benchmark de vitesse
Latence P50
1067 ms
Latence P95
1416 ms
Erreurs
0 / 6 exécutions
Dernière revue par Équipe Tokonomix·14 septembre 2026