Aller au contenu
Tier A — Frontier
Fonctionne en :USCréé en :United States

Date de retrait

Le fournisseur indique le 24 juillet 2027 comme date de retrait provisoire. Le modèle reste disponible normalement pour l’instant.

Anthropic

Claude Opus 5

Tier A — Frontier · 1M tokens

Équipe éditoriale Tokonomix·Relu par Mes Kalkan··
Section 01

Analyse de vitesse

Latence mesurée sur toutes les exécutions de benchmark. P50 (médiane) et P95 (95e percentile) donnent une image réaliste de la vitesse de réponse en charge normale et de pointe.

Latence P50 (médiane)Latence P95100 runs
97141197267104141356208-2109-14ms
Section 02

Scores de qualité

Comment ce modèle se situe par rapport au reste du champ sur chaque catégorie de prompts, à partir d'un ajustement par paires sur les mêmes prompts. La note brute du juge figure sous chaque nombre.

31%
Génération de code
moyenne du juge 69
86%
Créatif
moyenne du juge 92
53%
Factuel
moyenne du juge 86
41%
Multilingue
moyenne du juge 88
55%
Raisonnement
moyenne du juge 88

Taux de victoire par catégorie : la fréquence à laquelle ce modèle bat un modèle moyen sur un prompt de cette catégorie. 50% est la moyenne, pas un échec. Ce n'est pas un pourcentage de bonnes réponses.

Section 03

Tarifs

Ce que vous payez par million de tokens en utilisant ce modèle sur Tokonomix, avec une estimation pour une conversation type.

💰
Tarifs API — Claude Opus 5
$6.50 par 1M de tokens d'entrée
$32.50 par 1M de tokens de sortie
≈ $0.0104 par conversation typique (800 tokens)
Prix entrée vs sortie (par 1M de tokens)
par 1M de tokens d'entrée$6.50
par 1M de tokens de sortie$32.50
Section 04

Tokens par seconde

Débit en tokens par seconde, dérivé de la latence P50 mesurée. Plus haut est mieux ; les fluctuations reflètent la charge côté fournisseur.

Débit (tokens / s)107 / avg 133
20419

Estimé à partir de la latence P50 × 200 tokens de sortie — le chiffre absolu dépend de cette hypothèse ; c'est la tendance qui compte.

Section 05

Capacités

toolssource: manualvisionjson modepdf inputreasoningjson schemaprompt cachingmax output tokens: 128000
Section 06

Disponibilité

Disponibilité

La fréquence à laquelle ce modèle répond lorsqu'on l'appelle — mesurée sur de vraies requêtes API et des tests en direct au cours des 30 derniers jours. C'est indépendant de la qualité : ces chiffres indiquent seulement si le modèle répond, pas la qualité de sa réponse.

7 derniers jours

88.6%

n=44

30 derniers jours

91.7%

n=72

Temps de réponse médian

25,106ms

n=66

Basé sur 457 mesures au cours des 30 derniers jours.

Détails techniques

Seuls les vrais appels API et les requêtes de test en direct sont comptés — les sondes internes et les benchmarks sont exclus.

Les appels avec une clé API personnalisée (BYOK) sont exclus : ces échecs sont spécifiques à la clé, pas un signe de défaillance du modèle.

Les appels échoués ne sont PAS inclus dans les scores de qualité — la qualité est mesurée uniquement sur les réponses réussies. Disponibilité et qualité sont des signaux indépendants.

Temps de réponse médian (p50) sur les appels réussis avec une durée enregistrée. Les valeurs extrêmes influencent moins la médiane que la moyenne.

Total des appels (30d)

72

Réponses OK (30d)

66

Total des appels (7d)

44

Réponses OK (7d)

39

Section 07

Verdicts benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-583/100 · 38 runs
29 correct4 partial5 wrong76% accuracy
2026-09-13

Claude Opus 5 shows quality decline, particularly in coding performance

Claude Opus 5's overall quality score has dropped to 85.3 from 92.0 in the previous benchmark window, representing a 6.7 point decline. The most significant regression appears in coding performance, which fell from 92 to 64, a substantial 28-point decrease that suggests potential issues with code generation or analysis capabilities. Factual accuracy remains a bright spot, achieving a perfect 100 score, while reasoning performance stayed strong at 92. The model's latency has increased slightly from 8541ms to 9811ms at the median, representing about 15% slower response times. The current benchmark window includes fewer test runs (4 versus 5), though this should not materially affect score validity. The previous window included creative and multilingual category testing, which were not evaluated in the current window, making direct comparison limited to the available categories. Users relying on Claude Opus 5 for coding tasks should exercise additional caution and validation, while those focused on factual retrieval and reasoning can expect continued strong performance. The quality decline warrants monitoring in subsequent benchmark windows to determine if this represents a temporary anomaly or a sustained trend.

Qualité

85.3

Latence p50

9,811 ms

Exécutions de test

4

Coding score dropped 28 points Overall quality down 6.7 points Latency increased 15 percent Factual accuracy remains perfect
Section 08

Profil complet du modèle

Claude Opus 5 — analyse détaillée

Claude Opus 5 est le nouveau modèle phare de la gamme Opus d'Anthropic, publié le 24 juillet 2026 en successeur d'Opus 4.8. Anthropic le positionne "pour le codage agentique complexe et le travail en entreprise", et il est désormais le modèle par défaut de Claude Code. Il est disponible via l'API Claude (claude-opus-5), Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry et Claude Platform on AWS.

Prix et fenêtre de contexte

Selon Anthropic, "Opus 5 égale une grande partie des capacités de Fable 5 pour la moitié du prix" — une affirmation d'Anthropic elle-même, non vérifiée de façon indépendante. La fenêtre de contexte atteint 1 000 000 de tokens, avec une sortie maximale de 128k tokens par appel synchrone — suffisant pour englober de grandes bases de code en un seul contexte.

Adaptive thinking et couverture des données

Plutôt que le paramètre manuel budget_tokens de l'ancien mécanisme de réflexion étendue, Opus 5 utilise l'adaptive thinking, piloté par un paramètre effort à cinq niveaux : low, medium, high, xhigh et max (par défaut : high). Les données d'entraînement couvrent de façon fiable jusqu'à mai 2026 — selon Anthropic, la coupure la plus récente de tous les modèles Claude actuellement disponibles.

Autonomie sur la durée et jugement

L'argument principal d'Anthropic pour Opus 5 porte sur la persévérance dans les tâches longues et non supervisées : travailler seul pendant des heures, se remettre de ses propres erreurs, contourner les blocages plutôt que de s'arrêter, et vérifier périodiquement son propre travail. Anthropic appuie cela avec ses propres chiffres : 43,3% sur Frontier-Bench v0.1 (contre 18,7% pour Opus 4.8) et 68,8% sur DeepSWE v1.1 (contre 59,0% pour Opus 4.8) — des résultats publiés par Anthropic elle-même, non reproduits indépendamment par Tokonomix. Anthropic met aussi en avant un meilleur jugement : le modèle pose plus souvent une question de clarification avant de deviner face à une instruction ambiguë, s'oppose plus volontiers à une consigne défaillante plutôt que de l'exécuter au pied de la lettre, et réfléchit davantage aux implications d'un changement avant de l'implémenter — sans mesure quantitative publiée pour ce dernier point.

Quand choisir Opus 5

Anthropic positionne Opus 5 comme le nouveau choix par défaut pour le codage agentique complexe et le travail en entreprise, et comme l'alternative moins chère à Fable 5 avec des capacités comparables sur de nombreux points. Pour des tâches plus simples — chats courts, classification, extraction légère — un modèle plus petit et moins cher reste généralement le choix le plus rentable.

Disponibilité sur Tokonomix

Claude Opus 5 est référencé sur Tokonomix sous le slug claude-opus-5, tier A, hébergé aux États-Unis via Anthropic direct. Les scores de benchmark indépendants issus des propres testeurs de Tokonomix ne sont pas encore disponibles pour ce modèle — ils apparaîtront automatiquement sur cette page dès que Claude Opus 5 sera intégré au prochain cycle de test.

Dernier test automatisé
14 sept. 2026 · 20:02 UTC · Benchmark de vitesse
Latence P50
1862 ms
Latence P95
2597 ms
Erreurs
0 / 6 exécutions
Dernière revue par Équipe Tokonomix·15 septembre 2026