Aller au contenu
Tier A — Frontier
Fonctionne en :USCréé en :United States

Date de retrait

Le fournisseur indique le 28 mai 2027 comme date de retrait provisoire. Le modèle reste disponible normalement pour l’instant.

Anthropic

Claude Opus 4.8

Tier A — Frontier · 1M tokens

Équipe éditoriale Tokonomix·Relu par Mes Kalkan··

Opus 4.8 marque une étape concrète dans la fiabilité des agents autonomes : moins d'erreurs de code laissées passer, des exécutions plus longues sans dérive, et un contexte d'un million de tokens qui change la portée des tâches traitables en une seule passe. C'est le modèle phare d'Anthropic au 28 mai 2026, conçu pour les équipes qui confient à l'IA des missions complexes et de longue durée.

Analyse modèle Tokonomix
Section 01

Analyse de vitesse

Latence mesurée sur toutes les exécutions de benchmark. P50 (médiane) et P95 (95e percentile) donnent une image réaliste de la vitesse de réponse en charge normale et de pointe.

Latence P50 (médiane)Latence P95100 runs
702138320652746342708-2109-14ms
Section 02

Scores de qualité

Comment ce modèle se situe par rapport au reste du champ sur chaque catégorie de prompts, à partir d'un ajustement par paires sur les mêmes prompts. La note brute du juge figure sous chaque nombre.

48%
Génération de code
moyenne du juge 94
44%
Créatif
moyenne du juge 87
72%
Factuel
moyenne du juge 88
58%
Multilingue
moyenne du juge 98
67%
Raisonnement
moyenne du juge 99

Taux de victoire par catégorie : la fréquence à laquelle ce modèle bat un modèle moyen sur un prompt de cette catégorie. 50% est la moyenne, pas un échec. Ce n'est pas un pourcentage de bonnes réponses.

Section 03

Tarifs

Ce que vous payez par million de tokens en utilisant ce modèle sur Tokonomix, avec une estimation pour une conversation type.

💰
Tarifs API — Claude Opus 4.8
$6.50 par 1M de tokens d'entrée
$32.50 par 1M de tokens de sortie
≈ $0.0104 par conversation typique (800 tokens)
Prix entrée vs sortie (par 1M de tokens)
par 1M de tokens d'entrée$6.50
par 1M de tokens de sortie$32.50
Section 04

Tokens par seconde

Débit en tokens par seconde, dérivé de la latence P50 mesurée. Plus haut est mieux ; les fluctuations reflètent la charge côté fournisseur.

Débit (tokens / s)203 / avg 185
28373

Estimé à partir de la latence P50 × 200 tokens de sortie — le chiffre absolu dépend de cette hypothèse ; c'est la tendance qui compte.

Section 05

Forces & faiblesses

Basé sur les résultats de benchmarks et les retours communautaires agrégés sur des cas d'usage réels.

Forces

4× moins de défauts de code manquésJugement plus net sur sa propre progressionExécutions autonomes plus longues et stablesContexte de 1 000 000 tokensAdaptive thinking intégréVision et analyse d'images nativesTool-use robuste pour agents complexes

Faiblesses

Coût élevé vs Sonnet 4.6 ou Haiku 4.5Latence supérieure aux modèles plus légersCutoff de connaissance : mai 2026Pas de mode extended thinking disponible
Section 06

Capacités

toolssource: litellmvisionjson modepdf inputreasoningjson schemaprompt cachingmax output tokens: 128000
Section 07

Questions fréquentes

Pour les revues de code critiques ou les pipelines d'agents autonomes, oui : la réduction d'environ 4× des défauts non détectés peut éviter des incidents coûteux. Pour de la complétion de code rapide ou des tâches répétitives à faible enjeu, Sonnet 4.6 offre un meilleur rapport performance/coût.

Opus 4.8 est le bon choix pour les flux de travail autonomes exigeants où la qualité du code et la durée d'exécution comptent davantage que la vitesse brute ou le coût par token. Pour les tâches courtes et répétitives, Sonnet 4.6 ou Haiku 4.5 restent plus économiques.

Rédaction Tokonomix
Section 08

Disponibilité

Disponibilité

La fréquence à laquelle ce modèle répond lorsqu'on l'appelle — mesurée sur de vraies requêtes API et des tests en direct au cours des 30 derniers jours. C'est indépendant de la qualité : ces chiffres indiquent seulement si le modèle répond, pas la qualité de sa réponse.

7 derniers jours

100.0%

n=53

30 derniers jours

100.0%

n=56

Temps de réponse médian

8,130ms

n=56

Basé sur 441 mesures au cours des 30 derniers jours.

Détails techniques

Seuls les vrais appels API et les requêtes de test en direct sont comptés — les sondes internes et les benchmarks sont exclus.

Les appels avec une clé API personnalisée (BYOK) sont exclus : ces échecs sont spécifiques à la clé, pas un signe de défaillance du modèle.

Les appels échoués ne sont PAS inclus dans les scores de qualité — la qualité est mesurée uniquement sur les réponses réussies. Disponibilité et qualité sont des signaux indépendants.

Temps de réponse médian (p50) sur les appels réussis avec une durée enregistrée. Les valeurs extrêmes influencent moins la médiane que la moyenne.

Total des appels (30d)

56

Réponses OK (30d)

56

Total des appels (7d)

53

Réponses OK (7d)

53

Section 09

Verdicts benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-594/100 · 80 runs
74 correct4 partial2 wrong93% accuracy
2026-09-13

Claude Opus 4.8 adds seven capabilities but lacks performance benchmarks

Claude Opus 4.8 introduces a significant expansion of capabilities without accompanying performance data. The model now supports seven new features: tools, vision, JSON mode, PDF input, reasoning, JSON schema, and prompt caching. These additions represent a substantial broadening of the model's functionality, particularly with the inclusion of multimodal capabilities through vision and PDF input, as well as structured output options via JSON mode and schema support. The reasoning capability suggests enhanced analytical features, while prompt caching could improve efficiency for repetitive tasks. However, no benchmark scores are available in the current window, making it impossible to assess the model's actual performance across standard evaluation metrics or compare it to previous versions or competitors. Users gain access to a more versatile model with expanded input and output formats, but without performance data, it remains unclear whether these new capabilities come with any trade-offs in speed, accuracy, or other quality metrics. The absence of benchmarks is notable given that this appears to be a major feature release.

Qualité

Latence p50

Exécutions de test

0

Seven new capabilities added Multimodal support via vision Structured output with JSON No benchmark data available
Section 10

Profil complet du modèle

Claude Opus 4.8 par Anthropic

Sorti le 28 mai 2026. Nouveau modèle phare. 4× moins susceptible de laisser passer des défauts de code par rapport à Opus 4.7. Même tarification, contexte 1M.

Dernier test automatisé
14 sept. 2026 · 20:02 UTC · Benchmark de vitesse
Latence P50
987 ms
Latence P95
1118 ms
Erreurs
0 / 6 exécutions
Dernière revue par Équipe Tokonomix·15 septembre 2026