Aller au contenu
Tier A — Frontier
Fonctionne en :USCréé en :United States

Archivé

Ce modèle a été retiré par le fournisseur. Les données historiques sont conservées.

Plus disponible depuis le 28 mai 2027.

Anthropic

Claude Opus 4.8

Tier A — Frontier · 1M tokens

Équipe éditoriale Tokonomix·Relu par Mes Kalkan·

Opus 4.8 marque une étape concrète dans la fiabilité des agents autonomes : moins d'erreurs de code laissées passer, des exécutions plus longues sans dérive, et un contexte d'un million de tokens qui change la portée des tâches traitables en une seule passe. C'est le modèle phare d'Anthropic au 28 mai 2026, conçu pour les équipes qui confient à l'IA des missions complexes et de longue durée.

Analyse modèle Tokonomix
Section 01

Analyse de vitesse

Latence mesurée sur toutes les exécutions de benchmark. P50 (médiane) et P95 (95e percentile) donnent une image réaliste de la vitesse de réponse en charge normale et de pointe.

Latence P50 (médiane)Latence P95102 runs
731168026283577452508-1609-10ms
Section 02

Scores de qualité

Comment ce modèle se situe par rapport au reste du champ sur chaque catégorie de prompts, à partir d'un ajustement par paires sur les mêmes prompts. La note brute du juge figure sous chaque nombre.

46%
Génération de code
moyenne du juge 94
44%
Créatif
moyenne du juge 87
70%
Factuel
moyenne du juge 92
58%
Multilingue
moyenne du juge 98
74%
Raisonnement
moyenne du juge 99

Taux de victoire par catégorie : la fréquence à laquelle ce modèle bat un modèle moyen sur un prompt de cette catégorie. 50% est la moyenne, pas un échec. Ce n'est pas un pourcentage de bonnes réponses.

Section 03

Historique des tarifs

Tarifs directs du fournisseur par million de tokens, plus une estimation du coût d'une conversation typique.

💰
Tarifs API — Claude Opus 4.8
$5.00 par 1M de tokens d'entrée
$25.00 par 1M de tokens de sortie
≈ $0.0080 par conversation typique (800 tokens)
Prix entrée vs sortie (par 1M de tokens)
par 1M de tokens d'entrée$5.00
par 1M de tokens de sortie$25.00

Pricing over time

Input & output per 1M tokens · step-line = price changes

$5.00

input / 1M

— stable

$25.00

output / 1M

— stable

2026-06-212026-08-022026-09-06
Input
Output
Price change
⟳ synced weekly
Section 04

Tokens par seconde

Débit en tokens par seconde, dérivé de la latence P50 mesurée. Plus haut est mieux ; les fluctuations reflètent la charge côté fournisseur.

Débit (tokens / s)170 / avg 179
27140

Estimé à partir de la latence P50 × 200 tokens de sortie — le chiffre absolu dépend de cette hypothèse ; c'est la tendance qui compte.

Section 05

Forces & faiblesses

Basé sur les résultats de benchmarks et les retours communautaires agrégés sur des cas d'usage réels.

Forces

4× moins de défauts de code manquésJugement plus net sur sa propre progressionExécutions autonomes plus longues et stablesContexte de 1 000 000 tokensAdaptive thinking intégréVision et analyse d'images nativesTool-use robuste pour agents complexes

Faiblesses

Coût élevé vs Sonnet 4.6 ou Haiku 4.5Latence supérieure aux modèles plus légersCutoff de connaissance : mai 2026Pas de mode extended thinking disponible
Section 06

Capacités

toolssource: litellmvisionjson modepdf inputreasoningjson schemaprompt cachingmax output tokens: 128000
Section 07

Questions fréquentes

Pour les revues de code critiques ou les pipelines d'agents autonomes, oui : la réduction d'environ 4× des défauts non détectés peut éviter des incidents coûteux. Pour de la complétion de code rapide ou des tâches répétitives à faible enjeu, Sonnet 4.6 offre un meilleur rapport performance/coût.

Opus 4.8 est le bon choix pour les flux de travail autonomes exigeants où la qualité du code et la durée d'exécution comptent davantage que la vitesse brute ou le coût par token. Pour les tâches courtes et répétitives, Sonnet 4.6 ou Haiku 4.5 restent plus économiques.

Rédaction Tokonomix
Section 08

Disponibilité

Disponibilité

La fréquence à laquelle ce modèle répond lorsqu'on l'appelle — mesurée sur de vraies requêtes API et des tests en direct au cours des 30 derniers jours. C'est indépendant de la qualité : ces chiffres indiquent seulement si le modèle répond, pas la qualité de sa réponse.

7 derniers jours

100.0%

n=3

30 derniers jours

100.0%

n=3

Temps de réponse médian

46,644ms

n=3

Basé sur 386 mesures au cours des 30 derniers jours.

Détails techniques

Seuls les vrais appels API et les requêtes de test en direct sont comptés — les sondes internes et les benchmarks sont exclus.

Les appels avec une clé API personnalisée (BYOK) sont exclus : ces échecs sont spécifiques à la clé, pas un signe de défaillance du modèle.

Les appels échoués ne sont PAS inclus dans les scores de qualité — la qualité est mesurée uniquement sur les réponses réussies. Disponibilité et qualité sont des signaux indépendants.

Temps de réponse médian (p50) sur les appels réussis avec une durée enregistrée. Les valeurs extrêmes influencent moins la médiane que la moyenne.

Total des appels (30d)

3

Réponses OK (30d)

3

Total des appels (7d)

3

Réponses OK (7d)

3

Section 09

Verdicts benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-595/100 · 75 runs
70 correct4 partial1 wrong93% accuracy
2026-09-06

Claude Opus 4.8 adds seven capabilities but lacks performance benchmarks

Claude Opus 4.8 introduces seven new capabilities: tool use, vision, JSON mode, PDF input, reasoning, JSON schema, and prompt caching. These additions significantly expand the model's functionality, bringing it closer to feature parity with competing frontier models. The vision capability enables image understanding, while tool use allows function calling for extended workflows. PDF input support streamlines document processing, and the reasoning feature suggests enhanced problem-solving capabilities. JSON mode and schema support improve structured output generation, while prompt caching can reduce latency and costs for repeated interactions. However, this release includes no benchmark performance data across standard evaluation suites. Without metrics on coding ability, mathematical reasoning, instruction following, or general knowledge tasks, users cannot assess whether core model quality has improved, regressed, or remained stable. The absence of comparative scores makes it impossible to position this release against other frontier models or previous versions. Organizations considering adoption should conduct their own evaluations on task-specific benchmarks relevant to their use cases before deployment.

Qualité

Latence p50

Exécutions de test

0

Seven new capabilities added Vision and tool use enabled No performance benchmarks provided Quality changes unknown
Section 10

Profil complet du modèle

Claude Opus 4.8 par Anthropic

Sorti le 28 mai 2026. Nouveau modèle phare. 4× moins susceptible de laisser passer des défauts de code par rapport à Opus 4.7. Même tarification, contexte 1M.

Dernier test automatisé
10 sept. 2026 · 14:03 UTC · Benchmark de vitesse
Latence P50
1177 ms
Latence P95
1321 ms
Erreurs
0 / 6 exécutions
Dernière revue par Équipe Tokonomix·29 mai 2026