Claude Opus 4.8 par Anthropic
Sorti le 28 mai 2026. Nouveau modèle phare. 4× moins susceptible de laisser passer des défauts de code par rapport à Opus 4.7. Même tarification, contexte 1M.
Archivé
Ce modèle a été retiré par le fournisseur. Les données historiques sont conservées.
Plus disponible depuis le 28 mai 2027.
Opus 4.8 marque une étape concrète dans la fiabilité des agents autonomes : moins d'erreurs de code laissées passer, des exécutions plus longues sans dérive, et un contexte d'un million de tokens qui change la portée des tâches traitables en une seule passe. C'est le modèle phare d'Anthropic au 28 mai 2026, conçu pour les équipes qui confient à l'IA des missions complexes et de longue durée.
— Analyse modèle Tokonomix
Latence mesurée sur toutes les exécutions de benchmark. P50 (médiane) et P95 (95e percentile) donnent une image réaliste de la vitesse de réponse en charge normale et de pointe.
Comment ce modèle se situe par rapport au reste du champ sur chaque catégorie de prompts, à partir d'un ajustement par paires sur les mêmes prompts. La note brute du juge figure sous chaque nombre.
Taux de victoire par catégorie : la fréquence à laquelle ce modèle bat un modèle moyen sur un prompt de cette catégorie. 50% est la moyenne, pas un échec. Ce n'est pas un pourcentage de bonnes réponses.
Tarifs directs du fournisseur par million de tokens, plus une estimation du coût d'une conversation typique.
Pricing over time
Input & output per 1M tokens · step-line = price changes
$5.00
input / 1M
— stable
$25.00
output / 1M
— stable
Débit en tokens par seconde, dérivé de la latence P50 mesurée. Plus haut est mieux ; les fluctuations reflètent la charge côté fournisseur.
Estimé à partir de la latence P50 × 200 tokens de sortie — le chiffre absolu dépend de cette hypothèse ; c'est la tendance qui compte.
Basé sur les résultats de benchmarks et les retours communautaires agrégés sur des cas d'usage réels.
Opus 4.8 est le bon choix pour les flux de travail autonomes exigeants où la qualité du code et la durée d'exécution comptent davantage que la vitesse brute ou le coût par token. Pour les tâches courtes et répétitives, Sonnet 4.6 ou Haiku 4.5 restent plus économiques.
— Rédaction Tokonomix
La fréquence à laquelle ce modèle répond lorsqu'on l'appelle — mesurée sur de vraies requêtes API et des tests en direct au cours des 30 derniers jours. C'est indépendant de la qualité : ces chiffres indiquent seulement si le modèle répond, pas la qualité de sa réponse.
7 derniers jours
100.0%
n=3
30 derniers jours
100.0%
n=3
Temps de réponse médian
46,644ms
n=3
Basé sur 386 mesures au cours des 30 derniers jours.
Seuls les vrais appels API et les requêtes de test en direct sont comptés — les sondes internes et les benchmarks sont exclus.
Les appels avec une clé API personnalisée (BYOK) sont exclus : ces échecs sont spécifiques à la clé, pas un signe de défaillance du modèle.
Les appels échoués ne sont PAS inclus dans les scores de qualité — la qualité est mesurée uniquement sur les réponses réussies. Disponibilité et qualité sont des signaux indépendants.
Temps de réponse médian (p50) sur les appels réussis avec une durée enregistrée. Les valeurs extrêmes influencent moins la médiane que la moyenne.
Total des appels (30d)
3
Réponses OK (30d)
3
Total des appels (7d)
3
Réponses OK (7d)
3
Claude Opus 4.8 introduces seven new capabilities: tool use, vision, JSON mode, PDF input, reasoning, JSON schema, and prompt caching. These additions significantly expand the model's functionality, bringing it closer to feature parity with competing frontier models. The vision capability enables image understanding, while tool use allows function calling for extended workflows. PDF input support streamlines document processing, and the reasoning feature suggests enhanced problem-solving capabilities. JSON mode and schema support improve structured output generation, while prompt caching can reduce latency and costs for repeated interactions. However, this release includes no benchmark performance data across standard evaluation suites. Without metrics on coding ability, mathematical reasoning, instruction following, or general knowledge tasks, users cannot assess whether core model quality has improved, regressed, or remained stable. The absence of comparative scores makes it impossible to position this release against other frontier models or previous versions. Organizations considering adoption should conduct their own evaluations on task-specific benchmarks relevant to their use cases before deployment.
Qualité
—
Latence p50
—
Exécutions de test
0
Sorti le 28 mai 2026. Nouveau modèle phare. 4× moins susceptible de laisser passer des défauts de code par rapport à Opus 4.7. Même tarification, contexte 1M.
Archivé
Ce modèle a été retiré par le fournisseur. Les données historiques sont conservées.
Plus disponible depuis le 28 mai 2027.
Claude Opus 4.8
par Anthropic
Plus de Anthropic