Claude Opus 4.8 de Anthropic
Lanzado el 28 de mayo de 2026. Nuevo modelo insignia. 4× menos probable de dejar errores de código pasar.
Fecha de retirada
El proveedor indica el 28 de mayo de 2027 como fecha de retirada provisional. Por ahora el modelo funciona con normalidad.
Claude Opus 4.8 redefine qué significa un modelo insignia en producción: con una ventana de contexto de 1 millón de tokens y un sistema de autoevaluación significativamente más preciso, está diseñado para ejecuciones autónomas prolongadas donde la supervisión humana es esporádica.
— Análisis de modelo Tokonomix
Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.
Cómo se sitúa este modelo frente al resto del campo en cada categoría de prompts, a partir de un ajuste por pares sobre los mismos prompts. La nota bruta del juez aparece debajo de cada número.
Tasa de victorias por categoría: con qué frecuencia este modelo vence a un modelo medio en un prompt de esa categoría. 50% es la media, no un suspenso. No es un porcentaje de aciertos.
Lo que pagas por millón de tokens al usar este modelo en Tokonomix, más una estimación para una conversación típica.
Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.
Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.
Basado en resultados de benchmarks y comentarios agregados de la comunidad sobre casos de uso reales.
Para equipos que ya dependen de Opus 4.7, la actualización a Opus 4.8 es una decisión técnica clara: mayor fiabilidad en código, mayor autonomía, mismo coste. La única pregunta es si la latencia y el precio frente a Sonnet 4.6 se justifican según el caso de uso.
— Redacción Tokonomix
Con qué frecuencia responde este modelo cuando lo llamamos — medido en solicitudes reales de API y pruebas en vivo durante los últimos 30 días. Esto es independiente de la calidad: estos números solo indican si el modelo responde, no qué tan buena es la respuesta.
Últimos 7 días
100.0%
n=53
Últimos 30 días
100.0%
n=56
Tiempo de respuesta mediano
8,130ms
n=56
Basado en 441 mediciones en los últimos 30 días.
Solo cuentan las llamadas reales a la API y las solicitudes de prueba en vivo — las sondas internas y las ejecuciones de referencia están excluidas.
Las llamadas con una clave API propia (BYOK) están excluidas: esos fallos son específicos de la clave, no una señal de inactividad del modelo.
Las llamadas fallidas NO se incluyen en las puntuaciones de calidad — la calidad se mide solo en respuestas exitosas. Disponibilidad y calidad son señales independientes.
Tiempo de respuesta mediano (p50) en llamadas exitosas con una duración registrada. Los valores atípicos afectan menos a la mediana que a la media.
Total de llamadas (30d)
56
Respuestas OK (30d)
56
Total de llamadas (7d)
53
Respuestas OK (7d)
53
Claude Opus 4.8 introduces a significant expansion of capabilities without accompanying performance data. The model now supports seven new features: tools, vision, JSON mode, PDF input, reasoning, JSON schema, and prompt caching. These additions represent a substantial broadening of the model's functionality, particularly with the inclusion of multimodal capabilities through vision and PDF input, as well as structured output options via JSON mode and schema support. The reasoning capability suggests enhanced analytical features, while prompt caching could improve efficiency for repetitive tasks. However, no benchmark scores are available in the current window, making it impossible to assess the model's actual performance across standard evaluation metrics or compare it to previous versions or competitors. Users gain access to a more versatile model with expanded input and output formats, but without performance data, it remains unclear whether these new capabilities come with any trade-offs in speed, accuracy, or other quality metrics. The absence of benchmarks is notable given that this appears to be a major feature release.
Calidad
—
Latencia p50
—
Ejecuciones de test
0
Lanzado el 28 de mayo de 2026. Nuevo modelo insignia. 4× menos probable de dejar errores de código pasar.
Claude Opus 4.8
por Anthropic
Más de Anthropic