Ir al contenido
Tier A — Frontera
Se ejecuta en:USCreado en:United States

Fecha de retirada

El proveedor indica el 28 de mayo de 2027 como fecha de retirada provisional. Por ahora el modelo funciona con normalidad.

Anthropic

Claude Opus 4.8

Tier A — Frontera · 1M tokens

Equipo editorial Tokonomix·Revisado por Mes Kalkan··

Claude Opus 4.8 redefine qué significa un modelo insignia en producción: con una ventana de contexto de 1 millón de tokens y un sistema de autoevaluación significativamente más preciso, está diseñado para ejecuciones autónomas prolongadas donde la supervisión humana es esporádica.

Análisis de modelo Tokonomix
Sección 01

Análisis de velocidad

Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.

Latencia P50 (mediana)Latencia P95100 runs
702138320652746342708-2109-14ms
Sección 02

Puntuaciones de calidad

Cómo se sitúa este modelo frente al resto del campo en cada categoría de prompts, a partir de un ajuste por pares sobre los mismos prompts. La nota bruta del juez aparece debajo de cada número.

48%
Generación de código
media del juez 94
44%
Creativo
media del juez 87
72%
Factual
media del juez 88
58%
Multilingüe
media del juez 98
67%
Razonamiento
media del juez 99

Tasa de victorias por categoría: con qué frecuencia este modelo vence a un modelo medio en un prompt de esa categoría. 50% es la media, no un suspenso. No es un porcentaje de aciertos.

Sección 03

Precios

Lo que pagas por millón de tokens al usar este modelo en Tokonomix, más una estimación para una conversación típica.

💰
Tarifas API — Claude Opus 4.8
$6.50 por 1M de tokens de entrada
$32.50 por 1M de tokens de salida
≈ $0.0104 por conversación típica (800 tokens)
Precio entrada vs salida (por 1M de tokens)
por 1M de tokens de entrada$6.50
por 1M de tokens de salida$32.50
Sección 04

Tokens por segundo

Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.

Rendimiento (tokens / s)203 / avg 185
28373

Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.

Sección 05

Fortalezas & debilidades

Basado en resultados de benchmarks y comentarios agregados de la comunidad sobre casos de uso reales.

Fortalezas

4× menos errores de código pasados por altoAutoevaluación del progreso significativamente más precisaEjecuciones autónomas más largas sin intervenciónContexto de 1 millón de tokensSoporte nativo de visión e imágenesTool-use avanzado para pipelines de agentesAdaptive thinking integrado sin configuración adicional

Debilidades

Coste elevado frente a Sonnet 4.6 y Haiku 4.5Mayor latencia que modelos más ligeros en tareas simplesFecha de corte de conocimiento limita datos recientesSin modo extended thinking (no disponible en 4.8)
Sección 06

Capacidades

toolssource: litellmvisionjson modepdf inputreasoningjson schemaprompt cachingmax output tokens: 128000
Sección 07

Preguntas frecuentes

En la mayoría de los casos, sí. El precio de entrada/salida es idéntico al de Opus 4.7, por lo que no hay coste incremental. La mejora clave —aproximadamente 4× menos probabilidad de dejar pasar errores de código— se traduce directamente en menos revisiones manuales y ciclos de corrección en pipelines automatizados.

Para equipos que ya dependen de Opus 4.7, la actualización a Opus 4.8 es una decisión técnica clara: mayor fiabilidad en código, mayor autonomía, mismo coste. La única pregunta es si la latencia y el precio frente a Sonnet 4.6 se justifican según el caso de uso.

Redacción Tokonomix
Sección 08

Disponibilidad

Disponibilidad

Con qué frecuencia responde este modelo cuando lo llamamos — medido en solicitudes reales de API y pruebas en vivo durante los últimos 30 días. Esto es independiente de la calidad: estos números solo indican si el modelo responde, no qué tan buena es la respuesta.

Últimos 7 días

100.0%

n=53

Últimos 30 días

100.0%

n=56

Tiempo de respuesta mediano

8,130ms

n=56

Basado en 441 mediciones en los últimos 30 días.

Detalles técnicos

Solo cuentan las llamadas reales a la API y las solicitudes de prueba en vivo — las sondas internas y las ejecuciones de referencia están excluidas.

Las llamadas con una clave API propia (BYOK) están excluidas: esos fallos son específicos de la clave, no una señal de inactividad del modelo.

Las llamadas fallidas NO se incluyen en las puntuaciones de calidad — la calidad se mide solo en respuestas exitosas. Disponibilidad y calidad son señales independientes.

Tiempo de respuesta mediano (p50) en llamadas exitosas con una duración registrada. Los valores atípicos afectan menos a la mediana que a la media.

Total de llamadas (30d)

56

Respuestas OK (30d)

56

Total de llamadas (7d)

53

Respuestas OK (7d)

53

Sección 09

Veredictos del benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-594/100 · 80 runs
74 correct4 partial2 wrong93% accuracy
2026-09-13

Claude Opus 4.8 adds seven capabilities but lacks performance benchmarks

Claude Opus 4.8 introduces a significant expansion of capabilities without accompanying performance data. The model now supports seven new features: tools, vision, JSON mode, PDF input, reasoning, JSON schema, and prompt caching. These additions represent a substantial broadening of the model's functionality, particularly with the inclusion of multimodal capabilities through vision and PDF input, as well as structured output options via JSON mode and schema support. The reasoning capability suggests enhanced analytical features, while prompt caching could improve efficiency for repetitive tasks. However, no benchmark scores are available in the current window, making it impossible to assess the model's actual performance across standard evaluation metrics or compare it to previous versions or competitors. Users gain access to a more versatile model with expanded input and output formats, but without performance data, it remains unclear whether these new capabilities come with any trade-offs in speed, accuracy, or other quality metrics. The absence of benchmarks is notable given that this appears to be a major feature release.

Calidad

Latencia p50

Ejecuciones de test

0

Seven new capabilities added Multimodal support via vision Structured output with JSON No benchmark data available
Sección 10

Perfil completo del modelo

Claude Opus 4.8 de Anthropic

Lanzado el 28 de mayo de 2026. Nuevo modelo insignia. 4× menos probable de dejar errores de código pasar.

Última prueba automática
14 sept 2026 · 20:02 UTC · Benchmark de velocidad
Latencia P50
987 ms
Latencia P95
1118 ms
Errores
0 / 6 ejecuciones
Última revisión por Equipo Tokonomix·15 de septiembre de 2026