Ir al contenido
Tier A — Frontera
Se ejecuta en:USCreado en:United States

Archivado

Este modelo ha sido descontinuado por el proveedor. Los datos históricos se conservan.

Ya no está disponible desde el 28 de mayo de 2027.

Anthropic

Claude Opus 4.8

Tier A — Frontera · 1M tokens

Equipo editorial Tokonomix·Revisado por Mes Kalkan·

Claude Opus 4.8 redefine qué significa un modelo insignia en producción: con una ventana de contexto de 1 millón de tokens y un sistema de autoevaluación significativamente más preciso, está diseñado para ejecuciones autónomas prolongadas donde la supervisión humana es esporádica.

Análisis de modelo Tokonomix
Sección 01

Análisis de velocidad

Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.

Latencia P50 (mediana)Latencia P95101 runs
731168026283577452508-1609-10ms
Sección 02

Puntuaciones de calidad

Cómo se sitúa este modelo frente al resto del campo en cada categoría de prompts, a partir de un ajuste por pares sobre los mismos prompts. La nota bruta del juez aparece debajo de cada número.

46%
Generación de código
media del juez 94
44%
Creativo
media del juez 87
70%
Factual
media del juez 92
58%
Multilingüe
media del juez 98
74%
Razonamiento
media del juez 99

Tasa de victorias por categoría: con qué frecuencia este modelo vence a un modelo medio en un prompt de esa categoría. 50% es la media, no un suspenso. No es un porcentaje de aciertos.

Sección 03

Historial de precios

Tarifas directas del proveedor por millón de tokens, más una estimación del coste de una conversación típica.

💰
Tarifas API — Claude Opus 4.8
$5.00 por 1M de tokens de entrada
$25.00 por 1M de tokens de salida
≈ $0.0080 por conversación típica (800 tokens)
Precio entrada vs salida (por 1M de tokens)
por 1M de tokens de entrada$5.00
por 1M de tokens de salida$25.00

Pricing over time

Input & output per 1M tokens · step-line = price changes

$5.00

input / 1M

— stable

$25.00

output / 1M

— stable

2026-06-212026-08-022026-09-06
Input
Output
Price change
⟳ synced weekly
Sección 04

Tokens por segundo

Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.

Rendimiento (tokens / s)182 / avg 180
27140

Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.

Sección 05

Fortalezas & debilidades

Basado en resultados de benchmarks y comentarios agregados de la comunidad sobre casos de uso reales.

Fortalezas

4× menos errores de código pasados por altoAutoevaluación del progreso significativamente más precisaEjecuciones autónomas más largas sin intervenciónContexto de 1 millón de tokensSoporte nativo de visión e imágenesTool-use avanzado para pipelines de agentesAdaptive thinking integrado sin configuración adicional

Debilidades

Coste elevado frente a Sonnet 4.6 y Haiku 4.5Mayor latencia que modelos más ligeros en tareas simplesFecha de corte de conocimiento limita datos recientesSin modo extended thinking (no disponible en 4.8)
Sección 06

Capacidades

toolssource: litellmvisionjson modepdf inputreasoningjson schemaprompt cachingmax output tokens: 128000
Sección 07

Preguntas frecuentes

En la mayoría de los casos, sí. El precio de entrada/salida es idéntico al de Opus 4.7, por lo que no hay coste incremental. La mejora clave —aproximadamente 4× menos probabilidad de dejar pasar errores de código— se traduce directamente en menos revisiones manuales y ciclos de corrección en pipelines automatizados.

Para equipos que ya dependen de Opus 4.7, la actualización a Opus 4.8 es una decisión técnica clara: mayor fiabilidad en código, mayor autonomía, mismo coste. La única pregunta es si la latencia y el precio frente a Sonnet 4.6 se justifican según el caso de uso.

Redacción Tokonomix
Sección 08

Disponibilidad

Disponibilidad

Con qué frecuencia responde este modelo cuando lo llamamos — medido en solicitudes reales de API y pruebas en vivo durante los últimos 30 días. Esto es independiente de la calidad: estos números solo indican si el modelo responde, no qué tan buena es la respuesta.

Últimos 7 días

100.0%

n=3

Últimos 30 días

100.0%

n=3

Tiempo de respuesta mediano

46,644ms

n=3

Basado en 383 mediciones en los últimos 30 días.

Detalles técnicos

Solo cuentan las llamadas reales a la API y las solicitudes de prueba en vivo — las sondas internas y las ejecuciones de referencia están excluidas.

Las llamadas con una clave API propia (BYOK) están excluidas: esos fallos son específicos de la clave, no una señal de inactividad del modelo.

Las llamadas fallidas NO se incluyen en las puntuaciones de calidad — la calidad se mide solo en respuestas exitosas. Disponibilidad y calidad son señales independientes.

Tiempo de respuesta mediano (p50) en llamadas exitosas con una duración registrada. Los valores atípicos afectan menos a la mediana que a la media.

Total de llamadas (30d)

3

Respuestas OK (30d)

3

Total de llamadas (7d)

3

Respuestas OK (7d)

3

Sección 09

Veredictos del benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-595/100 · 75 runs
70 correct4 partial1 wrong93% accuracy
2026-09-06

Claude Opus 4.8 adds seven capabilities but lacks performance benchmarks

Claude Opus 4.8 introduces seven new capabilities: tool use, vision, JSON mode, PDF input, reasoning, JSON schema, and prompt caching. These additions significantly expand the model's functionality, bringing it closer to feature parity with competing frontier models. The vision capability enables image understanding, while tool use allows function calling for extended workflows. PDF input support streamlines document processing, and the reasoning feature suggests enhanced problem-solving capabilities. JSON mode and schema support improve structured output generation, while prompt caching can reduce latency and costs for repeated interactions. However, this release includes no benchmark performance data across standard evaluation suites. Without metrics on coding ability, mathematical reasoning, instruction following, or general knowledge tasks, users cannot assess whether core model quality has improved, regressed, or remained stable. The absence of comparative scores makes it impossible to position this release against other frontier models or previous versions. Organizations considering adoption should conduct their own evaluations on task-specific benchmarks relevant to their use cases before deployment.

Calidad

Latencia p50

Ejecuciones de test

0

Seven new capabilities added Vision and tool use enabled No performance benchmarks provided Quality changes unknown
Sección 10

Perfil completo del modelo

Claude Opus 4.8 de Anthropic

Lanzado el 28 de mayo de 2026. Nuevo modelo insignia. 4× menos probable de dejar errores de código pasar.

Última prueba automática
10 sept 2026 · 08:00 UTC · Benchmark de velocidad
Latencia P50
1096 ms
Latencia P95
1104 ms
Errores
0 / 6 ejecuciones
Última revisión por Equipo Tokonomix·29 de mayo de 2026