Ir al contenido
Tier A — Frontera
Se ejecuta en:USCreado en:United States

Fecha de retirada

El proveedor indica el 24 de julio de 2027 como fecha de retirada provisional. Por ahora el modelo funciona con normalidad.

Anthropic

Claude Opus 5

Tier A — Frontera · 1M tokens

Equipo editorial Tokonomix·Revisado por Mes Kalkan··
Sección 01

Análisis de velocidad

Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.

Latencia P50 (mediana)Latencia P95100 runs
97141197267104141356208-2109-14ms
Sección 02

Puntuaciones de calidad

Cómo se sitúa este modelo frente al resto del campo en cada categoría de prompts, a partir de un ajuste por pares sobre los mismos prompts. La nota bruta del juez aparece debajo de cada número.

31%
Generación de código
media del juez 69
86%
Creativo
media del juez 92
53%
Factual
media del juez 86
41%
Multilingüe
media del juez 88
55%
Razonamiento
media del juez 88

Tasa de victorias por categoría: con qué frecuencia este modelo vence a un modelo medio en un prompt de esa categoría. 50% es la media, no un suspenso. No es un porcentaje de aciertos.

Sección 03

Precios

Lo que pagas por millón de tokens al usar este modelo en Tokonomix, más una estimación para una conversación típica.

💰
Tarifas API — Claude Opus 5
$6.50 por 1M de tokens de entrada
$32.50 por 1M de tokens de salida
≈ $0.0104 por conversación típica (800 tokens)
Precio entrada vs salida (por 1M de tokens)
por 1M de tokens de entrada$6.50
por 1M de tokens de salida$32.50
Sección 04

Tokens por segundo

Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.

Rendimiento (tokens / s)107 / avg 133
20419

Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.

Sección 05

Capacidades

toolssource: manualvisionjson modepdf inputreasoningjson schemaprompt cachingmax output tokens: 128000
Sección 06

Disponibilidad

Disponibilidad

Con qué frecuencia responde este modelo cuando lo llamamos — medido en solicitudes reales de API y pruebas en vivo durante los últimos 30 días. Esto es independiente de la calidad: estos números solo indican si el modelo responde, no qué tan buena es la respuesta.

Últimos 7 días

88.6%

n=44

Últimos 30 días

91.7%

n=72

Tiempo de respuesta mediano

25,106ms

n=66

Basado en 457 mediciones en los últimos 30 días.

Detalles técnicos

Solo cuentan las llamadas reales a la API y las solicitudes de prueba en vivo — las sondas internas y las ejecuciones de referencia están excluidas.

Las llamadas con una clave API propia (BYOK) están excluidas: esos fallos son específicos de la clave, no una señal de inactividad del modelo.

Las llamadas fallidas NO se incluyen en las puntuaciones de calidad — la calidad se mide solo en respuestas exitosas. Disponibilidad y calidad son señales independientes.

Tiempo de respuesta mediano (p50) en llamadas exitosas con una duración registrada. Los valores atípicos afectan menos a la mediana que a la media.

Total de llamadas (30d)

72

Respuestas OK (30d)

66

Total de llamadas (7d)

44

Respuestas OK (7d)

39

Sección 07

Veredictos del benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-583/100 · 38 runs
29 correct4 partial5 wrong76% accuracy
2026-09-13

Claude Opus 5 shows quality decline, particularly in coding performance

Claude Opus 5's overall quality score has dropped to 85.3 from 92.0 in the previous benchmark window, representing a 6.7 point decline. The most significant regression appears in coding performance, which fell from 92 to 64, a substantial 28-point decrease that suggests potential issues with code generation or analysis capabilities. Factual accuracy remains a bright spot, achieving a perfect 100 score, while reasoning performance stayed strong at 92. The model's latency has increased slightly from 8541ms to 9811ms at the median, representing about 15% slower response times. The current benchmark window includes fewer test runs (4 versus 5), though this should not materially affect score validity. The previous window included creative and multilingual category testing, which were not evaluated in the current window, making direct comparison limited to the available categories. Users relying on Claude Opus 5 for coding tasks should exercise additional caution and validation, while those focused on factual retrieval and reasoning can expect continued strong performance. The quality decline warrants monitoring in subsequent benchmark windows to determine if this represents a temporary anomaly or a sustained trend.

Calidad

85.3

Latencia p50

9,811 ms

Ejecuciones de test

4

Coding score dropped 28 points Overall quality down 6.7 points Latency increased 15 percent Factual accuracy remains perfect
Sección 08

Perfil completo del modelo

Claude Opus 5 — análisis en profundidad

Claude Opus 5 es el nuevo buque insignia de la línea Opus de Anthropic, lanzado el 24 de julio de 2026 como sucesor de Opus 4.8. Anthropic lo posiciona "para codificación agéntica compleja y trabajo empresarial", y ahora es el modelo predeterminado en Claude Code. Está disponible a través de la API de Claude (claude-opus-5), Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry y Claude Platform on AWS.

Precio y ventana de contexto

Según Anthropic, "Opus 5 iguala muchas de las capacidades de Fable 5 a la mitad del precio" — una afirmación de la propia Anthropic, no verificada de forma independiente. La ventana de contexto es de 1.000.000 de tokens, con una salida máxima de 128k tokens por llamada síncrona — suficiente para abarcar bases de código grandes en un solo contexto.

Adaptive thinking y corte de conocimiento

En lugar del parámetro manual budget_tokens del antiguo mecanismo de pensamiento extendido, Opus 5 utiliza adaptive thinking, controlado mediante un parámetro effort con cinco niveles: low, medium, high, xhigh y max (por defecto: high). Los datos de entrenamiento cubren de forma fiable hasta mayo de 2026 — según Anthropic, el corte más reciente de todos los modelos Claude disponibles actualmente.

Autonomía a largo plazo y mejor criterio

La afirmación principal de Anthropic sobre Opus 5 se refiere a la persistencia en tareas largas y no supervisadas: trabajar de forma independiente durante horas, recuperarse de sus propios errores, sortear bloqueos en lugar de detenerse, y revisar periódicamente su propio trabajo. Anthropic respalda esto con sus propias cifras: 43,3% en Frontier-Bench v0.1 (frente a 18,7% de Opus 4.8) y 68,8% en DeepSWE v1.1 (frente a 59,0% de Opus 4.8) — resultados publicados por la propia Anthropic, no reproducidos de forma independiente por Tokonomix. Anthropic también destaca un mejor criterio: el modelo hace con más frecuencia una pregunta aclaratoria antes de adivinar ante una instrucción ambigua, es más propenso a cuestionar una instrucción defectuosa en lugar de ejecutarla literalmente, y considera más a menudo las implicaciones de un cambio antes de implementarlo — sin medición cuantitativa publicada para este último punto.

Cuándo elegir Opus 5

Anthropic posiciona Opus 5 como la nueva opción predeterminada para codificación agéntica compleja y trabajo empresarial, y como la alternativa más económica a Fable 5 con capacidades comparables en muchos aspectos. Para tareas más simples — chats cortos, clasificación, extracción ligera — un modelo más pequeño y económico suele seguir siendo la opción más rentable.

Disponibilidad en Tokonomix

Claude Opus 5 figura en Tokonomix bajo el slug claude-opus-5, tier A, alojado en EE. UU. vía Anthropic direct. Las puntuaciones de referencia independientes de los propios evaluadores de Tokonomix aún no están disponibles para este modelo — aparecerán automáticamente en esta página en cuanto Claude Opus 5 se incluya en el próximo ciclo de pruebas.

Última prueba automática
14 sept 2026 · 20:02 UTC · Benchmark de velocidad
Latencia P50
1862 ms
Latencia P95
2597 ms
Errores
0 / 6 ejecuciones
Última revisión por Equipo Tokonomix·15 de septiembre de 2026