Ir al contenido
Tier A — Frontera
Se ejecuta en:USCreado en:United States

Fecha de retirada

El proveedor indica el 30 de junio de 2027 como fecha de retirada provisional. Por ahora el modelo funciona con normalidad.

Anthropic

Claude Sonnet 5

Tier A — Frontera · 1M tokens

Equipo editorial Tokonomix·Revisado por Mes Kalkan·
Sección 01

Análisis de velocidad

Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.

Latencia P50 (mediana)Latencia P95100 runs
8483324580082751075108-2109-14ms
Sección 02

Puntuaciones de calidad

Cómo se sitúa este modelo frente al resto del campo en cada categoría de prompts, a partir de un ajuste por pares sobre los mismos prompts. La nota bruta del juez aparece debajo de cada número.

54%
Generación de código
media del juez 93
89%
Creativo
media del juez 92
53%
Factual
media del juez 73
65%
Multilingüe
media del juez 98
59%
Razonamiento
media del juez 75

Tasa de victorias por categoría: con qué frecuencia este modelo vence a un modelo medio en un prompt de esa categoría. 50% es la media, no un suspenso. No es un porcentaje de aciertos.

Sección 03

Precios

Lo que pagas por millón de tokens al usar este modelo en Tokonomix, más una estimación para una conversación típica.

💰
Tarifas API — Claude Sonnet 5
$2.60 por 1M de tokens de entrada
$13.00 por 1M de tokens de salida
≈ $0.0042 por conversación típica (800 tokens)
Precio entrada vs salida (por 1M de tokens)
por 1M de tokens de entrada$2.60
por 1M de tokens de salida$13.00
Sección 04

Tokens por segundo

Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.

Rendimiento (tokens / s)187 / avg 160
23427

Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.

Sección 05

Capacidades

toolssource: manualvisionjson modepdf inputreasoningjson schemaprompt cachingmax output tokens: 128000
Sección 06

Disponibilidad

Disponibilidad

Con qué frecuencia responde este modelo cuando lo llamamos — medido en solicitudes reales de API y pruebas en vivo durante los últimos 30 días. Esto es independiente de la calidad: estos números solo indican si el modelo responde, no qué tan buena es la respuesta.

Últimos 7 días

100.0%

n=13

Últimos 30 días

100.0%

n=13

Tiempo de respuesta mediano

30,020ms

n=13

Basado en 398 mediciones en los últimos 30 días.

Detalles técnicos

Solo cuentan las llamadas reales a la API y las solicitudes de prueba en vivo — las sondas internas y las ejecuciones de referencia están excluidas.

Las llamadas con una clave API propia (BYOK) están excluidas: esos fallos son específicos de la clave, no una señal de inactividad del modelo.

Las llamadas fallidas NO se incluyen en las puntuaciones de calidad — la calidad se mide solo en respuestas exitosas. Disponibilidad y calidad son señales independientes.

Tiempo de respuesta mediano (p50) en llamadas exitosas con una duración registrada. Los valores atípicos afectan menos a la mediana que a la media.

Total de llamadas (30d)

13

Respuestas OK (30d)

13

Total de llamadas (7d)

13

Respuestas OK (7d)

13

Sección 07

Veredictos del benchmark Tokonomix

⚖️
Endorsed by 1 judge
Independent LLM judges evaluated this model on our weekly intelligence tests
claude-sonnet-4-587/100 · 30 runs
26 correct1 partial3 wrong87% accuracy
2026-09-13

Claude Sonnet 5 quality drops 16 points with slower response times

Claude Sonnet 5 experienced a significant performance regression in this benchmark window. Overall quality declined from 93.2 to 77.3, representing a 15.9 point drop that affects most capabilities. The model maintained exceptional reasoning performance at a perfect 100 score, but coding ability decreased substantially from 95 to 81. Most concerning is the factual accuracy category, which scored just 52 compared to previous strong performance. Response latency also degraded, with the median increasing from 4.8 to 6.5 seconds, a 36% slowdown that will be noticeable to users. The benchmark categories shifted between windows, making direct comparison challenging for creative and multilingual tasks which were not retested. This change pattern suggests either a model update that traded accuracy for other characteristics, infrastructure issues affecting performance, or possible variations in test composition. Users relying on factual accuracy should exercise additional caution, while those prioritizing reasoning tasks may see less impact. The latency increase affects all use cases and may require timeout adjustments in production environments.

Calidad

77.3

Latencia p50

6,457 ms

Ejecuciones de test

5

Quality dropped 16 points Factual accuracy scored only 52 Response time increased 36% Reasoning remains perfect at 100
Sección 08

Perfil completo del modelo

Claude Sonnet 5: el Claude de gama media construido para actuar, no solo para responder

Claude Sonnet 5 es el modelo de gama media de Anthropic, lanzado el 30 de junio de 2026 como sucesor de Sonnet 4.6. Anthropic lo presenta como el Sonnet más agéntico que la compañía ha lanzado hasta ahora: un modelo pensado para planificar una tarea, usar herramientas como un navegador o una terminal, y llevar adelante un trabajo de varios pasos con menos supervisión paso a paso de la que necesitaban las generaciones anteriores de Sonnet. El propio posicionamiento de Anthropic es que Sonnet 5 cierra buena parte de la brecha con la línea insignia Opus sin salir del nivel Sonnet.

Dónde destaca

El modelo está construido en torno al uso sostenido de herramientas más que a la conversación de un solo turno. Admite llamadas a funciones, salida JSON estructurada contra un esquema, entrada de PDF y visión, y expone un modo de razonamiento que le permite trabajar un problema antes de responder. Esa combinación encaja bien con flujos de trabajo agénticos: una tarea que requiere leer un documento, llamar a una herramienta, comprobar el resultado y decidir el siguiente paso es exactamente la forma de trabajo para la que Anthropic dice haber diseñado este lanzamiento. Anthropic reporta un 78,5% en OSWorld-Verified, su benchmark de uso de ordenador, y un 46,8% en Humanity's Last Exam cuando se permite al modelo usar herramientas — ambas son cifras publicadas por la propia Anthropic, no resultados reproducidos de forma independiente, así que describen la versión del fabricante sobre el progreso del modelo, no un resultado neutral de terceros.

Bajo el capó

Sonnet 5 tiene una ventana de contexto de 1.000.000 de tokens con una salida síncrona máxima de 128.000 tokens por respuesta. La salida es solo de texto — esta generación de Sonnet no genera imágenes ni audio. La caché de prompts está soportada, lo cual importa para los bucles agénticos que reenvían un contexto grande y mayormente sin cambios (una base de código, un documento largo, un esquema de herramienta) a lo largo de muchos turnos de la misma sesión.

Dónde se queda corto

El propio anuncio de Anthropic para este lanzamiento no indica una fecha de corte de conocimiento, así que cualquiera que dependa del modelo para eventos muy recientes o bibliotecas recién publicadas debería verificar en lugar de asumir. Los puntos fuertes del modelo se concentran en el trabajo de varios pasos con uso de herramientas; para preguntas cortas de un solo turno o clasificación simple, la maquinaria agéntica es más sobrecarga que beneficio, y un modelo más ligero de la misma familia normalmente responderá igual de bien. Las propias afirmaciones de benchmark de Anthropic, al venir del fabricante probando su propio modelo, también conviene tratarlas como orientativas más que definitivas — la magnitud de la mejora respecto a Sonnet 4.6 es la caracterización de Anthropic hasta que se contraste con cargas de trabajo independientes.

Cuándo elegirlo

Sonnet 5 encaja en agentes de programación, agentes de investigación y cualquier flujo de trabajo donde el modelo necesite seguir trabajando a través de varias llamadas a herramientas sin que un humano tenga que volver a indicarle en cada paso — depurar una suite de pruebas que falla, avanzar en una refactorización de varios archivos o ejecutar de principio a fin una tarea de navegar y resumir. También encaja en cargas de trabajo que necesitan una ventana de contexto genuinamente grande junto con uso de herramientas, como revisar una base de código extensa o un conjunto largo de documentos en una sola sesión.

Para trabajos que no necesitan esa autonomía — generación de formato corto, extracción simple, clasificación de una sola llamada — la sobrecarga agéntica no aporta nada útil, y un modelo más pequeño y rápido será normalmente la opción por defecto más sensata.

Alternativas que vale la pena comparar

Dentro de la propia gama de Anthropic, Claude Opus 5 se sitúa por encima de Sonnet 5 como la insignia para el trabajo agéntico y empresarial más complejo, y Claude Fable 5 se sitúa por encima de ese como el modelo más capaz que Anthropic ha lanzado de forma amplia — ambos son opciones si una carga de trabajo resulta necesitar más margen del que ofrece Sonnet 5. El propio posicionamiento de Anthropic presenta a Sonnet 5 como cercano al rendimiento de Opus en muchas tareas, lo que hace que valga la pena empezar por ahí antes de recurrir a un modelo más grande, y solo subir de nivel si la carga de trabajo demuestra específicamente que necesita esa capacidad extra.

Notas de implementación

Como Sonnet 5 está construido en torno a sesiones largas y con uso intensivo de herramientas, las integraciones deben esperar y manejar bucles de llamadas a herramientas de varios turnos en lugar de un único intercambio de solicitud/respuesta — los tiempos de espera, la lógica de reintentos y el formato de los resultados de herramientas deben tener en cuenta una tarea que puede tardar varias rondas en completarse. El techo de 128.000 tokens de salida es generoso pero finito; un flujo de trabajo que espera que una sola llamada devuelva un artefacto generado completo y grande debería confirmar que cabe bajo ese límite antes de depender de ello en producción.

Última prueba automática
14 sept 2026 · 20:02 UTC · Benchmark de velocidad
Latencia P50
1067 ms
Latencia P95
1416 ms
Errores
0 / 6 ejecuciones
Última revisión por Equipo Tokonomix·14 de septiembre de 2026