Ir al contenido
Tier A — Frontera
Se ejecuta en:USCreado en:United States

Fecha de retirada

El proveedor indica el 9 de junio de 2027 como fecha de retirada provisional. Por ahora el modelo funciona con normalidad.

Anthropic

Claude Fable 5

Tier A — Frontera · 1M tokens

Equipo editorial Tokonomix·Revisado por Mes Kalkan·

Claude Fable 5 es el modelo de visión y razonamiento de Anthropic, con una variante de contexto de un millón de tokens. En nuestro propio piloto de control de calidad de imágenes fue el evaluador más estable que probamos, así que lo convertimos en el proponente de visión por defecto de nuestro panel de consenso visual. Esto es lo que medimos, y lo que no.

Lo que queríamos de un proponente de visión no era inteligencia sino estabilidad — y en nuestro conjunto piloto, Fable 5 fue el más estable.

Piloto de visión-QC de Tokonomix, 9 de junio de 2026
Sección 01

Análisis de velocidad

Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.

Latencia P50 (mediana)Latencia P95100 runs
2251388555207154878808-2109-14ms
Sección 02

Puntuaciones de calidad

Cómo se sitúa este modelo frente al resto del campo en cada categoría de prompts, a partir de un ajuste por pares sobre los mismos prompts. La nota bruta del juez aparece debajo de cada número.

64%
Generación de código
media del juez 97
67%
Creativo
media del juez 89
59%
Factual
media del juez 67
65%
Multilingüe
media del juez 99
69%
Razonamiento
media del juez 98

Tasa de victorias por categoría: con qué frecuencia este modelo vence a un modelo medio en un prompt de esa categoría. 50% es la media, no un suspenso. No es un porcentaje de aciertos.

Sección 03

Precios

Lo que pagas por millón de tokens al usar este modelo en Tokonomix, más una estimación para una conversación típica.

💰
Tarifas API — Claude Fable 5
$13.00 por 1M de tokens de entrada
$65.00 por 1M de tokens de salida
≈ $0.0208 por conversación típica (800 tokens)
Precio entrada vs salida (por 1M de tokens)
por 1M de tokens de entrada$13.00
por 1M de tokens de salida$65.00
Sección 04

Tokens por segundo

Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.

Rendimiento (tokens / s)69 / avg 60
8832

Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.

Sección 05

Fortalezas & debilidades

Basado en resultados de benchmarks y comentarios agregados de la comunidad sobre casos de uso reales.

Fortalezas

Proponente de visión más estable del piloto (88% idéntico)Baja tasa de falsas alarmas (7,1% en la base de 300 imágenes)Detectó puntos ciegos que otros modelos pasaron por altoVariante de contexto 1M para material largo y rico en imágenes

Debilidades

Exhaustividad solo 66,9% — se necesita un panel para 87,5%Cifras de razonamiento/código tempranas (una ejecución, n=1)
Sección 06

Capacidades

toolssource: manualvisionjson modepdf inputreasoningjson schemamodel class: mythosprompt cachingmax output tokens: 128000
Sección 07

Preguntas frecuentes

En nuestro piloto del 9 de junio de 2026 fue idéntico el 88% de las veces, cambió de opinión solo el 3,9% y produjo cero falsos positivos — la estabilidad que se quiere al frente de un flujo de control de calidad. Una decisión de producto deliberada basada en ese piloto.

Preferimos entregarte el matiz — piloto pequeño, referencia de un día, cifras de razonamiento tempranas — antes que una historia pulida que no sobrevive a la siguiente ejecución.

Redacción de Tokonomix
Sección 08

Disponibilidad

Disponibilidad

Con qué frecuencia responde este modelo cuando lo llamamos — medido en solicitudes reales de API y pruebas en vivo durante los últimos 30 días. Esto es independiente de la calidad: estos números solo indican si el modelo responde, no qué tan buena es la respuesta.

Últimos 7 días

62.5%

n=48

Últimos 30 días

70.5%

n=61

Tiempo de respuesta mediano

16,774ms

n=43

Basado en 448 mediciones en los últimos 30 días.

Detalles técnicos

Solo cuentan las llamadas reales a la API y las solicitudes de prueba en vivo — las sondas internas y las ejecuciones de referencia están excluidas.

Las llamadas con una clave API propia (BYOK) están excluidas: esos fallos son específicos de la clave, no una señal de inactividad del modelo.

Las llamadas fallidas NO se incluyen en las puntuaciones de calidad — la calidad se mide solo en respuestas exitosas. Disponibilidad y calidad son señales independientes.

Tiempo de respuesta mediano (p50) en llamadas exitosas con una duración registrada. Los valores atípicos afectan menos a la mediana que a la media.

Total de llamadas (30d)

61

Respuestas OK (30d)

43

Total de llamadas (7d)

48

Respuestas OK (7d)

30

Piloto de calidad de imagen (2026-06-10)

Recall

66.9%

n=300

Falsa alarma

7.1%

n=300

Sección 09

Veredictos del benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 2 runs
2 correct0 partial0 wrong100% accuracy
claude-sonnet-4-589/100 · 65 runs
55 correct4 partial6 wrong85% accuracy
2026-09-13

Claude Fable 5 shows reasoning gains but latency degrades 20%

Claude Fable 5 demonstrates a modest overall quality improvement, rising from 86.9 to 88.0 across the benchmark window. The most significant development is perfect reasoning performance at 100, showing strong capabilities in logical tasks and problem-solving scenarios. Coding performance remains exceptionally stable, improving only marginally from 95 to 96, indicating consistent strength in programming tasks. However, the model faces a notable performance tradeoff. Latency has increased substantially from 7361ms to 8825ms at the median, representing a 20% slowdown in response times. This degradation may impact user experience in time-sensitive applications despite the quality improvements. Category coverage has shifted between windows, with factual question performance now measured at 68, suggesting room for improvement in knowledge retrieval tasks. Previous strengths in creative writing (66) and multilingual capabilities (100) are not reflected in current testing, making direct comparison difficult. The overall quality gain of 1.1 points suggests incremental refinement rather than transformative changes. Users should weigh the reasoning improvements against increased wait times when evaluating this model for production deployment.

Calidad

88.0

Latencia p50

8,825 ms

Ejecuciones de test

5

Perfect reasoning score achieved Coding remains exceptionally strong Latency increased 20% Factual performance needs improvement
Sección 10

Perfil completo del modelo

Claude Fable 5: el evaluador más estable que probamos

El Claude Fable 5 de Anthropic es un modelo de visión y razonamiento, y la variante en la que más nos apoyamos — claude-fable-5[1m] — tiene una ventana de contexto de un millón de tokens. No vamos a recitar una ficha técnica. Lo que sí ofrecemos es algo que la mayoría de los artículos no tiene: cifras de nuestras propias mediciones, con fechas y tamaños de muestra, y una nota honesta donde la evidencia escasea.

Por qué lo convertimos en nuestro proponente de visión por defecto

El 9 de junio de 2026 ejecutamos un piloto de control de calidad de imágenes — un conjunto de imágenes, cada una con un defecto de calidad de medios conocido por detectar, presentadas a varios modelos de visión para comparar su comportamiento. Fable 5 destacó por una cualidad que pesa más que la pura inteligencia: la estabilidad.

A lo largo de pasadas repetidas sobre el conjunto piloto fue idéntico el 88% de las veces, con una tasa de cambio de opinión del 3,9% — rara vez cambiaba de criterio sobre la misma imagen. En ese conjunto produjo cero falsos positivos: no inventó defectos inexistentes. También detectó puntos ciegos que otros modelos del panel pasaron por alto.

La estabilidad es justo lo que se quiere de un proponente. Un modelo que hoy marca un defecto real y mañana ignora la misma imagen es una mala base para un proceso. Uno que responde igual cada vez — y no da falsas alarmas — puede ponerse al frente de un flujo. Eso hicimos: Fable 5 es el proponente de visión por defecto de nuestro panel de consenso visual. (Una decisión de producto deliberada, tomada con base en el piloto.) No está en nuestros grupos de jueces de texto — su tarea aquí es mirar imágenes, no puntuar texto.

La referencia de hoy: 300 imágenes, medidas en vivo

Un piloto es algo pequeño. Así que sometimos al modelo a una ejecución mayor y publicamos el resultado, en vivo, en nuestro benchmark de visión-QC.

El 10 de junio de 2026, contra el conjunto de datos mediaqc-v3-2026-06-10 de 300 imágenes, Fable 5 en solitario obtuvo:

  • 66,9% de exhaustividad — la proporción de defectos reales que detectó. Empató como el mejor resultado individual de la ejecución.
  • 7,1% de tasa de falsas alarmas — con qué frecuencia marcó una imagen limpia. Otro modelo de visión fuerte, en la misma ejecución, estuvo más del doble de alto — exactamente la diferencia que decide si un paso de control de calidad ahorra o malgasta tiempo.
  • 60,3% de categoría correcta — casos en que no solo detectó el defecto sino que nombró la categoría adecuada.

Dos tercios de exhaustividad en solitario es útil pero no una historia terminada — de ahí que ejecutemos un panel en lugar de un solo modelo. Con Fable 5 en el panel de consenso, la exhaustividad subió al 87,5%. La estabilidad del proponente da al consejo una base fiable; el consejo cierra la brecha que un solo modelo deja abierta.

Razonamiento y código: señal temprana y honesta

En visión es donde tenemos más evidencia. Sobre capacidad general, menos — y lo decimos sin rodeos.

En una evaluación interna el 9 de junio de 2026 — un arnés de 682 pruebas que pasamos a varios modelos — los resultados de Fable 5 se separaron con nitidez: obtuvo 91% y 73% en las dos mitades del arnés, donde los modelos de comparación obtuvieron 3% y 0% en las mismas tareas. Una brecha grande, que tratamos como señal fuerte y no como veredicto cerrado, porque un solo arnés puede favorecer o castigar a un modelo.

Nuestra primera ejecución de inteligencia en la plataforma, hoy, devolvió una puntuación de razonamiento de 100 y una de código de 97. Preliminares — una sola ejecución, n=1. Las reportamos porque ocultar cifras tempranas es su propia forma de deshonestidad, pero una ejecución es una ejecución. Sigue la clasificación a medida que crezca la muestra.

Para qué sirve la variante de contexto 1M

La variante claude-fable-5[1m] existe para los casos en que el cuello de botella es el contexto, no el razonamiento. Una ventana tan amplia permite sostener ante el modelo un conjunto largo de documentos, un gran cuerpo de material de referencia o una interacción extensa, en vez de trocear y esperar que no se pierda nada importante. Junto con la visión, encaja en el trabajo donde el modelo debe razonar sobre mucho material y mirar las imágenes incrustadas en él — informes largos, conjuntos de documentos con figuras, capturas de pantalla en contexto.

Cómo leer estas cifras

Todo lo anterior está medido, fechado y acotado por un tamaño de muestra que hemos nombrado. El piloto de visión-QC fue pequeño; la referencia de 300 imágenes es mayor pero es un conjunto de datos en un día; las cifras de razonamiento y código son tempranas. Preferimos entregarte ese matiz antes que una historia pulida, porque la historia pulida no suele sobrevivir a la siguiente ejecución.

Claude Fable 5 está disponible a través de la pasarela y el catálogo de Tokonomix. Puedes ponerlo ante tus propias imágenes en nuestro benchmark de visión-QC o seguirlo en distintas tareas en la clasificación.

Última prueba automática
14 sept 2026 · 20:02 UTC · Benchmark de velocidad
Latencia P50
2913 ms
Latencia P95
3228 ms
Errores
0 / 6 ejecuciones
Última revisión por Equipo Tokonomix·10 de junio de 2026