Ir al contenido
Tier A — Frontera
Se ejecuta en:USCreado en:United States
Anthropic

Claude Fable 5

Tier A — Frontera · 1M tokens

Equipo editorial Tokonomix·Revisado por Mes Kalkan·

Claude Fable 5 es el modelo de visión y razonamiento de Anthropic, con una variante de contexto de un millón de tokens. En nuestro propio piloto de control de calidad de imágenes fue el evaluador más estable que probamos, así que lo convertimos en el proponente de visión por defecto de nuestro panel de consenso visual. Esto es lo que medimos, y lo que no.

Lo que queríamos de un proponente de visión no era inteligencia sino estabilidad — y en nuestro conjunto piloto, Fable 5 fue el más estable.

Piloto de visión-QC de Tokonomix, 9 de junio de 2026
Sección 01

Historial de precios

Tarifas directas del proveedor por millón de tokens, más una estimación del coste de una conversación típica.

💰
Tarifas API — Claude Fable 5
$10.00 por 1M de tokens de entrada
$50.00 por 1M de tokens de salida
≈ $0.0160 por conversación típica (800 tokens)
Precio entrada vs salida (por 1M de tokens)
por 1M de tokens de entrada$10.00
por 1M de tokens de salida$50.00

Pricing over time

Input & output per 1M tokens · step-line = price changes

$10.00

input / 1M

— stable

$50.00

output / 1M

— stable

2026-06-102026-06-142026-06-14
Input
Output
Price change
⟳ synced weekly
Sección 02

Fortalezas & debilidades

Basado en resultados de benchmarks y comentarios agregados de la comunidad sobre casos de uso reales.

Fortalezas

Proponente de visión más estable del piloto (88% idéntico)Baja tasa de falsas alarmas (7,1% en la base de 300 imágenes)Detectó puntos ciegos que otros modelos pasaron por altoVariante de contexto 1M para material largo y rico en imágenes

Debilidades

Exhaustividad solo 66,9% — se necesita un panel para 87,5%Cifras de razonamiento/código tempranas (una ejecución, n=1)
Sección 03

Capacidades

toolssource: manualvisionjson modepdf inputreasoningjson schemamodel class: mythosprompt cachingmax output tokens: 128000
Sección 04

Preguntas frecuentes

En nuestro piloto del 9 de junio de 2026 fue idéntico el 88% de las veces, cambió de opinión solo el 3,9% y produjo cero falsos positivos — la estabilidad que se quiere al frente de un flujo de control de calidad. Una decisión de producto deliberada basada en ese piloto.

Preferimos entregarte el matiz — piloto pequeño, referencia de un día, cifras de razonamiento tempranas — antes que una historia pulida que no sobrevive a la siguiente ejecución.

Redacción de Tokonomix
Sección 05

Disponibilidad

Disponibilidad

Con qué frecuencia responde este modelo cuando lo llamamos — medido en solicitudes reales de API y pruebas en vivo durante los últimos 30 días. Esto es independiente de la calidad: estos números solo indican si el modelo responde, no qué tan buena es la respuesta.

Últimos 7 días

100.0%

n=1

Últimos 30 días

100.0%

n=1

Tiempo de respuesta mediano

3,294ms

n=1

Basado en 1 mediciones en los últimos 30 días.

Detalles técnicos

Solo cuentan las llamadas reales a la API y las solicitudes de prueba en vivo — las sondas internas y las ejecuciones de referencia están excluidas.

Las llamadas con una clave API propia (BYOK) están excluidas: esos fallos son específicos de la clave, no una señal de inactividad del modelo.

Las llamadas fallidas NO se incluyen en las puntuaciones de calidad — la calidad se mide solo en respuestas exitosas. Disponibilidad y calidad son señales independientes.

Tiempo de respuesta mediano (p50) en llamadas exitosas con una duración registrada. Los valores atípicos afectan menos a la mediana que a la media.

Total de llamadas (30d)

1

Respuestas OK (30d)

1

Total de llamadas (7d)

1

Respuestas OK (7d)

1

Piloto de calidad de imagen (2026-06-10)

Recall

66.9%

n=300

Falsa alarma

7.1%

n=300

Sección 06

Veredictos del benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-591/100 · 25 runs
22 correct1 partial2 wrong88% accuracy
2026-06-14

Claude Fable 5 shows improved coding, but reasoning and factual decline

Claude Fable 5 demonstrates a mixed performance shift from the previous window. The overall quality score decreased from 88.4 to 85.7, driven primarily by notable declines in reasoning and factual accuracy. Reasoning performance dropped significantly from a perfect 100 to 83, representing the most substantial category decline. Factual accuracy also fell from 68 to 60, continuing weakness in this area. However, coding performance improved from 97 to 98, maintaining strength in technical tasks. Latency showed marginal improvement, with p50 decreasing from 8318ms to 7986ms, though this remains relatively slow for real-time applications. The test sample size increased from 5 to 8 runs, providing somewhat greater statistical confidence. No new capabilities were detected in this window, suggesting a focus on performance tuning rather than feature expansion. Users should be aware that while coding tasks remain highly reliable, applications requiring strong reasoning or factual retrieval may see degraded results compared to the previous benchmark period. The overall trend indicates some regression in core capabilities that may warrant attention from development teams relying on this model for production workloads.

Quality

Latency p50

Test runs

0

Reasoning dropped from 100 to 83 Factual accuracy declined to 60 Coding improved slightly to 98 Latency improved to 7986ms
Sección 07

Perfil completo del modelo

Claude Fable 5: el evaluador más estable que probamos

El Claude Fable 5 de Anthropic es un modelo de visión y razonamiento, y la variante en la que más nos apoyamos — claude-fable-5[1m] — tiene una ventana de contexto de un millón de tokens. No vamos a recitar una ficha técnica. Lo que sí ofrecemos es algo que la mayoría de los artículos no tiene: cifras de nuestras propias mediciones, con fechas y tamaños de muestra, y una nota honesta donde la evidencia escasea.

Por qué lo convertimos en nuestro proponente de visión por defecto

El 9 de junio de 2026 ejecutamos un piloto de control de calidad de imágenes — un conjunto de imágenes, cada una con un defecto de calidad de medios conocido por detectar, presentadas a varios modelos de visión para comparar su comportamiento. Fable 5 destacó por una cualidad que pesa más que la pura inteligencia: la estabilidad.

A lo largo de pasadas repetidas sobre el conjunto piloto fue idéntico el 88% de las veces, con una tasa de cambio de opinión del 3,9% — rara vez cambiaba de criterio sobre la misma imagen. En ese conjunto produjo cero falsos positivos: no inventó defectos inexistentes. También detectó puntos ciegos que otros modelos del panel pasaron por alto.

La estabilidad es justo lo que se quiere de un proponente. Un modelo que hoy marca un defecto real y mañana ignora la misma imagen es una mala base para un proceso. Uno que responde igual cada vez — y no da falsas alarmas — puede ponerse al frente de un flujo. Eso hicimos: Fable 5 es el proponente de visión por defecto de nuestro panel de consenso visual. (Una decisión de producto deliberada, tomada con base en el piloto.) No está en nuestros grupos de jueces de texto — su tarea aquí es mirar imágenes, no puntuar texto.

La referencia de hoy: 300 imágenes, medidas en vivo

Un piloto es algo pequeño. Así que sometimos al modelo a una ejecución mayor y publicamos el resultado, en vivo, en nuestro benchmark de visión-QC.

El 10 de junio de 2026, contra el conjunto de datos mediaqc-v3-2026-06-10 de 300 imágenes, Fable 5 en solitario obtuvo:

  • 66,9% de exhaustividad — la proporción de defectos reales que detectó. Empató como el mejor resultado individual de la ejecución.
  • 7,1% de tasa de falsas alarmas — con qué frecuencia marcó una imagen limpia. Otro modelo de visión fuerte, en la misma ejecución, estuvo más del doble de alto — exactamente la diferencia que decide si un paso de control de calidad ahorra o malgasta tiempo.
  • 60,3% de categoría correcta — casos en que no solo detectó el defecto sino que nombró la categoría adecuada.

Dos tercios de exhaustividad en solitario es útil pero no una historia terminada — de ahí que ejecutemos un panel en lugar de un solo modelo. Con Fable 5 en el panel de consenso, la exhaustividad subió al 87,5%. La estabilidad del proponente da al consejo una base fiable; el consejo cierra la brecha que un solo modelo deja abierta.

Razonamiento y código: señal temprana y honesta

En visión es donde tenemos más evidencia. Sobre capacidad general, menos — y lo decimos sin rodeos.

En una evaluación interna el 9 de junio de 2026 — un arnés de 682 pruebas que pasamos a varios modelos — los resultados de Fable 5 se separaron con nitidez: obtuvo 91% y 73% en las dos mitades del arnés, donde los modelos de comparación obtuvieron 3% y 0% en las mismas tareas. Una brecha grande, que tratamos como señal fuerte y no como veredicto cerrado, porque un solo arnés puede favorecer o castigar a un modelo.

Nuestra primera ejecución de inteligencia en la plataforma, hoy, devolvió una puntuación de razonamiento de 100 y una de código de 97. Preliminares — una sola ejecución, n=1. Las reportamos porque ocultar cifras tempranas es su propia forma de deshonestidad, pero una ejecución es una ejecución. Sigue la clasificación a medida que crezca la muestra.

Para qué sirve la variante de contexto 1M

La variante claude-fable-5[1m] existe para los casos en que el cuello de botella es el contexto, no el razonamiento. Una ventana tan amplia permite sostener ante el modelo un conjunto largo de documentos, un gran cuerpo de material de referencia o una interacción extensa, en vez de trocear y esperar que no se pierda nada importante. Junto con la visión, encaja en el trabajo donde el modelo debe razonar sobre mucho material y mirar las imágenes incrustadas en él — informes largos, conjuntos de documentos con figuras, capturas de pantalla en contexto.

Cómo leer estas cifras

Todo lo anterior está medido, fechado y acotado por un tamaño de muestra que hemos nombrado. El piloto de visión-QC fue pequeño; la referencia de 300 imágenes es mayor pero es un conjunto de datos en un día; las cifras de razonamiento y código son tempranas. Preferimos entregarte ese matiz antes que una historia pulida, porque la historia pulida no suele sobrevivir a la siguiente ejecución.

Claude Fable 5 está disponible a través de la pasarela y el catálogo de Tokonomix. Puedes ponerlo ante tus propias imágenes en nuestro benchmark de visión-QC o seguirlo en distintas tareas en la clasificación.

Última prueba automática
25 jul 2026 · 02:02 UTC · Benchmark de velocidad
Latencia P50
2990 ms
Latencia P95
3377 ms
Errores
0 / 6 ejecuciones
Última revisión por Equipo Tokonomix·10 de junio de 2026