Ir al contenido
Tier A — Frontera
Se ejecuta en:USCreado en:United States

Archivado

Este modelo ha sido descontinuado por el proveedor. Los datos históricos se conservan.

Ya no está disponible desde el 9 de junio de 2027.

Anthropic

Claude Fable 5

Tier A — Frontera · 1M tokens

Equipo editorial Tokonomix·Revisado por Mes Kalkan·

Claude Fable 5 es el modelo de visión y razonamiento de Anthropic, con una variante de contexto de un millón de tokens. En nuestro propio piloto de control de calidad de imágenes fue el evaluador más estable que probamos, así que lo convertimos en el proponente de visión por defecto de nuestro panel de consenso visual. Esto es lo que medimos, y lo que no.

Lo que queríamos de un proponente de visión no era inteligencia sino estabilidad — y en nuestro conjunto piloto, Fable 5 fue el más estable.

Piloto de visión-QC de Tokonomix, 9 de junio de 2026
Sección 01

Análisis de velocidad

Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.

Latencia P50 (mediana)Latencia P95101 runs
2251347847055931715808-1609-10ms
Sección 02

Puntuaciones de calidad

Cómo se sitúa este modelo frente al resto del campo en cada categoría de prompts, a partir de un ajuste por pares sobre los mismos prompts. La nota bruta del juez aparece debajo de cada número.

63%
Generación de código
media del juez 97
67%
Creativo
media del juez 89
49%
Factual
media del juez 67
65%
Multilingüe
media del juez 99
68%
Razonamiento
media del juez 98

Tasa de victorias por categoría: con qué frecuencia este modelo vence a un modelo medio en un prompt de esa categoría. 50% es la media, no un suspenso. No es un porcentaje de aciertos.

Sección 03

Historial de precios

Tarifas directas del proveedor por millón de tokens, más una estimación del coste de una conversación típica.

💰
Tarifas API — Claude Fable 5
$10.00 por 1M de tokens de entrada
$50.00 por 1M de tokens de salida
≈ $0.0160 por conversación típica (800 tokens)
Precio entrada vs salida (por 1M de tokens)
por 1M de tokens de entrada$10.00
por 1M de tokens de salida$50.00

Pricing over time

Input & output per 1M tokens · step-line = price changes

$10.00

input / 1M

— stable

$50.00

output / 1M

— stable

2026-06-102026-08-162026-09-06
Input
Output
Price change
⟳ synced weekly
Sección 04

Tokens por segundo

Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.

Rendimiento (tokens / s)56 / avg 57
8830

Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.

Sección 05

Fortalezas & debilidades

Basado en resultados de benchmarks y comentarios agregados de la comunidad sobre casos de uso reales.

Fortalezas

Proponente de visión más estable del piloto (88% idéntico)Baja tasa de falsas alarmas (7,1% en la base de 300 imágenes)Detectó puntos ciegos que otros modelos pasaron por altoVariante de contexto 1M para material largo y rico en imágenes

Debilidades

Exhaustividad solo 66,9% — se necesita un panel para 87,5%Cifras de razonamiento/código tempranas (una ejecución, n=1)
Sección 06

Capacidades

toolssource: manualvisionjson modepdf inputreasoningjson schemamodel class: mythosprompt cachingmax output tokens: 128000
Sección 07

Preguntas frecuentes

En nuestro piloto del 9 de junio de 2026 fue idéntico el 88% de las veces, cambió de opinión solo el 3,9% y produjo cero falsos positivos — la estabilidad que se quiere al frente de un flujo de control de calidad. Una decisión de producto deliberada basada en ese piloto.

Preferimos entregarte el matiz — piloto pequeño, referencia de un día, cifras de razonamiento tempranas — antes que una historia pulida que no sobrevive a la siguiente ejecución.

Redacción de Tokonomix
Sección 08

Disponibilidad

Disponibilidad

Con qué frecuencia responde este modelo cuando lo llamamos — medido en solicitudes reales de API y pruebas en vivo durante los últimos 30 días. Esto es independiente de la calidad: estos números solo indican si el modelo responde, no qué tan buena es la respuesta.

Últimos 7 días

45.5%

n=33

Últimos 30 días

55.0%

n=40

Tiempo de respuesta mediano

12,982ms

n=22

Basado en 422 mediciones en los últimos 30 días.

Detalles técnicos

Solo cuentan las llamadas reales a la API y las solicitudes de prueba en vivo — las sondas internas y las ejecuciones de referencia están excluidas.

Las llamadas con una clave API propia (BYOK) están excluidas: esos fallos son específicos de la clave, no una señal de inactividad del modelo.

Las llamadas fallidas NO se incluyen en las puntuaciones de calidad — la calidad se mide solo en respuestas exitosas. Disponibilidad y calidad son señales independientes.

Tiempo de respuesta mediano (p50) en llamadas exitosas con una duración registrada. Los valores atípicos afectan menos a la mediana que a la media.

Total de llamadas (30d)

40

Respuestas OK (30d)

22

Total de llamadas (7d)

33

Respuestas OK (7d)

15

Piloto de calidad de imagen (2026-06-10)

Recall

66.9%

n=300

Falsa alarma

7.1%

n=300

Sección 09

Veredictos del benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 2 runs
2 correct0 partial0 wrong100% accuracy
claude-sonnet-4-589/100 · 60 runs
51 correct4 partial5 wrong85% accuracy
2026-09-06

Claude Fable 5 adds multimodal features but lacks benchmark performance data

Claude Fable 5 has expanded its technical capabilities significantly since the previous evaluation window, now supporting tools, vision, JSON mode, PDF input, reasoning, JSON schema, and prompt caching. These additions represent a substantial feature set expansion that brings the model in line with contemporary multimodal AI systems. However, for the second consecutive benchmark window, no performance data is available across any standard evaluation metrics. Without scores on language understanding, reasoning, coding, or multimodal tasks, it remains impossible to assess how Claude Fable 5 performs relative to other models or whether the new capabilities deliver meaningful improvements in practical applications. The absence of benchmark data is particularly notable given the model's expanded feature set, as users would typically expect performance validation accompanying such significant capability additions. Organizations considering this model should be aware that while the technical feature list appears comprehensive, independent verification of performance characteristics is not currently possible through standard benchmarking protocols. The continued lack of empirical results across two evaluation periods suggests either limited model availability for testing or potential issues with benchmark compatibility.

Calidad

Latencia p50

Ejecuciones de test

0

Added vision and PDF support New tool and reasoning capabilities No benchmark scores available Performance remains unverified
Sección 10

Perfil completo del modelo

Claude Fable 5: el evaluador más estable que probamos

El Claude Fable 5 de Anthropic es un modelo de visión y razonamiento, y la variante en la que más nos apoyamos — claude-fable-5[1m] — tiene una ventana de contexto de un millón de tokens. No vamos a recitar una ficha técnica. Lo que sí ofrecemos es algo que la mayoría de los artículos no tiene: cifras de nuestras propias mediciones, con fechas y tamaños de muestra, y una nota honesta donde la evidencia escasea.

Por qué lo convertimos en nuestro proponente de visión por defecto

El 9 de junio de 2026 ejecutamos un piloto de control de calidad de imágenes — un conjunto de imágenes, cada una con un defecto de calidad de medios conocido por detectar, presentadas a varios modelos de visión para comparar su comportamiento. Fable 5 destacó por una cualidad que pesa más que la pura inteligencia: la estabilidad.

A lo largo de pasadas repetidas sobre el conjunto piloto fue idéntico el 88% de las veces, con una tasa de cambio de opinión del 3,9% — rara vez cambiaba de criterio sobre la misma imagen. En ese conjunto produjo cero falsos positivos: no inventó defectos inexistentes. También detectó puntos ciegos que otros modelos del panel pasaron por alto.

La estabilidad es justo lo que se quiere de un proponente. Un modelo que hoy marca un defecto real y mañana ignora la misma imagen es una mala base para un proceso. Uno que responde igual cada vez — y no da falsas alarmas — puede ponerse al frente de un flujo. Eso hicimos: Fable 5 es el proponente de visión por defecto de nuestro panel de consenso visual. (Una decisión de producto deliberada, tomada con base en el piloto.) No está en nuestros grupos de jueces de texto — su tarea aquí es mirar imágenes, no puntuar texto.

La referencia de hoy: 300 imágenes, medidas en vivo

Un piloto es algo pequeño. Así que sometimos al modelo a una ejecución mayor y publicamos el resultado, en vivo, en nuestro benchmark de visión-QC.

El 10 de junio de 2026, contra el conjunto de datos mediaqc-v3-2026-06-10 de 300 imágenes, Fable 5 en solitario obtuvo:

  • 66,9% de exhaustividad — la proporción de defectos reales que detectó. Empató como el mejor resultado individual de la ejecución.
  • 7,1% de tasa de falsas alarmas — con qué frecuencia marcó una imagen limpia. Otro modelo de visión fuerte, en la misma ejecución, estuvo más del doble de alto — exactamente la diferencia que decide si un paso de control de calidad ahorra o malgasta tiempo.
  • 60,3% de categoría correcta — casos en que no solo detectó el defecto sino que nombró la categoría adecuada.

Dos tercios de exhaustividad en solitario es útil pero no una historia terminada — de ahí que ejecutemos un panel en lugar de un solo modelo. Con Fable 5 en el panel de consenso, la exhaustividad subió al 87,5%. La estabilidad del proponente da al consejo una base fiable; el consejo cierra la brecha que un solo modelo deja abierta.

Razonamiento y código: señal temprana y honesta

En visión es donde tenemos más evidencia. Sobre capacidad general, menos — y lo decimos sin rodeos.

En una evaluación interna el 9 de junio de 2026 — un arnés de 682 pruebas que pasamos a varios modelos — los resultados de Fable 5 se separaron con nitidez: obtuvo 91% y 73% en las dos mitades del arnés, donde los modelos de comparación obtuvieron 3% y 0% en las mismas tareas. Una brecha grande, que tratamos como señal fuerte y no como veredicto cerrado, porque un solo arnés puede favorecer o castigar a un modelo.

Nuestra primera ejecución de inteligencia en la plataforma, hoy, devolvió una puntuación de razonamiento de 100 y una de código de 97. Preliminares — una sola ejecución, n=1. Las reportamos porque ocultar cifras tempranas es su propia forma de deshonestidad, pero una ejecución es una ejecución. Sigue la clasificación a medida que crezca la muestra.

Para qué sirve la variante de contexto 1M

La variante claude-fable-5[1m] existe para los casos en que el cuello de botella es el contexto, no el razonamiento. Una ventana tan amplia permite sostener ante el modelo un conjunto largo de documentos, un gran cuerpo de material de referencia o una interacción extensa, en vez de trocear y esperar que no se pierda nada importante. Junto con la visión, encaja en el trabajo donde el modelo debe razonar sobre mucho material y mirar las imágenes incrustadas en él — informes largos, conjuntos de documentos con figuras, capturas de pantalla en contexto.

Cómo leer estas cifras

Todo lo anterior está medido, fechado y acotado por un tamaño de muestra que hemos nombrado. El piloto de visión-QC fue pequeño; la referencia de 300 imágenes es mayor pero es un conjunto de datos en un día; las cifras de razonamiento y código son tempranas. Preferimos entregarte ese matiz antes que una historia pulida, porque la historia pulida no suele sobrevivir a la siguiente ejecución.

Claude Fable 5 está disponible a través de la pasarela y el catálogo de Tokonomix. Puedes ponerlo ante tus propias imágenes en nuestro benchmark de visión-QC o seguirlo en distintas tareas en la clasificación.

Última prueba automática
10 sept 2026 · 08:00 UTC · Benchmark de velocidad
Latencia P50
3570 ms
Latencia P95
3768 ms
Errores
0 / 6 ejecuciones
Última revisión por Equipo Tokonomix·10 de junio de 2026