El Claude Fable 5 de Anthropic es un modelo de visión y razonamiento, y la variante en la que más nos apoyamos — claude-fable-5[1m] — tiene una ventana de contexto de un millón de tokens. No vamos a recitar una ficha técnica. Lo que sí ofrecemos es algo que la mayoría de los artículos no tiene: cifras de nuestras propias mediciones, con fechas y tamaños de muestra, y una nota honesta donde la evidencia escasea.
Por qué lo convertimos en nuestro proponente de visión por defecto
El 9 de junio de 2026 ejecutamos un piloto de control de calidad de imágenes — un conjunto de imágenes, cada una con un defecto de calidad de medios conocido por detectar, presentadas a varios modelos de visión para comparar su comportamiento. Fable 5 destacó por una cualidad que pesa más que la pura inteligencia: la estabilidad.
A lo largo de pasadas repetidas sobre el conjunto piloto fue idéntico el 88% de las veces, con una tasa de cambio de opinión del 3,9% — rara vez cambiaba de criterio sobre la misma imagen. En ese conjunto produjo cero falsos positivos: no inventó defectos inexistentes. También detectó puntos ciegos que otros modelos del panel pasaron por alto.
La estabilidad es justo lo que se quiere de un proponente. Un modelo que hoy marca un defecto real y mañana ignora la misma imagen es una mala base para un proceso. Uno que responde igual cada vez — y no da falsas alarmas — puede ponerse al frente de un flujo. Eso hicimos: Fable 5 es el proponente de visión por defecto de nuestro panel de consenso visual. (Una decisión de producto deliberada, tomada con base en el piloto.) No está en nuestros grupos de jueces de texto — su tarea aquí es mirar imágenes, no puntuar texto.
La referencia de hoy: 300 imágenes, medidas en vivo
Un piloto es algo pequeño. Así que sometimos al modelo a una ejecución mayor y publicamos el resultado, en vivo, en nuestro benchmark de visión-QC.
El 10 de junio de 2026, contra el conjunto de datos mediaqc-v3-2026-06-10 de 300 imágenes, Fable 5 en solitario obtuvo:
- 66,9% de exhaustividad — la proporción de defectos reales que detectó. Empató como el mejor resultado individual de la ejecución.
- 7,1% de tasa de falsas alarmas — con qué frecuencia marcó una imagen limpia. Otro modelo de visión fuerte, en la misma ejecución, estuvo más del doble de alto — exactamente la diferencia que decide si un paso de control de calidad ahorra o malgasta tiempo.
- 60,3% de categoría correcta — casos en que no solo detectó el defecto sino que nombró la categoría adecuada.
Dos tercios de exhaustividad en solitario es útil pero no una historia terminada — de ahí que ejecutemos un panel en lugar de un solo modelo. Con Fable 5 en el panel de consenso, la exhaustividad subió al 87,5%. La estabilidad del proponente da al consejo una base fiable; el consejo cierra la brecha que un solo modelo deja abierta.
Razonamiento y código: señal temprana y honesta
En visión es donde tenemos más evidencia. Sobre capacidad general, menos — y lo decimos sin rodeos.
En una evaluación interna el 9 de junio de 2026 — un arnés de 682 pruebas que pasamos a varios modelos — los resultados de Fable 5 se separaron con nitidez: obtuvo 91% y 73% en las dos mitades del arnés, donde los modelos de comparación obtuvieron 3% y 0% en las mismas tareas. Una brecha grande, que tratamos como señal fuerte y no como veredicto cerrado, porque un solo arnés puede favorecer o castigar a un modelo.
Nuestra primera ejecución de inteligencia en la plataforma, hoy, devolvió una puntuación de razonamiento de 100 y una de código de 97. Preliminares — una sola ejecución, n=1. Las reportamos porque ocultar cifras tempranas es su propia forma de deshonestidad, pero una ejecución es una ejecución. Sigue la clasificación a medida que crezca la muestra.
Para qué sirve la variante de contexto 1M
La variante claude-fable-5[1m] existe para los casos en que el cuello de botella es el contexto, no el razonamiento. Una ventana tan amplia permite sostener ante el modelo un conjunto largo de documentos, un gran cuerpo de material de referencia o una interacción extensa, en vez de trocear y esperar que no se pierda nada importante. Junto con la visión, encaja en el trabajo donde el modelo debe razonar sobre mucho material y mirar las imágenes incrustadas en él — informes largos, conjuntos de documentos con figuras, capturas de pantalla en contexto.
Cómo leer estas cifras
Todo lo anterior está medido, fechado y acotado por un tamaño de muestra que hemos nombrado. El piloto de visión-QC fue pequeño; la referencia de 300 imágenes es mayor pero es un conjunto de datos en un día; las cifras de razonamiento y código son tempranas. Preferimos entregarte ese matiz antes que una historia pulida, porque la historia pulida no suele sobrevivir a la siguiente ejecución.
Claude Fable 5 está disponible a través de la pasarela y el catálogo de Tokonomix. Puedes ponerlo ante tus propias imágenes en nuestro benchmark de visión-QC o seguirlo en distintas tareas en la clasificación.