Ir al contenido
Tier B — Producción
Se ejecuta en:FranceCreado en:France
OVH AI Endpoints (GRA)

Mistral-Small-3.2-24B-Instruct-2506

Tier B — Producción

Equipo editorial Tokonomix·Revisado por Mes Kalkan··
Sección 01

Análisis de velocidad

Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.

Latencia P50 (mediana)Latencia P95100 runs
7036467222107981437408-2109-14ms
Sección 02

Puntuaciones de calidad

Cómo se sitúa este modelo frente al resto del campo en cada categoría de prompts, a partir de un ajuste por pares sobre los mismos prompts. La nota bruta del juez aparece debajo de cada número.

66%
Generación de código
media del juez 98
41%
Creativo
media del juez 86
46%
Factual
media del juez 70
50%
Multilingüe
media del juez 98
61%
Razonamiento
media del juez 96

Tasa de victorias por categoría: con qué frecuencia este modelo vence a un modelo medio en un prompt de esa categoría. 50% es la media, no un suspenso. No es un porcentaje de aciertos.

Sección 03

Precios

Lo que pagas por millón de tokens al usar este modelo en Tokonomix, más una estimación para una conversación típica.

💰
Tarifas API — Mistral-Small-3.2-24B-Instruct-2506
$0.2400 por 1M de tokens de entrada
$0.7300 por 1M de tokens de salida
≈ $0.0003 por conversación típica (800 tokens)
Precio entrada vs salida (por 1M de tokens)
por 1M de tokens de entrada$0.2400
por 1M de tokens de salida$0.7300
Sección 04

Tokens por segundo

Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.

Rendimiento (tokens / s)1149 / avg 1317
282184

Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.

Sección 05

Capacidades

ownedBy: mistralai
Sección 06

Disponibilidad

Disponibilidad

Con qué frecuencia responde este modelo cuando lo llamamos — medido en solicitudes reales de API y pruebas en vivo durante los últimos 30 días. Esto es independiente de la calidad: estos números solo indican si el modelo responde, no qué tan buena es la respuesta.

Últimos 7 días

100.0%

n=819

Últimos 30 días

100.0%

n=2,307

Tiempo de respuesta mediano

1,905ms

n=2,307

Basado en 2,692 mediciones en los últimos 30 días.

Detalles técnicos

Solo cuentan las llamadas reales a la API y las solicitudes de prueba en vivo — las sondas internas y las ejecuciones de referencia están excluidas.

Las llamadas con una clave API propia (BYOK) están excluidas: esos fallos son específicos de la clave, no una señal de inactividad del modelo.

Las llamadas fallidas NO se incluyen en las puntuaciones de calidad — la calidad se mide solo en respuestas exitosas. Disponibilidad y calidad son señales independientes.

Tiempo de respuesta mediano (p50) en llamadas exitosas con una duración registrada. Los valores atípicos afectan menos a la mediana que a la media.

Total de llamadas (30d)

2,307

Respuestas OK (30d)

2,307

Total de llamadas (7d)

819

Respuestas OK (7d)

819

Piloto de calidad de imagen (2026-06-10)

Recall

9.4%

n=300

Falsa alarma

12.1%

n=300

Sección 07

Veredictos del benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-591/100 · 83 runs
73 correct7 partial3 wrong88% accuracy
2026-09-13

Quality plummets 17.1 points to 70.7 amid doubled latency and coverage shift

Mistral-Small-3.2-24B-Instruct-2506 experiences a significant performance decline in this benchmark window, with overall quality dropping from 87.8 to 70.7 points. This 17.1-point decrease represents the continuation of a downward trend observed in the previous period. Latency has deteriorated substantially, with the median response time nearly doubling from 4102ms to 8162ms, a 99% increase that will impact real-world application responsiveness. Category performance reveals an unusual pattern. Coding remains exceptional at 96, maintaining near-perfect scores across both windows. Reasoning achieved a perfect 100 score in current testing. However, factual accuracy collapsed to just 16 points, representing a critical weakness. The benchmark window also shows a shift in category coverage, with multilingual and creative categories from the previous period replaced by factual and reasoning assessments in the current window. The dramatic decline in factual performance combined with significantly slower response times raises concerns about model reliability for knowledge-based tasks. While coding and reasoning capabilities remain strong, the overall trajectory suggests potential infrastructure or configuration issues affecting both speed and accuracy.

Calidad

70.7

Latencia p50

8,162 ms

Ejecuciones de test

5

Quality dropped 17.1 points Latency doubled to 8162ms Factual accuracy critically low Perfect reasoning score achieved
Última prueba automática
14 sept 2026 · 20:02 UTC · Benchmark de velocidad
Latencia P50
174 ms
Latencia P95
691 ms
Errores
0 / 6 ejecuciones
Última revisión por Equipo Tokonomix·14 de septiembre de 2026