Ir al contenido
Tier C — Especialista
Se ejecuta en:FranceCreado en:France
OVH AI Endpoints (GRA)

Mistral-Nemo-Instruct-2407

Tier C — Especialista

Equipo editorial Tokonomix·Revisado por Mes Kalkan··
Sección 01

Análisis de velocidad

Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.

Latencia P50 (mediana)Latencia P95100 runs
7456710601553204608-2109-14ms
Sección 02

Puntuaciones de calidad

Cómo se sitúa este modelo frente al resto del campo en cada categoría de prompts, a partir de un ajuste por pares sobre los mismos prompts. La nota bruta del juez aparece debajo de cada número.

42%
Generación de código
media del juez 89
10%
Creativo
media del juez 61
29%
Factual
media del juez 57
39%
Multilingüe
media del juez 89
36%
Razonamiento
media del juez 68

Tasa de victorias por categoría: con qué frecuencia este modelo vence a un modelo medio en un prompt de esa categoría. 50% es la media, no un suspenso. No es un porcentaje de aciertos.

Sección 03

Precios

Lo que pagas por millón de tokens al usar este modelo en Tokonomix, más una estimación para una conversación típica.

💰
Tarifas API — Mistral-Nemo-Instruct-2407
$0.3400 por 1M de tokens de entrada
$0.3400 por 1M de tokens de salida
≈ $0.0003 por conversación típica (800 tokens)
Precio entrada vs salida (por 1M de tokens)
por 1M de tokens de entrada$0.3400
por 1M de tokens de salida$0.3400
Sección 04

Tokens por segundo

Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.

Rendimiento (tokens / s)1266 / avg 1641
2651195

Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.

Sección 05

Capacidades

ownedBy: mistralai
Sección 06

Disponibilidad

Disponibilidad

Sin datos todavía

Aún no hemos registrado suficientes llamadas a la API para mostrar estadísticas de disponibilidad de este modelo. Los datos aparecen una vez que el modelo comienza a recibir tráfico en vivo.

Sección 07

Veredictos del benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a20/100 · 1 runs
0 correct1 partial0 wrong0% accuracy
claude-sonnet-4-576/100 · 81 runs
52 correct10 partial19 wrong64% accuracy
2026-09-13

Quality drops 33 points to 49.5 as latency more than doubles

Mistral-Nemo-Instruct-2407 experienced a significant performance regression in this benchmark window, with overall quality declining from 82.6 to 49.5 points. The model's latency deteriorated substantially, with p50 response times increasing from 3969ms to 8587ms, representing a 116% slowdown. Category performance shows mixed results with a dramatic shift in capability distribution. Coding performance declined from 95 to 69 points, though it remains the model's strongest area. Reasoning performance dropped from previous levels to 66 points. Most notably, factual accuracy collapsed to just 14 points, indicating serious issues with knowledge retrieval and accuracy. The multilingual and creative categories, which showed strong scores of 100 and 53 respectively in the previous window, were not measured in this evaluation period. These combined regressions in both quality and speed suggest potential infrastructure issues or model serving problems affecting the OVH AI Endpoints deployment in the GRA region. Users should exercise caution with factual queries and expect significantly slower response times until these issues are investigated and resolved.

Calidad

49.5

Latencia p50

8,587 ms

Ejecuciones de test

5

Quality dropped 33 points Latency doubled to 8.6s Factual accuracy collapsed to 14 Coding performance declined to 69
Última prueba automática
14 sept 2026 · 20:02 UTC · Benchmark de velocidad
Latencia P50
158 ms
Latencia P95
190 ms
Errores
0 / 6 ejecuciones
Última revisión por Equipo Tokonomix·14 de septiembre de 2026