Aller au contenu
Tier C — Spécialiste
Fonctionne en :FranceCréé en :France
OVH AI Endpoints (GRA)

Mistral-Nemo-Instruct-2407

Tier C — Spécialiste

Équipe éditoriale Tokonomix·Relu par Mes Kalkan··
Section 01

Analyse de vitesse

Latence mesurée sur toutes les exécutions de benchmark. P50 (médiane) et P95 (95e percentile) donnent une image réaliste de la vitesse de réponse en charge normale et de pointe.

Latence P50 (médiane)Latence P95100 runs
7456710601553204608-2109-14ms
Section 02

Scores de qualité

Comment ce modèle se situe par rapport au reste du champ sur chaque catégorie de prompts, à partir d'un ajustement par paires sur les mêmes prompts. La note brute du juge figure sous chaque nombre.

42%
Génération de code
moyenne du juge 89
10%
Créatif
moyenne du juge 61
29%
Factuel
moyenne du juge 57
39%
Multilingue
moyenne du juge 89
36%
Raisonnement
moyenne du juge 68

Taux de victoire par catégorie : la fréquence à laquelle ce modèle bat un modèle moyen sur un prompt de cette catégorie. 50% est la moyenne, pas un échec. Ce n'est pas un pourcentage de bonnes réponses.

Section 03

Tarifs

Ce que vous payez par million de tokens en utilisant ce modèle sur Tokonomix, avec une estimation pour une conversation type.

💰
Tarifs API — Mistral-Nemo-Instruct-2407
$0.3400 par 1M de tokens d'entrée
$0.3400 par 1M de tokens de sortie
≈ $0.0003 par conversation typique (800 tokens)
Prix entrée vs sortie (par 1M de tokens)
par 1M de tokens d'entrée$0.3400
par 1M de tokens de sortie$0.3400
Section 04

Tokens par seconde

Débit en tokens par seconde, dérivé de la latence P50 mesurée. Plus haut est mieux ; les fluctuations reflètent la charge côté fournisseur.

Débit (tokens / s)1266 / avg 1641
2651195

Estimé à partir de la latence P50 × 200 tokens de sortie — le chiffre absolu dépend de cette hypothèse ; c'est la tendance qui compte.

Section 05

Capacités

ownedBy: mistralai
Section 06

Disponibilité

Disponibilité

Pas encore de données

Nous n'avons pas encore enregistré suffisamment d'appels API pour afficher les statistiques de disponibilité de ce modèle. Les données apparaîtront dès que le modèle reçoit du trafic en direct.

Section 07

Verdicts benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a20/100 · 1 runs
0 correct1 partial0 wrong0% accuracy
claude-sonnet-4-576/100 · 81 runs
52 correct10 partial19 wrong64% accuracy
2026-09-13

Quality drops 33 points to 49.5 as latency more than doubles

Mistral-Nemo-Instruct-2407 experienced a significant performance regression in this benchmark window, with overall quality declining from 82.6 to 49.5 points. The model's latency deteriorated substantially, with p50 response times increasing from 3969ms to 8587ms, representing a 116% slowdown. Category performance shows mixed results with a dramatic shift in capability distribution. Coding performance declined from 95 to 69 points, though it remains the model's strongest area. Reasoning performance dropped from previous levels to 66 points. Most notably, factual accuracy collapsed to just 14 points, indicating serious issues with knowledge retrieval and accuracy. The multilingual and creative categories, which showed strong scores of 100 and 53 respectively in the previous window, were not measured in this evaluation period. These combined regressions in both quality and speed suggest potential infrastructure issues or model serving problems affecting the OVH AI Endpoints deployment in the GRA region. Users should exercise caution with factual queries and expect significantly slower response times until these issues are investigated and resolved.

Qualité

49.5

Latence p50

8,587 ms

Exécutions de test

5

Quality dropped 33 points Latency doubled to 8.6s Factual accuracy collapsed to 14 Coding performance declined to 69
Dernier test automatisé
14 sept. 2026 · 20:02 UTC · Benchmark de vitesse
Latence P50
158 ms
Latence P95
190 ms
Erreurs
0 / 6 exécutions
Dernière revue par Équipe Tokonomix·14 septembre 2026