Analyse de vitesse
Latence mesurée sur toutes les exécutions de benchmark. P50 (médiane) et P95 (95e percentile) donnent une image réaliste de la vitesse de réponse en charge normale et de pointe.
Scores de qualité
Comment ce modèle se situe par rapport au reste du champ sur chaque catégorie de prompts, à partir d'un ajustement par paires sur les mêmes prompts. La note brute du juge figure sous chaque nombre.
Taux de victoire par catégorie : la fréquence à laquelle ce modèle bat un modèle moyen sur un prompt de cette catégorie. 50% est la moyenne, pas un échec. Ce n'est pas un pourcentage de bonnes réponses.
Tarifs
Ce que vous payez par million de tokens en utilisant ce modèle sur Tokonomix, avec une estimation pour une conversation type.
Tokens par seconde
Débit en tokens par seconde, dérivé de la latence P50 mesurée. Plus haut est mieux ; les fluctuations reflètent la charge côté fournisseur.
Estimé à partir de la latence P50 × 200 tokens de sortie — le chiffre absolu dépend de cette hypothèse ; c'est la tendance qui compte.
Capacités
Disponibilité
Disponibilité
Pas encore de données
Nous n'avons pas encore enregistré suffisamment d'appels API pour afficher les statistiques de disponibilité de ce modèle. Les données apparaîtront dès que le modèle reçoit du trafic en direct.
Verdicts benchmark Tokonomix
Quality drops 33 points to 49.5 as latency more than doubles
Mistral-Nemo-Instruct-2407 experienced a significant performance regression in this benchmark window, with overall quality declining from 82.6 to 49.5 points. The model's latency deteriorated substantially, with p50 response times increasing from 3969ms to 8587ms, representing a 116% slowdown. Category performance shows mixed results with a dramatic shift in capability distribution. Coding performance declined from 95 to 69 points, though it remains the model's strongest area. Reasoning performance dropped from previous levels to 66 points. Most notably, factual accuracy collapsed to just 14 points, indicating serious issues with knowledge retrieval and accuracy. The multilingual and creative categories, which showed strong scores of 100 and 53 respectively in the previous window, were not measured in this evaluation period. These combined regressions in both quality and speed suggest potential infrastructure issues or model serving problems affecting the OVH AI Endpoints deployment in the GRA region. Users should exercise caution with factual queries and expect significantly slower response times until these issues are investigated and resolved.
Qualité
49.5
Latence p50
8,587 ms
Exécutions de test
5
Mistral-Nemo-Instruct-2407
par OVH AI Endpoints (GRA)
- Fenêtre de contexte
- — tokens
- Prix d'entrée
- $0.3400 / 1M
- Prix de sortie
- $0.3400 / 1M
- Tier
- Tier C — Spécialiste
- Modalité
- Texte
- Type d'API
- REST · streaming
- Exécutions benchmark
- 522
Plus de OVH AI Endpoints (GRA)