Analyse de vitesse
Latence mesurée sur toutes les exécutions de benchmark. P50 (médiane) et P95 (95e percentile) donnent une image réaliste de la vitesse de réponse en charge normale et de pointe.
Scores de qualité
Comment ce modèle se situe par rapport au reste du champ sur chaque catégorie de prompts, à partir d'un ajustement par paires sur les mêmes prompts. La note brute du juge figure sous chaque nombre.
Taux de victoire par catégorie : la fréquence à laquelle ce modèle bat un modèle moyen sur un prompt de cette catégorie. 50% est la moyenne, pas un échec. Ce n'est pas un pourcentage de bonnes réponses.
Tarifs
Ce que vous payez par million de tokens en utilisant ce modèle sur Tokonomix, avec une estimation pour une conversation type.
Tokens par seconde
Débit en tokens par seconde, dérivé de la latence P50 mesurée. Plus haut est mieux ; les fluctuations reflètent la charge côté fournisseur.
Estimé à partir de la latence P50 × 200 tokens de sortie — le chiffre absolu dépend de cette hypothèse ; c'est la tendance qui compte.
Capacités
Disponibilité
Disponibilité
La fréquence à laquelle ce modèle répond lorsqu'on l'appelle — mesurée sur de vraies requêtes API et des tests en direct au cours des 30 derniers jours. C'est indépendant de la qualité : ces chiffres indiquent seulement si le modèle répond, pas la qualité de sa réponse.
7 derniers jours
100.0%
n=819
30 derniers jours
100.0%
n=2,307
Temps de réponse médian
1,905ms
n=2,307
Basé sur 2,692 mesures au cours des 30 derniers jours.
Détails techniques
Seuls les vrais appels API et les requêtes de test en direct sont comptés — les sondes internes et les benchmarks sont exclus.
Les appels avec une clé API personnalisée (BYOK) sont exclus : ces échecs sont spécifiques à la clé, pas un signe de défaillance du modèle.
Les appels échoués ne sont PAS inclus dans les scores de qualité — la qualité est mesurée uniquement sur les réponses réussies. Disponibilité et qualité sont des signaux indépendants.
Temps de réponse médian (p50) sur les appels réussis avec une durée enregistrée. Les valeurs extrêmes influencent moins la médiane que la moyenne.
Total des appels (30d)
2,307
Réponses OK (30d)
2,307
Total des appels (7d)
819
Réponses OK (7d)
819
Pilote contrôle qualité image (2026-06-10)
Rappel
9.4%
n=300
Faux positifs
12.1%
n=300
Verdicts benchmark Tokonomix
Quality plummets 17.1 points to 70.7 amid doubled latency and coverage shift
Mistral-Small-3.2-24B-Instruct-2506 experiences a significant performance decline in this benchmark window, with overall quality dropping from 87.8 to 70.7 points. This 17.1-point decrease represents the continuation of a downward trend observed in the previous period. Latency has deteriorated substantially, with the median response time nearly doubling from 4102ms to 8162ms, a 99% increase that will impact real-world application responsiveness. Category performance reveals an unusual pattern. Coding remains exceptional at 96, maintaining near-perfect scores across both windows. Reasoning achieved a perfect 100 score in current testing. However, factual accuracy collapsed to just 16 points, representing a critical weakness. The benchmark window also shows a shift in category coverage, with multilingual and creative categories from the previous period replaced by factual and reasoning assessments in the current window. The dramatic decline in factual performance combined with significantly slower response times raises concerns about model reliability for knowledge-based tasks. While coding and reasoning capabilities remain strong, the overall trajectory suggests potential infrastructure or configuration issues affecting both speed and accuracy.
Qualité
70.7
Latence p50
8,162 ms
Exécutions de test
5
Mistral-Small-3.2-24B-Instruct-2506
par OVH AI Endpoints (GRA)
- Sortie
- 20 juin 2025
- Fenêtre de contexte
- — tokens
- Prix d'entrée
- $0.2400 / 1M
- Prix de sortie
- $0.7300 / 1M
- Tier
- Tier B — Production
- Modalité
- Texte
- Type d'API
- REST · streaming
- Exécutions benchmark
- 522
Plus de OVH AI Endpoints (GRA)