Analyse de vitesse
Latence mesurée sur toutes les exécutions de benchmark. P50 (médiane) et P95 (95e percentile) donnent une image réaliste de la vitesse de réponse en charge normale et de pointe.
Scores de qualité
Comment ce modèle se situe par rapport au reste du champ sur chaque catégorie de prompts, à partir d'un ajustement par paires sur les mêmes prompts. La note brute du juge figure sous chaque nombre.
Taux de victoire par catégorie : la fréquence à laquelle ce modèle bat un modèle moyen sur un prompt de cette catégorie. 50% est la moyenne, pas un échec. Ce n'est pas un pourcentage de bonnes réponses.
Tarifs
Ce que vous payez par million de tokens en utilisant ce modèle sur Tokonomix, avec une estimation pour une conversation type.
Tokens par seconde
Débit en tokens par seconde, dérivé de la latence P50 mesurée. Plus haut est mieux ; les fluctuations reflètent la charge côté fournisseur.
Estimé à partir de la latence P50 × 200 tokens de sortie — le chiffre absolu dépend de cette hypothèse ; c'est la tendance qui compte.
Capacités
Disponibilité
Disponibilité
La fréquence à laquelle ce modèle répond lorsqu'on l'appelle — mesurée sur de vraies requêtes API et des tests en direct au cours des 30 derniers jours. C'est indépendant de la qualité : ces chiffres indiquent seulement si le modèle répond, pas la qualité de sa réponse.
7 derniers jours
100.0%
n=19
30 derniers jours
100.0%
n=22
Temps de réponse médian
4,604ms
n=22
Basé sur 407 mesures au cours des 30 derniers jours.
Détails techniques
Seuls les vrais appels API et les requêtes de test en direct sont comptés — les sondes internes et les benchmarks sont exclus.
Les appels avec une clé API personnalisée (BYOK) sont exclus : ces échecs sont spécifiques à la clé, pas un signe de défaillance du modèle.
Les appels échoués ne sont PAS inclus dans les scores de qualité — la qualité est mesurée uniquement sur les réponses réussies. Disponibilité et qualité sont des signaux indépendants.
Temps de réponse médian (p50) sur les appels réussis avec une durée enregistrée. Les valeurs extrêmes influencent moins la médiane que la moyenne.
Total des appels (30d)
22
Réponses OK (30d)
22
Total des appels (7d)
19
Réponses OK (7d)
19
Verdicts benchmark Tokonomix
Quality drops 13.3 points to 78.7 amid latency and scoring shifts
Meta-Llama-3_3-70B-Instruct shows notable performance degradation in this benchmark window, with the overall quality score falling from 92.0 to 78.7. The median latency increased by 45 percent, rising from 8405 ms to 12224 ms, indicating slower response times that may impact user experience. Category performance reveals mixed results with reasoning maintaining exceptional performance at 100, while coding capability declined from 92 to 83. The factual accuracy score of 53 represents a concerning weakness, though this metric was not measured in the previous window. Previously strong multilingual and creative scores are absent from current testing, making direct comparison challenging. The model continues to demonstrate solid reasoning capabilities and acceptable coding performance, but the substantial drop in overall quality combined with increased latency suggests potential infrastructure or configuration changes. Users should expect longer wait times and may encounter reduced accuracy in factual tasks. The reasoning category remains a strength worth noting, but the overall trajectory indicates this benchmark window represents a step backward for the model's performance on the OVH AI Endpoints platform.
Qualité
78.7
Latence p50
12,224 ms
Exécutions de test
5
Meta-Llama-3_3-70B-Instruct
par OVH AI Endpoints (GRA)
- Sortie
- 6 décembre 2024
- Fenêtre de contexte
- — tokens
- Prix d'entrée
- $1.31 / 1M
- Prix de sortie
- $1.31 / 1M
- Tier
- Tier B — Production
- Modalité
- Texte
- Type d'API
- REST · streaming
- Exécutions benchmark
- 522
Plus de OVH AI Endpoints (GRA)