Aller au contenu
Tier B — Production
Fonctionne en :FranceCréé en :United States
OVH AI Endpoints (GRA)

Meta-Llama-3_3-70B-Instruct

Tier B — Production

Équipe éditoriale Tokonomix·Relu par Mes Kalkan··
Section 01

Analyse de vitesse

Latence mesurée sur toutes les exécutions de benchmark. P50 (médiane) et P95 (95e percentile) donnent une image réaliste de la vitesse de réponse en charge normale et de pointe.

Latence P50 (médiane)Latence P95100 runs
90128424793673486708-2109-14ms
Section 02

Scores de qualité

Comment ce modèle se situe par rapport au reste du champ sur chaque catégorie de prompts, à partir d'un ajustement par paires sur les mêmes prompts. La note brute du juge figure sous chaque nombre.

46%
Génération de code
moyenne du juge 94
69%
Créatif
moyenne du juge 92
60%
Factuel
moyenne du juge 76
51%
Multilingue
moyenne du juge 97
74%
Raisonnement
moyenne du juge 99

Taux de victoire par catégorie : la fréquence à laquelle ce modèle bat un modèle moyen sur un prompt de cette catégorie. 50% est la moyenne, pas un échec. Ce n'est pas un pourcentage de bonnes réponses.

Section 03

Tarifs

Ce que vous payez par million de tokens en utilisant ce modèle sur Tokonomix, avec une estimation pour une conversation type.

💰
Tarifs API — Meta-Llama-3_3-70B-Instruct
$1.31 par 1M de tokens d'entrée
$1.31 par 1M de tokens de sortie
≈ $0.0010 par conversation typique (800 tokens)
Prix entrée vs sortie (par 1M de tokens)
par 1M de tokens d'entrée$1.31
par 1M de tokens de sortie$1.31
Section 04

Tokens par seconde

Débit en tokens par seconde, dérivé de la latence P50 mesurée. Plus haut est mieux ; les fluctuations reflètent la charge côté fournisseur.

Débit (tokens / s)1471 / avg 1469
2200231

Estimé à partir de la latence P50 × 200 tokens de sortie — le chiffre absolu dépend de cette hypothèse ; c'est la tendance qui compte.

Section 05

Capacités

ownedBy: meta-llama
Section 06

Disponibilité

Disponibilité

La fréquence à laquelle ce modèle répond lorsqu'on l'appelle — mesurée sur de vraies requêtes API et des tests en direct au cours des 30 derniers jours. C'est indépendant de la qualité : ces chiffres indiquent seulement si le modèle répond, pas la qualité de sa réponse.

7 derniers jours

100.0%

n=19

30 derniers jours

100.0%

n=22

Temps de réponse médian

4,604ms

n=22

Basé sur 407 mesures au cours des 30 derniers jours.

Détails techniques

Seuls les vrais appels API et les requêtes de test en direct sont comptés — les sondes internes et les benchmarks sont exclus.

Les appels avec une clé API personnalisée (BYOK) sont exclus : ces échecs sont spécifiques à la clé, pas un signe de défaillance du modèle.

Les appels échoués ne sont PAS inclus dans les scores de qualité — la qualité est mesurée uniquement sur les réponses réussies. Disponibilité et qualité sont des signaux indépendants.

Temps de réponse médian (p50) sur les appels réussis avec une durée enregistrée. Les valeurs extrêmes influencent moins la médiane que la moyenne.

Total des appels (30d)

22

Réponses OK (30d)

22

Total des appels (7d)

19

Réponses OK (7d)

19

Section 07

Verdicts benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-592/100 · 83 runs
74 correct4 partial5 wrong89% accuracy
2026-09-13

Quality drops 13.3 points to 78.7 amid latency and scoring shifts

Meta-Llama-3_3-70B-Instruct shows notable performance degradation in this benchmark window, with the overall quality score falling from 92.0 to 78.7. The median latency increased by 45 percent, rising from 8405 ms to 12224 ms, indicating slower response times that may impact user experience. Category performance reveals mixed results with reasoning maintaining exceptional performance at 100, while coding capability declined from 92 to 83. The factual accuracy score of 53 represents a concerning weakness, though this metric was not measured in the previous window. Previously strong multilingual and creative scores are absent from current testing, making direct comparison challenging. The model continues to demonstrate solid reasoning capabilities and acceptable coding performance, but the substantial drop in overall quality combined with increased latency suggests potential infrastructure or configuration changes. Users should expect longer wait times and may encounter reduced accuracy in factual tasks. The reasoning category remains a strength worth noting, but the overall trajectory indicates this benchmark window represents a step backward for the model's performance on the OVH AI Endpoints platform.

Qualité

78.7

Latence p50

12,224 ms

Exécutions de test

5

Quality dropped 13.3 points Latency increased 45% Reasoning score perfect at 100 Factual accuracy low at 53
Dernier test automatisé
14 sept. 2026 · 20:02 UTC · Benchmark de vitesse
Latence P50
136 ms
Latence P95
138 ms
Erreurs
0 / 6 exécutions
Dernière revue par Équipe Tokonomix·14 septembre 2026