Aller au contenu
Tier B — Production
Fonctionne en :FranceCréé en :United States
OVH AI Endpoints (GRA)

Meta-Llama-3_3-70B-Instruct

Tier B — Production

Équipe éditoriale Tokonomix·Relu par Mes Kalkan··
Section 01

Analyse de vitesse

Latence mesurée sur toutes les exécutions de benchmark. P50 (médiane) et P95 (95e percentile) donnent une image réaliste de la vitesse de réponse en charge normale et de pointe.

Latence P50 (médiane)Latence P95105 runs
90172033514981661108-1009-05ms
Section 02

Scores de qualité

Comment ce modèle se situe par rapport au reste du champ sur chaque catégorie de prompts, à partir d'un ajustement par paires sur les mêmes prompts. La note brute du juge figure sous chaque nombre.

45%
Génération de code
moyenne du juge 96
63%
Créatif
moyenne du juge 91
63%
Factuel
moyenne du juge 79
53%
Multilingue
moyenne du juge 98
74%
Raisonnement
moyenne du juge 99

Taux de victoire par catégorie : la fréquence à laquelle ce modèle bat un modèle moyen sur un prompt de cette catégorie. 50% est la moyenne, pas un échec. Ce n'est pas un pourcentage de bonnes réponses.

Section 03

Historique des tarifs

Tarifs directs du fournisseur par million de tokens, plus une estimation du coût d'une conversation typique.

💰
Tarifs API — Meta-Llama-3_3-70B-Instruct
$0.6700 par 1M de tokens d'entrée
$0.6700 par 1M de tokens de sortie
≈ $0.0005 par conversation typique (800 tokens)
Prix entrée vs sortie (par 1M de tokens)
par 1M de tokens d'entrée$0.6700
par 1M de tokens de sortie$0.6700

Pricing over time

Input & output per 1M tokens · step-line = price changes

$0.6700

input / 1M

— stable

$0.6700

output / 1M

— stable

2026-06-142026-07-192026-08-30
Input
Output
Price change
⟳ synced weekly
Section 04

Tokens par seconde

Débit en tokens par seconde, dérivé de la latence P50 mesurée. Plus haut est mieux ; les fluctuations reflètent la charge côté fournisseur.

Débit (tokens / s)1639 / avg 1439
2200231

Estimé à partir de la latence P50 × 200 tokens de sortie — le chiffre absolu dépend de cette hypothèse ; c'est la tendance qui compte.

Section 05

Capacités

ownedBy: meta-llama
Section 06

Disponibilité

Disponibilité

Pas encore de données

Nous n'avons pas encore enregistré suffisamment d'appels API pour afficher les statistiques de disponibilité de ce modèle. Les données apparaîtront dès que le modèle reçoit du trafic en direct.

Section 07

Verdicts benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-593/100 · 73 runs
66 correct3 partial4 wrong90% accuracy
2026-08-30

Quality rebounds 9.8 points to 85.3 with strong factual recovery

Meta-Llama-3.3-70B-Instruct demonstrates significant recovery in this benchmark window, climbing from 75.5 to 85.3 in overall quality. The most dramatic improvement comes in factual performance, which surged from 54 to a perfect 100, completely reversing the previous period's sharp decline. Coding capability also advanced from 81 to 92, showing solid progression. Reasoning performance debuts at an impressive 96, indicating strong logical processing capabilities. However, creative output presents a concerning new weakness at just 53, representing a notable gap in the model's capabilities. Multilingual support, previously measured at 92, was not evaluated in the current window. Latency improved modestly from 8442ms to 7416ms at the median, though response times remain relatively slow for real-time applications. The recovery suggests the previous window's issues may have been temporary, possibly related to infrastructure or configuration problems that have since been resolved. Users can expect reliable performance for technical, factual, and reasoning-heavy tasks, but should be aware of limitations in creative applications. The model appears well-suited for analytical workloads where accuracy and logical processing matter most.

Qualité

85.3

Latence p50

7,416 ms

Exécutions de test

5

Factual score jumped to 100 Quality recovered 9.8 points Creative performance only 53 Latency improved by 1026ms
Dernier test automatisé
5 sept. 2026 · 08:01 UTC · Benchmark de vitesse
Latence P50
122 ms
Latence P95
123 ms
Erreurs
0 / 6 exécutions
Dernière revue par Équipe Tokonomix·5 septembre 2026