Naar inhoud
Tier B — Productie
Draait in:FranceGemaakt in:United States
OVH AI Endpoints (GRA)

Meta-Llama-3_3-70B-Instruct

Tier B — Productie

Tokonomix-redactie·Gecontroleerd door Mes Kalkan··
Sectie 01

Snelheidsanalyse

Latency gemeten over alle benchmark-runs. P50 (mediaan) en P95 (95e percentiel) geven een realistisch beeld van de responssnelheid onder normale en piekbelasting.

P50 latency (mediaan)P95 latency100 runs
90128424793673486708-2109-14ms
Sectie 02

Kwaliteitsscores

Hoe dit model zich per promptcategorie verhoudt tot de rest van het veld, uit een paarsgewijze berekening over dezelfde prompts. Het ruwe jurycijfer staat onder elk getal.

46%
Code generatie
jurygemiddelde 94
69%
Creatief
jurygemiddelde 92
60%
Feitelijk
jurygemiddelde 76
51%
Meertaligheid
jurygemiddelde 97
74%
Redeneren
jurygemiddelde 99

Winstpercentage per categorie: hoe vaak dit model een gemiddeld model verslaat op een prompt uit die categorie. 50% is gemiddeld, geen onvoldoende. Het is geen percentage goede antwoorden.

Sectie 03

Prijzen

Wat je per miljoen tokens betaalt als je dit model via Tokonomix gebruikt, plus een schatting voor een gemiddeld gesprek.

💰
API-tarieven — Meta-Llama-3_3-70B-Instruct
$1.31 per 1M input-tokens
$1.31 per 1M output-tokens
≈ $0.0010 per typisch gesprek (800 tokens)
Input vs output prijs (per 1M tokens)
per 1M input-tokens$1.31
per 1M output-tokens$1.31
Sectie 04

Tokens per seconde

Doorvoersnelheid in tokens per seconde, afgeleid uit gemeten P50-latency. Hogere waarden zijn beter; fluctuaties weerspiegelen serverbelasting bij de provider.

Doorvoer (tokens / s)1471 / avg 1469
2200231

Geschat uit P50-latency × 200 output-tokens — het absolute getal hangt af van deze aanname; de trend is wat telt.

Sectie 05

Mogelijkheden

ownedBy: meta-llama
Sectie 06

Beschikbaarheid

Beschikbaarheid

Hoe vaak dit model antwoordt als we het aanroepen — gemeten over echte API-aanvragen en live-tests in de afgelopen 30 dagen. Dit staat los van kwaliteit: deze cijfers laten alleen zien of het model reageert, niet hoe goed het antwoord is.

Afgelopen 7 dagen

100.0%

n=19

Afgelopen 30 dagen

100.0%

n=22

Mediane responstijd

4,604ms

n=22

Gebaseerd op 407 metingen in de afgelopen 30 dagen.

Technische details

Alleen echte API-aanroepen en live-testverzoeken tellen mee — interne probes en benchmarkruns zijn uitgesloten.

Aanroepen met een eigen API-sleutel (BYOK) zijn uitgesloten: die fouten zijn sleutelspecifiek en geen teken van modelneergang.

Mislukte aanroepen worden NIET meegeteld in kwaliteitsscores — kwaliteit wordt gemeten op geslaagde responses. Beschikbaarheid en kwaliteit zijn onafhankelijke signalen.

Mediane responstijd (p50) over geslaagde aanroepen met een vastgelegde duur. Uitschieters trekken de mediaan minder dan het gemiddelde.

Totaal aanroepen (30d)

22

OK-reacties (30d)

22

Totaal aanroepen (7d)

19

OK-reacties (7d)

19

Sectie 07

Tokonomix benchmark-oordelen

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-592/100 · 83 runs
74 correct4 partial5 wrong89% accuracy
2026-09-13

Quality drops 13.3 points to 78.7 amid latency and scoring shifts

Meta-Llama-3_3-70B-Instruct shows notable performance degradation in this benchmark window, with the overall quality score falling from 92.0 to 78.7. The median latency increased by 45 percent, rising from 8405 ms to 12224 ms, indicating slower response times that may impact user experience. Category performance reveals mixed results with reasoning maintaining exceptional performance at 100, while coding capability declined from 92 to 83. The factual accuracy score of 53 represents a concerning weakness, though this metric was not measured in the previous window. Previously strong multilingual and creative scores are absent from current testing, making direct comparison challenging. The model continues to demonstrate solid reasoning capabilities and acceptable coding performance, but the substantial drop in overall quality combined with increased latency suggests potential infrastructure or configuration changes. Users should expect longer wait times and may encounter reduced accuracy in factual tasks. The reasoning category remains a strength worth noting, but the overall trajectory indicates this benchmark window represents a step backward for the model's performance on the OVH AI Endpoints platform.

Kwaliteit

78.7

Latency p50

12,224 ms

Testruns

5

Quality dropped 13.3 points Latency increased 45% Reasoning score perfect at 100 Factual accuracy low at 53
Laatste automatische test
14 sep 2026 · 20:02 UTC · Snelheidstest
P50 latency
136 ms
P95 latency
138 ms
Fouten
0 / 6 runs
Laatst beoordeeld door Tokonomix-team·14 september 2026