Snelheidsanalyse
Latency gemeten over alle benchmark-runs. P50 (mediaan) en P95 (95e percentiel) geven een realistisch beeld van de responssnelheid onder normale en piekbelasting.
Kwaliteitsscores
Hoe dit model zich per promptcategorie verhoudt tot de rest van het veld, uit een paarsgewijze berekening over dezelfde prompts. Het ruwe jurycijfer staat onder elk getal.
Winstpercentage per categorie: hoe vaak dit model een gemiddeld model verslaat op een prompt uit die categorie. 50% is gemiddeld, geen onvoldoende. Het is geen percentage goede antwoorden.
Prijzen
Wat je per miljoen tokens betaalt als je dit model via Tokonomix gebruikt, plus een schatting voor een gemiddeld gesprek.
Tokens per seconde
Doorvoersnelheid in tokens per seconde, afgeleid uit gemeten P50-latency. Hogere waarden zijn beter; fluctuaties weerspiegelen serverbelasting bij de provider.
Geschat uit P50-latency × 200 output-tokens — het absolute getal hangt af van deze aanname; de trend is wat telt.
Mogelijkheden
Beschikbaarheid
Beschikbaarheid
Hoe vaak dit model antwoordt als we het aanroepen — gemeten over echte API-aanvragen en live-tests in de afgelopen 30 dagen. Dit staat los van kwaliteit: deze cijfers laten alleen zien of het model reageert, niet hoe goed het antwoord is.
Afgelopen 7 dagen
100.0%
n=19
Afgelopen 30 dagen
100.0%
n=22
Mediane responstijd
4,604ms
n=22
Gebaseerd op 407 metingen in de afgelopen 30 dagen.
Technische details
Alleen echte API-aanroepen en live-testverzoeken tellen mee — interne probes en benchmarkruns zijn uitgesloten.
Aanroepen met een eigen API-sleutel (BYOK) zijn uitgesloten: die fouten zijn sleutelspecifiek en geen teken van modelneergang.
Mislukte aanroepen worden NIET meegeteld in kwaliteitsscores — kwaliteit wordt gemeten op geslaagde responses. Beschikbaarheid en kwaliteit zijn onafhankelijke signalen.
Mediane responstijd (p50) over geslaagde aanroepen met een vastgelegde duur. Uitschieters trekken de mediaan minder dan het gemiddelde.
Totaal aanroepen (30d)
22
OK-reacties (30d)
22
Totaal aanroepen (7d)
19
OK-reacties (7d)
19
Tokonomix benchmark-oordelen
Quality drops 13.3 points to 78.7 amid latency and scoring shifts
Meta-Llama-3_3-70B-Instruct shows notable performance degradation in this benchmark window, with the overall quality score falling from 92.0 to 78.7. The median latency increased by 45 percent, rising from 8405 ms to 12224 ms, indicating slower response times that may impact user experience. Category performance reveals mixed results with reasoning maintaining exceptional performance at 100, while coding capability declined from 92 to 83. The factual accuracy score of 53 represents a concerning weakness, though this metric was not measured in the previous window. Previously strong multilingual and creative scores are absent from current testing, making direct comparison challenging. The model continues to demonstrate solid reasoning capabilities and acceptable coding performance, but the substantial drop in overall quality combined with increased latency suggests potential infrastructure or configuration changes. Users should expect longer wait times and may encounter reduced accuracy in factual tasks. The reasoning category remains a strength worth noting, but the overall trajectory indicates this benchmark window represents a step backward for the model's performance on the OVH AI Endpoints platform.
Kwaliteit
78.7
Latency p50
12,224 ms
Testruns
5
Meta-Llama-3_3-70B-Instruct
door OVH AI Endpoints (GRA)
- Uitgebracht
- 6 december 2024
- Contextvenster
- — tokens
- Inputprijs
- $1.31 / 1M
- Outputprijs
- $1.31 / 1M
- Tier
- Tier B — Productie
- Modaliteit
- Tekst
- API-type
- REST · streaming
- Benchmark-runs
- 522
Meer van OVH AI Endpoints (GRA)