Snelheidsanalyse
Latency gemeten over alle benchmark-runs. P50 (mediaan) en P95 (95e percentiel) geven een realistisch beeld van de responssnelheid onder normale en piekbelasting.
Kwaliteitsscores
Hoe dit model zich per promptcategorie verhoudt tot de rest van het veld, uit een paarsgewijze berekening over dezelfde prompts. Het ruwe jurycijfer staat onder elk getal.
Winstpercentage per categorie: hoe vaak dit model een gemiddeld model verslaat op een prompt uit die categorie. 50% is gemiddeld, geen onvoldoende. Het is geen percentage goede antwoorden.
Prijsgeschiedenis
Directe provider-tarieven per miljoen tokens, plus een typische gespreks-kostschatting.
Pricing over time
Input & output per 1M tokens · step-line = price changes
$0.6700
input / 1M
— stable
$0.6700
output / 1M
— stable
Tokens per seconde
Doorvoersnelheid in tokens per seconde, afgeleid uit gemeten P50-latency. Hogere waarden zijn beter; fluctuaties weerspiegelen serverbelasting bij de provider.
Geschat uit P50-latency × 200 output-tokens — het absolute getal hangt af van deze aanname; de trend is wat telt.
Mogelijkheden
Beschikbaarheid
Beschikbaarheid
Nog geen meetdata
Er zijn nog niet genoeg API-aanroepen geregistreerd om beschikbaarheidsstatistieken voor dit model te tonen. Data verschijnt zodra het model live verkeer ontvangt.
Tokonomix benchmark-oordelen
Quality rebounds 9.8 points to 85.3 with strong factual recovery
Meta-Llama-3.3-70B-Instruct demonstrates significant recovery in this benchmark window, climbing from 75.5 to 85.3 in overall quality. The most dramatic improvement comes in factual performance, which surged from 54 to a perfect 100, completely reversing the previous period's sharp decline. Coding capability also advanced from 81 to 92, showing solid progression. Reasoning performance debuts at an impressive 96, indicating strong logical processing capabilities. However, creative output presents a concerning new weakness at just 53, representing a notable gap in the model's capabilities. Multilingual support, previously measured at 92, was not evaluated in the current window. Latency improved modestly from 8442ms to 7416ms at the median, though response times remain relatively slow for real-time applications. The recovery suggests the previous window's issues may have been temporary, possibly related to infrastructure or configuration problems that have since been resolved. Users can expect reliable performance for technical, factual, and reasoning-heavy tasks, but should be aware of limitations in creative applications. The model appears well-suited for analytical workloads where accuracy and logical processing matter most.
Kwaliteit
85.3
Latency p50
7,416 ms
Testruns
5
Meta-Llama-3_3-70B-Instruct
door OVH AI Endpoints (GRA)
- Contextvenster
- — tokens
- Inputprijs
- $0.6700 / 1M
- Outputprijs
- $0.6700 / 1M
- Tier
- Tier B — Productie
- Modaliteit
- Tekst
- API-type
- REST · streaming
- Benchmark-runs
- 474
Meer van OVH AI Endpoints (GRA)