Geschwindigkeitsanalyse
Latenz über alle Benchmark-Läufe gemessen. P50 (Median) und P95 (95. Perzentil) zeigen ein realistisches Bild der Antwortgeschwindigkeit bei normaler und Spitzenlast.
Qualitätswerte
Wie sich dieses Modell je Prompt-Kategorie zum übrigen Feld verhält, aus einem paarweisen Fit über dieselben Prompts. Die rohe Jury-Wertung steht unter jeder Zahl.
Gewinnrate je Kategorie: wie oft dieses Modell ein durchschnittliches Modell bei einem Prompt dieser Kategorie schlägt. 50% ist der Durchschnitt, keine schlechte Note. Es ist kein Prozentsatz richtiger Antworten.
Preisverlauf
Direkte Provider-Tarife pro Million Tokens, plus eine typische Gesprächskostenschätzung.
Pricing over time
Input & output per 1M tokens · step-line = price changes
$0.6700
input / 1M
— stable
$0.6700
output / 1M
— stable
Tokens pro Sekunde
Durchsatz in Tokens pro Sekunde, abgeleitet aus gemessener P50-Latenz. Höhere Werte sind besser; Schwankungen spiegeln die Provider-seitige Last wider.
Geschätzt aus P50-Latenz × 200 Output-Tokens — die absolute Zahl hängt von dieser Annahme ab; entscheidend ist der Trend.
Fähigkeiten
Verfügbarkeit
Verfügbarkeit
Noch keine Messdaten
Es wurden noch nicht genug API-Aufrufe aufgezeichnet, um Verfügbarkeitsstatistiken für dieses Modell anzuzeigen. Daten erscheinen, sobald das Modell Live-Traffic erhält.
Tokonomix-Benchmark-Urteile
Quality rebounds 9.8 points to 85.3 with strong factual recovery
Meta-Llama-3.3-70B-Instruct demonstrates significant recovery in this benchmark window, climbing from 75.5 to 85.3 in overall quality. The most dramatic improvement comes in factual performance, which surged from 54 to a perfect 100, completely reversing the previous period's sharp decline. Coding capability also advanced from 81 to 92, showing solid progression. Reasoning performance debuts at an impressive 96, indicating strong logical processing capabilities. However, creative output presents a concerning new weakness at just 53, representing a notable gap in the model's capabilities. Multilingual support, previously measured at 92, was not evaluated in the current window. Latency improved modestly from 8442ms to 7416ms at the median, though response times remain relatively slow for real-time applications. The recovery suggests the previous window's issues may have been temporary, possibly related to infrastructure or configuration problems that have since been resolved. Users can expect reliable performance for technical, factual, and reasoning-heavy tasks, but should be aware of limitations in creative applications. The model appears well-suited for analytical workloads where accuracy and logical processing matter most.
Qualität
85.3
Latenz p50
7,416 ms
Testläufe
5
Meta-Llama-3_3-70B-Instruct
von OVH AI Endpoints (GRA)
- Kontextfenster
- — tokens
- Eingabepreis
- $0.6700 / 1M
- Ausgabepreis
- $0.6700 / 1M
- Tier
- Tier B — Produktion
- Modalität
- Text
- API-Typ
- REST · Streaming
- Benchmark-Läufe
- 474
Mehr von OVH AI Endpoints (GRA)