Naar inhoud
Tier B — Productie
Draait in:FranceGemaakt in:China
OVH AI Endpoints (GRA)

Qwen2.5-VL-72B-Instruct

Tier B — Productie

Tokonomix-redactie·Gecontroleerd door Mes Kalkan··
Sectie 01

Snelheidsanalyse

Latency gemeten over alle benchmark-runs. P50 (mediaan) en P95 (95e percentiel) geven een realistisch beeld van de responssnelheid onder normale en piekbelasting.

P50 latency (mediaan)P95 latency100 runs
923102611291211213108-2109-14ms
Sectie 02

Kwaliteitsscores

Hoe dit model zich per promptcategorie verhoudt tot de rest van het veld, uit een paarsgewijze berekening over dezelfde prompts. Het ruwe jurycijfer staat onder elk getal.

56%
Code generatie
jurygemiddelde 97
65%
Creatief
jurygemiddelde 90
33%
Feitelijk
jurygemiddelde 70
52%
Meertaligheid
jurygemiddelde 97
74%
Redeneren
jurygemiddelde 99

Winstpercentage per categorie: hoe vaak dit model een gemiddeld model verslaat op een prompt uit die categorie. 50% is gemiddeld, geen onvoldoende. Het is geen percentage goede antwoorden.

Sectie 03

Prijzen

Wat je per miljoen tokens betaalt als je dit model via Tokonomix gebruikt, plus een schatting voor een gemiddeld gesprek.

💰
API-tarieven — Qwen2.5-VL-72B-Instruct
$1.78 per 1M input-tokens
$1.78 per 1M output-tokens
≈ $0.0014 per typisch gesprek (800 tokens)
Input vs output prijs (per 1M tokens)
per 1M input-tokens$1.78
per 1M output-tokens$1.78
Sectie 04

Tokens per seconde

Doorvoersnelheid in tokens per seconde, afgeleid uit gemeten P50-latency. Hogere waarden zijn beter; fluctuaties weerspiegelen serverbelasting bij de provider.

Doorvoer (tokens / s)1379 / avg 1314
213619

Geschat uit P50-latency × 200 output-tokens — het absolute getal hangt af van deze aanname; de trend is wat telt.

Sectie 05

Mogelijkheden

visionownedBy: Qwen
Sectie 06

Beschikbaarheid

Beschikbaarheid

Nog geen meetdata

Er zijn nog niet genoeg API-aanroepen geregistreerd om beschikbaarheidsstatistieken voor dit model te tonen. Data verschijnt zodra het model live verkeer ontvangt.

Sectie 07

Tokonomix benchmark-oordelen

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-592/100 · 82 runs
71 correct9 partial2 wrong87% accuracy
2026-09-13

Vision capability confirmed, stable quality and latency maintained

Qwen2.5-VL-72B-Instruct through OVH AI Endpoints continues to demonstrate stable performance in its second benchmark window with vision capabilities. The model maintains its quality score of 93.3, showing consistency in response accuracy and helpfulness. Average latency remains steady at 15.3 seconds, indicating reliable performance characteristics for this multimodal model. The vision capability, newly detected in the previous window, is now confirmed as an established feature of this endpoint. Users can expect dependable performance for both text and visual understanding tasks. The model serves as a capable option for applications requiring vision-language understanding with predictable response times. While no improvements are observed in this window, the lack of degradation in either quality or speed suggests stable infrastructure and model serving. Organizations evaluating this endpoint can rely on the consistent metrics for capacity planning. The 93.3 quality score positions this model competitively for production workloads requiring multimodal capabilities, though users should consider the 15.3-second latency when designing time-sensitive applications.

Kwaliteit

Latency p50

Testruns

0

Quality stable at 93.3 Latency consistent at 15.3s Vision capability confirmed
Laatste automatische test
14 sep 2026 · 20:02 UTC · Snelheidstest
P50 latency
145 ms
P95 latency
394 ms
Fouten
0 / 6 runs
Laatst beoordeeld door Tokonomix-team·14 september 2026