Zum Inhalt
Tier B — Produktion
Läuft in:FranceErstellt in:China
OVH AI Endpoints (GRA)

Qwen2.5-VL-72B-Instruct

Tier B — Produktion

Tokonomix-Redaktionsteam·Geprüft von Mes Kalkan··
Abschnitt 01

Geschwindigkeitsanalyse

Latenz über alle Benchmark-Läufe gemessen. P50 (Median) und P95 (95. Perzentil) zeigen ein realistisches Bild der Antwortgeschwindigkeit bei normaler und Spitzenlast.

P50-Latenz (Median)P95-Latenz100 runs
923102611291211213108-2109-14ms
Abschnitt 02

Qualitätswerte

Wie sich dieses Modell je Prompt-Kategorie zum übrigen Feld verhält, aus einem paarweisen Fit über dieselben Prompts. Die rohe Jury-Wertung steht unter jeder Zahl.

56%
Codegenerierung
Jury-Mittel 97
65%
Kreativ
Jury-Mittel 90
33%
Faktisch
Jury-Mittel 70
52%
Mehrsprachig
Jury-Mittel 97
74%
Schlussfolgern
Jury-Mittel 99

Gewinnrate je Kategorie: wie oft dieses Modell ein durchschnittliches Modell bei einem Prompt dieser Kategorie schlägt. 50% ist der Durchschnitt, keine schlechte Note. Es ist kein Prozentsatz richtiger Antworten.

Abschnitt 03

Preise

Was Sie pro Million Tokens zahlen, wenn Sie dieses Modell über Tokonomix nutzen, plus eine Schätzung für ein typisches Gespräch.

💰
API-Tarife — Qwen2.5-VL-72B-Instruct
$1.78 pro 1M Input-Tokens
$1.78 pro 1M Output-Tokens
≈ $0.0014 pro typischem Gespräch (800 Tokens)
Input- vs. Output-Preis (pro 1M Tokens)
pro 1M Input-Tokens$1.78
pro 1M Output-Tokens$1.78
Abschnitt 04

Tokens pro Sekunde

Durchsatz in Tokens pro Sekunde, abgeleitet aus gemessener P50-Latenz. Höhere Werte sind besser; Schwankungen spiegeln die Provider-seitige Last wider.

Durchsatz (Tokens / s)1379 / avg 1314
213619

Geschätzt aus P50-Latenz × 200 Output-Tokens — die absolute Zahl hängt von dieser Annahme ab; entscheidend ist der Trend.

Abschnitt 05

Fähigkeiten

visionownedBy: Qwen
Abschnitt 06

Verfügbarkeit

Verfügbarkeit

Noch keine Messdaten

Es wurden noch nicht genug API-Aufrufe aufgezeichnet, um Verfügbarkeitsstatistiken für dieses Modell anzuzeigen. Daten erscheinen, sobald das Modell Live-Traffic erhält.

Abschnitt 07

Tokonomix-Benchmark-Urteile

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-592/100 · 82 runs
71 correct9 partial2 wrong87% accuracy
2026-09-13

Vision capability confirmed, stable quality and latency maintained

Qwen2.5-VL-72B-Instruct through OVH AI Endpoints continues to demonstrate stable performance in its second benchmark window with vision capabilities. The model maintains its quality score of 93.3, showing consistency in response accuracy and helpfulness. Average latency remains steady at 15.3 seconds, indicating reliable performance characteristics for this multimodal model. The vision capability, newly detected in the previous window, is now confirmed as an established feature of this endpoint. Users can expect dependable performance for both text and visual understanding tasks. The model serves as a capable option for applications requiring vision-language understanding with predictable response times. While no improvements are observed in this window, the lack of degradation in either quality or speed suggests stable infrastructure and model serving. Organizations evaluating this endpoint can rely on the consistent metrics for capacity planning. The 93.3 quality score positions this model competitively for production workloads requiring multimodal capabilities, though users should consider the 15.3-second latency when designing time-sensitive applications.

Qualität

Latenz p50

Testläufe

0

Quality stable at 93.3 Latency consistent at 15.3s Vision capability confirmed
Letzter automatisierter Test
14. Sept. 2026 · 20:02 UTC · Geschwindigkeits-Benchmark
P50-Latenz
145 ms
P95-Latenz
394 ms
Fehler
0 / 6 Läufe
Zuletzt geprüft von Tokonomix-Team·14. September 2026