Analyse de vitesse
Latence mesurée sur toutes les exécutions de benchmark. P50 (médiane) et P95 (95e percentile) donnent une image réaliste de la vitesse de réponse en charge normale et de pointe.
Scores de qualité
Comment ce modèle se situe par rapport au reste du champ sur chaque catégorie de prompts, à partir d'un ajustement par paires sur les mêmes prompts. La note brute du juge figure sous chaque nombre.
Taux de victoire par catégorie : la fréquence à laquelle ce modèle bat un modèle moyen sur un prompt de cette catégorie. 50% est la moyenne, pas un échec. Ce n'est pas un pourcentage de bonnes réponses.
Tarifs
Ce que vous payez par million de tokens en utilisant ce modèle sur Tokonomix, avec une estimation pour une conversation type.
Tokens par seconde
Débit en tokens par seconde, dérivé de la latence P50 mesurée. Plus haut est mieux ; les fluctuations reflètent la charge côté fournisseur.
Estimé à partir de la latence P50 × 200 tokens de sortie — le chiffre absolu dépend de cette hypothèse ; c'est la tendance qui compte.
Capacités
Disponibilité
Disponibilité
Pas encore de données
Nous n'avons pas encore enregistré suffisamment d'appels API pour afficher les statistiques de disponibilité de ce modèle. Les données apparaîtront dès que le modèle reçoit du trafic en direct.
Verdicts benchmark Tokonomix
Vision capability confirmed, stable quality and latency maintained
Qwen2.5-VL-72B-Instruct through OVH AI Endpoints continues to demonstrate stable performance in its second benchmark window with vision capabilities. The model maintains its quality score of 93.3, showing consistency in response accuracy and helpfulness. Average latency remains steady at 15.3 seconds, indicating reliable performance characteristics for this multimodal model. The vision capability, newly detected in the previous window, is now confirmed as an established feature of this endpoint. Users can expect dependable performance for both text and visual understanding tasks. The model serves as a capable option for applications requiring vision-language understanding with predictable response times. While no improvements are observed in this window, the lack of degradation in either quality or speed suggests stable infrastructure and model serving. Organizations evaluating this endpoint can rely on the consistent metrics for capacity planning. The 93.3 quality score positions this model competitively for production workloads requiring multimodal capabilities, though users should consider the 15.3-second latency when designing time-sensitive applications.
Qualité
—
Latence p50
—
Exécutions de test
0
Qwen2.5-VL-72B-Instruct
par OVH AI Endpoints (GRA)
- Sortie
- 26 janvier 2025
- Fenêtre de contexte
- — tokens
- Prix d'entrée
- $1.78 / 1M
- Prix de sortie
- $1.78 / 1M
- Tier
- Tier B — Production
- Modalité
- Texte + vision
- Type d'API
- REST · streaming
- Exécutions benchmark
- 531
Plus de OVH AI Endpoints (GRA)