Ir al contenido
Tier B — Producción
Se ejecuta en:FranceCreado en:China
OVH AI Endpoints (GRA)

Qwen2.5-VL-72B-Instruct

Tier B — Producción

Equipo editorial Tokonomix·Revisado por Mes Kalkan··
Sección 01

Análisis de velocidad

Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.

Latencia P50 (mediana)Latencia P95100 runs
923102611291211213108-2309-17ms
Sección 02

Puntuaciones de calidad

Cómo se sitúa este modelo frente al resto del campo en cada categoría de prompts, a partir de un ajuste por pares sobre los mismos prompts. La nota bruta del juez aparece debajo de cada número.

56%
Generación de código
media del juez 97
65%
Creativo
media del juez 90
33%
Factual
media del juez 70
52%
Multilingüe
media del juez 97
74%
Razonamiento
media del juez 99

Tasa de victorias por categoría: con qué frecuencia este modelo vence a un modelo medio en un prompt de esa categoría. 50% es la media, no un suspenso. No es un porcentaje de aciertos.

Sección 03

Precios

Lo que pagas por millón de tokens al usar este modelo en Tokonomix, más una estimación para una conversación típica.

💰
Tarifas API — Qwen2.5-VL-72B-Instruct
$1.78 por 1M de tokens de entrada
$1.78 por 1M de tokens de salida
≈ $0.0014 por conversación típica (800 tokens)
Precio entrada vs salida (por 1M de tokens)
por 1M de tokens de entrada$1.78
por 1M de tokens de salida$1.78
Sección 04

Tokens por segundo

Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.

Rendimiento (tokens / s)1163 / avg 1303
213619

Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.

Sección 05

Capacidades

visionownedBy: Qwen
Sección 06

Disponibilidad

Disponibilidad

Sin datos todavía

Aún no hemos registrado suficientes llamadas a la API para mostrar estadísticas de disponibilidad de este modelo. Los datos aparecen una vez que el modelo comienza a recibir tráfico en vivo.

Sección 07

Veredictos del benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-592/100 · 82 runs
71 correct9 partial2 wrong87% accuracy
2026-09-13

Vision capability confirmed, stable quality and latency maintained

Qwen2.5-VL-72B-Instruct through OVH AI Endpoints continues to demonstrate stable performance in its second benchmark window with vision capabilities. The model maintains its quality score of 93.3, showing consistency in response accuracy and helpfulness. Average latency remains steady at 15.3 seconds, indicating reliable performance characteristics for this multimodal model. The vision capability, newly detected in the previous window, is now confirmed as an established feature of this endpoint. Users can expect dependable performance for both text and visual understanding tasks. The model serves as a capable option for applications requiring vision-language understanding with predictable response times. While no improvements are observed in this window, the lack of degradation in either quality or speed suggests stable infrastructure and model serving. Organizations evaluating this endpoint can rely on the consistent metrics for capacity planning. The 93.3 quality score positions this model competitively for production workloads requiring multimodal capabilities, though users should consider the 15.3-second latency when designing time-sensitive applications.

Calidad

Latencia p50

Ejecuciones de test

0

Quality stable at 93.3 Latency consistent at 15.3s Vision capability confirmed
Última prueba automática
17 sept 2026 · 02:03 UTC · Benchmark de velocidad
Latencia P50
172 ms
Latencia P95
303 ms
Errores
0 / 6 ejecuciones
Última revisión por Equipo Tokonomix·17 de septiembre de 2026