Análisis de velocidad
Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.
Puntuaciones de calidad
Resultados de evaluación de modelos juez en diversas categorías de tareas. Las puntuaciones reflejan coherencia, precisión y seguimiento de instrucciones.
Historial de precios
Tarifas directas del proveedor por millón de tokens, más una estimación del coste de una conversación típica.
Pricing over time
Input & output per 1M tokens · step-line = price changes
$0.0800
input / 1M
— stable
$0.2300
output / 1M
— stable
Tokens por segundo
Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.
Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.
Capacidades
Disponibilidad
Disponibilidad
Con qué frecuencia responde este modelo cuando lo llamamos — medido en solicitudes reales de API y pruebas en vivo durante los últimos 30 días. Esto es independiente de la calidad: estos números solo indican si el modelo responde, no qué tan buena es la respuesta.
Últimos 7 días
—
Últimos 30 días
100.0%
n=33
Tiempo de respuesta mediano
145,961ms
n=33
Basado en 413 mediciones en los últimos 30 días.
Detalles técnicos
Solo cuentan las llamadas reales a la API y las solicitudes de prueba en vivo — las sondas internas y las ejecuciones de referencia están excluidas.
Las llamadas con una clave API propia (BYOK) están excluidas: esos fallos son específicos de la clave, no una señal de inactividad del modelo.
Las llamadas fallidas NO se incluyen en las puntuaciones de calidad — la calidad se mide solo en respuestas exitosas. Disponibilidad y calidad son señales independientes.
Tiempo de respuesta mediano (p50) en llamadas exitosas con una duración registrada. Los valores atípicos afectan menos a la mediana que a la media.
Total de llamadas (30d)
33
Respuestas OK (30d)
33
Total de llamadas (7d)
0
Respuestas OK (7d)
0
Veredictos del benchmark Tokonomix
Qwen3-32B shows 34% latency gain but factual score plummets to 35
The current benchmark window reveals a mixed performance picture for Qwen3-32B deployed on OVH AI Endpoints. While latency has improved substantially with p50 dropping from 24595ms to 16206ms, representing a 34% speed increase, the overall quality score has declined slightly from 73.4 to 72.3. The most concerning development is the dramatic collapse in factual performance, now scoring just 35 compared to the previous window where factual capabilities weren't measured but coding achieved 94. This suggests a significant regression in knowledge accuracy and reliability. On the positive side, multilingual capabilities have strengthened from 86 to 95, and reasoning performance stands strong at 83. Creative writing has rebounded impressively from 40 to 76, reversing the sharp decline noted in the previous period. The model appears to have shifted its strengths, excelling at multilingual tasks and creative generation while struggling with factual accuracy. Users requiring precise factual responses should exercise caution, while those focused on creative multilingual applications may find the current configuration more suitable. The latency improvements make the service more responsive overall, but the factual performance gap represents a critical weakness for general-purpose deployments.
Quality
72.3
Latency p50
16,206 ms
Test runs
5
Qwen3-32B
por OVH AI Endpoints (GRA)
- Ventana de contexto
- — tokens
- Precio de entrada
- $0.0800 / 1M
- Precio de salida
- $0.2300 / 1M
- Tier
- Tier B — Producción
- Modalidad
- Texto
- Tipo de API
- REST · streaming
- Ejecuciones benchmark
- 301
Más de OVH AI Endpoints (GRA)