Análisis de velocidad
Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.
Puntuaciones de calidad
Cómo se sitúa este modelo frente al resto del campo en cada categoría de prompts, a partir de un ajuste por pares sobre los mismos prompts. La nota bruta del juez aparece debajo de cada número.
Tasa de victorias por categoría: con qué frecuencia este modelo vence a un modelo medio en un prompt de esa categoría. 50% es la media, no un suspenso. No es un porcentaje de aciertos.
Precios
Lo que pagas por millón de tokens al usar este modelo en Tokonomix, más una estimación para una conversación típica.
Tokens por segundo
Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.
Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.
Capacidades
Disponibilidad
Disponibilidad
Sin datos todavía
Aún no hemos registrado suficientes llamadas a la API para mostrar estadísticas de disponibilidad de este modelo. Los datos aparecen una vez que el modelo comienza a recibir tráfico en vivo.
Veredictos del benchmark Tokonomix
Quality falls 9.5 points to 75.2 with near-doubled latency
Qwen3-Coder-30B-A3B-Instruct demonstrates significant performance degradation in this benchmark window. Overall quality dropped from 84.7 to 75.2, representing a 9.5 point decline that follows a previous 6.5 point decrease. This marks a concerning downward trend across consecutive windows. Latency deteriorated substantially, with p50 response times increasing 93% from 2009ms to 3886ms, nearly doubling the wait time for users. Category performance shows mixed results with sharp variations. Reasoning achieved a perfect 100 score, indicating strong logical capabilities. However, coding performance plummeted from 94 to 69, a 25 point drop that undermines the model's core positioning as a coding specialist. Factual accuracy scored 57, though this represents a new category without direct comparison. The previous window's multilingual and creative categories were not tested in the current period. The combination of declining quality metrics and significantly increased latency suggests potential infrastructure or model configuration issues. Users should expect notably slower responses and reduced coding performance compared to the previous benchmark period. The perfect reasoning score provides limited consolation given the substantial regression in the model's primary coding capabilities.
Calidad
75.2
Latencia p50
3,886 ms
Ejecuciones de test
5
Qwen3-Coder-30B-A3B-Instruct
por OVH AI Endpoints (GRA)
- Ventana de contexto
- — tokens
- Precio de entrada
- $0.1900 / 1M
- Precio de salida
- $0.6800 / 1M
- Tier
- Tier B — Producción
- Modalidad
- Texto
- Tipo de API
- REST · streaming
- Ejecuciones benchmark
- 522
Más de OVH AI Endpoints (GRA)