Análisis de velocidad
Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.
Puntuaciones de calidad
Cómo se sitúa este modelo frente al resto del campo en cada categoría de prompts, a partir de un ajuste por pares sobre los mismos prompts. La nota bruta del juez aparece debajo de cada número.
Tasa de victorias por categoría: con qué frecuencia este modelo vence a un modelo medio en un prompt de esa categoría. 50% es la media, no un suspenso. No es un porcentaje de aciertos.
Historial de precios
Tarifas directas del proveedor por millón de tokens, más una estimación del coste de una conversación típica.
Pricing over time
Input & output per 1M tokens · step-line = price changes
$0.6700
input / 1M
— stable
$0.6700
output / 1M
— stable
Tokens por segundo
Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.
Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.
Capacidades
Disponibilidad
Disponibilidad
Sin datos todavía
Aún no hemos registrado suficientes llamadas a la API para mostrar estadísticas de disponibilidad de este modelo. Los datos aparecen una vez que el modelo comienza a recibir tráfico en vivo.
Veredictos del benchmark Tokonomix
Quality rebounds 9.8 points to 85.3 with strong factual recovery
Meta-Llama-3.3-70B-Instruct demonstrates significant recovery in this benchmark window, climbing from 75.5 to 85.3 in overall quality. The most dramatic improvement comes in factual performance, which surged from 54 to a perfect 100, completely reversing the previous period's sharp decline. Coding capability also advanced from 81 to 92, showing solid progression. Reasoning performance debuts at an impressive 96, indicating strong logical processing capabilities. However, creative output presents a concerning new weakness at just 53, representing a notable gap in the model's capabilities. Multilingual support, previously measured at 92, was not evaluated in the current window. Latency improved modestly from 8442ms to 7416ms at the median, though response times remain relatively slow for real-time applications. The recovery suggests the previous window's issues may have been temporary, possibly related to infrastructure or configuration problems that have since been resolved. Users can expect reliable performance for technical, factual, and reasoning-heavy tasks, but should be aware of limitations in creative applications. The model appears well-suited for analytical workloads where accuracy and logical processing matter most.
Calidad
85.3
Latencia p50
7,416 ms
Ejecuciones de test
5
Meta-Llama-3_3-70B-Instruct
por OVH AI Endpoints (GRA)
- Ventana de contexto
- — tokens
- Precio de entrada
- $0.6700 / 1M
- Precio de salida
- $0.6700 / 1M
- Tier
- Tier B — Producción
- Modalidad
- Texto
- Tipo de API
- REST · streaming
- Ejecuciones benchmark
- 474
Más de OVH AI Endpoints (GRA)