Ir al contenido
Tier B — Producción
Se ejecuta en:FranceCreado en:United States
OVH AI Endpoints (GRA)

Meta-Llama-3_3-70B-Instruct

Tier B — Producción

Equipo editorial Tokonomix·Revisado por Mes Kalkan··
Sección 01

Análisis de velocidad

Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.

Latencia P50 (mediana)Latencia P95100 runs
90128424793673486708-2109-14ms
Sección 02

Puntuaciones de calidad

Cómo se sitúa este modelo frente al resto del campo en cada categoría de prompts, a partir de un ajuste por pares sobre los mismos prompts. La nota bruta del juez aparece debajo de cada número.

46%
Generación de código
media del juez 94
69%
Creativo
media del juez 92
60%
Factual
media del juez 76
51%
Multilingüe
media del juez 97
74%
Razonamiento
media del juez 99

Tasa de victorias por categoría: con qué frecuencia este modelo vence a un modelo medio en un prompt de esa categoría. 50% es la media, no un suspenso. No es un porcentaje de aciertos.

Sección 03

Precios

Lo que pagas por millón de tokens al usar este modelo en Tokonomix, más una estimación para una conversación típica.

💰
Tarifas API — Meta-Llama-3_3-70B-Instruct
$1.31 por 1M de tokens de entrada
$1.31 por 1M de tokens de salida
≈ $0.0010 por conversación típica (800 tokens)
Precio entrada vs salida (por 1M de tokens)
por 1M de tokens de entrada$1.31
por 1M de tokens de salida$1.31
Sección 04

Tokens por segundo

Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.

Rendimiento (tokens / s)1471 / avg 1469
2200231

Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.

Sección 05

Capacidades

ownedBy: meta-llama
Sección 06

Disponibilidad

Disponibilidad

Con qué frecuencia responde este modelo cuando lo llamamos — medido en solicitudes reales de API y pruebas en vivo durante los últimos 30 días. Esto es independiente de la calidad: estos números solo indican si el modelo responde, no qué tan buena es la respuesta.

Últimos 7 días

100.0%

n=19

Últimos 30 días

100.0%

n=22

Tiempo de respuesta mediano

4,604ms

n=22

Basado en 407 mediciones en los últimos 30 días.

Detalles técnicos

Solo cuentan las llamadas reales a la API y las solicitudes de prueba en vivo — las sondas internas y las ejecuciones de referencia están excluidas.

Las llamadas con una clave API propia (BYOK) están excluidas: esos fallos son específicos de la clave, no una señal de inactividad del modelo.

Las llamadas fallidas NO se incluyen en las puntuaciones de calidad — la calidad se mide solo en respuestas exitosas. Disponibilidad y calidad son señales independientes.

Tiempo de respuesta mediano (p50) en llamadas exitosas con una duración registrada. Los valores atípicos afectan menos a la mediana que a la media.

Total de llamadas (30d)

22

Respuestas OK (30d)

22

Total de llamadas (7d)

19

Respuestas OK (7d)

19

Sección 07

Veredictos del benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-592/100 · 83 runs
74 correct4 partial5 wrong89% accuracy
2026-09-13

Quality drops 13.3 points to 78.7 amid latency and scoring shifts

Meta-Llama-3_3-70B-Instruct shows notable performance degradation in this benchmark window, with the overall quality score falling from 92.0 to 78.7. The median latency increased by 45 percent, rising from 8405 ms to 12224 ms, indicating slower response times that may impact user experience. Category performance reveals mixed results with reasoning maintaining exceptional performance at 100, while coding capability declined from 92 to 83. The factual accuracy score of 53 represents a concerning weakness, though this metric was not measured in the previous window. Previously strong multilingual and creative scores are absent from current testing, making direct comparison challenging. The model continues to demonstrate solid reasoning capabilities and acceptable coding performance, but the substantial drop in overall quality combined with increased latency suggests potential infrastructure or configuration changes. Users should expect longer wait times and may encounter reduced accuracy in factual tasks. The reasoning category remains a strength worth noting, but the overall trajectory indicates this benchmark window represents a step backward for the model's performance on the OVH AI Endpoints platform.

Calidad

78.7

Latencia p50

12,224 ms

Ejecuciones de test

5

Quality dropped 13.3 points Latency increased 45% Reasoning score perfect at 100 Factual accuracy low at 53
Última prueba automática
14 sept 2026 · 20:02 UTC · Benchmark de velocidad
Latencia P50
136 ms
Latencia P95
138 ms
Errores
0 / 6 ejecuciones
Última revisión por Equipo Tokonomix·14 de septiembre de 2026