Ir al contenido
Tier C — Especialista
Se ejecuta en:FranceCreado en:United States
OVH AI Endpoints (GRA)

gpt-oss-120b

Tier C — Especialista

Equipo editorial Tokonomix·Revisado por Mes Kalkan··

GPT-OSS-120B es un gran modelo de lenguaje disponible a través de OVH AI Endpoints, alojado en la región del centro de datos GRA (Gravelines, Francia) de la compañía. Este modelo representa la oferta de OVH de infraestructura de modelos de lenguaje de código abierto, desplegada sobre su infraestructura cloud europea. La escala de 120 mil millones de parámetros lo posiciona como un modelo robusto capaz de gestionar tareas de procesamiento de lenguaje natural de propósito general, incluyendo generación de texto, conversación, análisis y razonamiento básico. El modelo proporciona capacidades estándar de generación de texto adecuadas para aplicaciones que requieren contenido coherente de formato largo, respuesta a preguntas, resumen y cargas de trabajo similares de NLP. Si bien el tamaño específico de la ventana de contexto no ha sido documentado públicamente, el modelo sigue los patrones convencionales de arquitectura transformer típicos de modelos en este rango de parámetros. OVH AI Endpoints ofrece este modelo a través de su infraestructura de API, permitiendo a los desarrolladores integrar capacidades de grandes modelos de lenguaje sin gestionar los recursos computacionales subyacentes. Dentro de la gama AI Endpoints de OVH, GPT-OSS-120B funciona como una de las opciones de modelos de código abierto de mayor tamaño disponibles para clientes que buscan capacidades sustanciales de procesamiento de lenguaje manteniendo la soberanía de datos dentro de infraestructura europea. La ubicación de despliegue en GRA puede resultar especialmente relevante para usuarios con requisitos de residencia de datos bajo la normativa europea. El enfoque de OVH se centra en proporcionar acceso a modelos de código abierto a través de su infraestructura cloud existente, ofreciendo una alternativa a los proveedores de modelos propietarios mientras aprovecha su presencia consolidada en el mercado europeo de hosting.

GPT-OSS-120B es un modelo de lenguaje de 120B parámetros de código abierto disponible en la infraestructura europea de OVH, ideal para organizaciones con requisitos de soberanía de datos.

Resumen de benchmark Tokonomix
Sección 01

Análisis de velocidad

Latencia medida en todas las ejecuciones de benchmark. P50 (mediana) y P95 (percentil 95) dan una imagen realista de la velocidad de respuesta bajo carga normal y máxima.

Latencia P50 (mediana)Latencia P95100 runs
133210440766047801808-2109-14ms
Sección 02

Puntuaciones de calidad

Cómo se sitúa este modelo frente al resto del campo en cada categoría de prompts, a partir de un ajuste por pares sobre los mismos prompts. La nota bruta del juez aparece debajo de cada número.

60%
Generación de código
media del juez 95
84%
Creativo
media del juez 96
61%
Factual
media del juez 81
54%
Multilingüe
media del juez 98
70%
Razonamiento
media del juez 86

Tasa de victorias por categoría: con qué frecuencia este modelo vence a un modelo medio en un prompt de esa categoría. 50% es la media, no un suspenso. No es un porcentaje de aciertos.

Sección 03

Precios

Lo que pagas por millón de tokens al usar este modelo en Tokonomix, más una estimación para una conversación típica.

💰
Tarifas API — gpt-oss-120b
$0.2100 por 1M de tokens de entrada
$1.04 por 1M de tokens de salida
≈ $0.0003 por conversación típica (800 tokens)
Precio entrada vs salida (por 1M de tokens)
por 1M de tokens de entrada$0.2100
por 1M de tokens de salida$1.04
Sección 04

Tokens por segundo

Rendimiento en tokens por segundo, derivado de la latencia P50 medida. Más alto es mejor; las fluctuaciones reflejan la carga del lado del proveedor.

Rendimiento (tokens / s)957 / avg 684
148789

Estimado a partir de latencia P50 × 200 tokens de salida — el número absoluto depende de esta suposición; lo que importa es la tendencia.

Sección 05

Fortalezas & debilidades

Basado en resultados de benchmarks y comentarios agregados de la comunidad sobre casos de uso reales.

Fortalezas

Infraestructura 100% europea120B parámetros para tareas complejasDatos procesados en EuropaGeneración de texto versátilSin gestión de infraestructura propiaApto para cumplimiento GDPR

Debilidades

Contexto no documentado públicamentePuede ser inferior a modelos propietarios de similar escalaDocumentación técnica limitada en OVHOpciones de personalización reducidas
Sección 06

Capacidades

ownedBy: OpenAI
Sección 07

Preguntas frecuentes

Para organizaciones con requisitos de residencia de datos en Europa, OVH garantiza que el procesamiento permanece en territorio europeo.

La combinación de 120B parámetros con infraestructura europea hace de este modelo una opción sólida para organizaciones bajo regulaciones GDPR estrictas.

Resumen de benchmark Tokonomix
Sección 08

Disponibilidad

Disponibilidad

Con qué frecuencia responde este modelo cuando lo llamamos — medido en solicitudes reales de API y pruebas en vivo durante los últimos 30 días. Esto es independiente de la calidad: estos números solo indican si el modelo responde, no qué tan buena es la respuesta.

Últimos 7 días

Últimos 30 días

100.0%

n=1

Tiempo de respuesta mediano

7,695ms

n=1

Basado en 386 mediciones en los últimos 30 días.

Detalles técnicos

Solo cuentan las llamadas reales a la API y las solicitudes de prueba en vivo — las sondas internas y las ejecuciones de referencia están excluidas.

Las llamadas con una clave API propia (BYOK) están excluidas: esos fallos son específicos de la clave, no una señal de inactividad del modelo.

Las llamadas fallidas NO se incluyen en las puntuaciones de calidad — la calidad se mide solo en respuestas exitosas. Disponibilidad y calidad son señales independientes.

Tiempo de respuesta mediano (p50) en llamadas exitosas con una duración registrada. Los valores atípicos afectan menos a la mediana que a la media.

Total de llamadas (30d)

1

Respuestas OK (30d)

1

Total de llamadas (7d)

0

Respuestas OK (7d)

0

Sección 09

Veredictos del benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-592/100 · 87 runs
76 correct7 partial4 wrong87% accuracy
2026-09-13

gpt-oss-120b quality plummets 14.7 points with notable latency regression

The gpt-oss-120b model experienced significant degradation across multiple dimensions in this benchmark window. Overall quality dropped sharply from 92.9 to 78.2, representing a 14.7 point decline that follows a previous 5 point drop. This marks consecutive windows of deterioration for the model. Performance across categories became highly inconsistent, with reasoning showing perfect scores at 100 while factual accuracy collapsed to just 52 points, down from unmeasured in the previous window. Coding capability also declined from 95 to 83. Latency regressed further, increasing 17 percent from 4243ms to 4959ms at the median, compounding previous latency issues. The dramatic variance in category performance suggests potential instability in the model deployment or configuration. The particularly concerning factual accuracy score of 52 indicates the model may struggle with knowledge-based queries. Users should exercise caution when relying on this model for fact-intensive applications and be prepared for longer response times. The consecutive quality drops across two benchmark windows warrant investigation into whether infrastructure or model changes at OVH GRA are impacting performance.

Calidad

78.2

Latencia p50

4,959 ms

Ejecuciones de test

5

Quality dropped 14.7 points Factual accuracy critically low Latency increased 17% Reasoning performance perfect score
Sección 10

Perfil completo del modelo

gpt-oss-120b — illustration 1
OVH gpt-oss-120b: el modelo insignia de peso abierto de OpenAI alojado en infraestructura soberana de la UE

OVH AI Endpoints sirve gpt-oss-120b desde su centro de datos de Gravelines (Francia). La combinación es la historia real aquí. OpenAI lanzó un modelo de peso abierto de 120 mil millones de parámetros. OVH aloja la inferencia dentro de infraestructura francesa con operaciones nativas del RGPD y garantías de residencia de datos en la UE. Para los equipos europeos que han estado esperando un modelo de alta capacidad del linaje OpenAI que puedan usar sin enviar tráfico a endpoints de inferencia en EE.UU., esta configuración es el camino que se abrió.

Por qué importa la combinación OpenAI-más-OVH

El perfil de capacidad que se obtiene de gpt-oss-120b está más cerca del frontier de OpenAI que cualquier otra cosa disponible bajo alojamiento soberano de la UE. Los modelos de peso abierto de otros proveedores son competitivos en benchmarks, pero el linaje de OpenAI lleva hábitos de seguimiento de instrucciones, fiabilidad de salida estructurada y patrones de razonamiento contra los que los sistemas de producción han pasado años calibrando. Cambiar a una familia de modelos diferente no es gratis aunque las puntuaciones de benchmark parezcan comparables.

El alojamiento en OVH dentro de Francia le da la historia del acuerdo de procesamiento de datos que los clientes de la UE realmente necesitan. El tráfico permanece dentro de las fronteras francesas. Las operaciones están regidas por la ley de datos francesa y europea. La conversación del DPA con los clientes es sencilla de una forma que llamar a los endpoints de OpenAI en EE.UU. nunca lo es, independientemente de lo buenos que sean los términos de protección de datos al estilo Anthropic.

La compensación es que se renuncia al comportamiento más reciente absoluto de OpenAI. Los pesos de gpt-oss-120b son una instantánea fija en lugar de un modelo de producción actualizado continuamente. OpenAI sigue lanzando modelos de razonamiento más nuevos, modelos de imagen y capacidades multimodales a través de su propia API, y estos no se propagan al lanzamiento de peso abierto. Para las cargas de trabajo donde la capacidad del 120b de peso abierto es suficiente, esto está bien. Para las cargas de trabajo que dependen del frontier, esta no es la herramienta correcta.

Qué cubre bien

Generación de texto de propósito general, seguimiento de instrucciones, salida estructurada, conversación de múltiples turnos. La escala de 120b parámetros es suficientemente grande para gestionar razonamiento moderadamente complejo, síntesis de código de alcance no trivial y generación de formato largo con estructura coherente. Para la mayoría de las cargas de trabajo que antes corrían en modelos de clase GPT-4 para trabajo general, gpt-oss-120b es una alternativa creíble.

La cobertura multilingüe es sólida en los idiomas europeos, lo que importa para la base de clientes de la UE a la que apunta esta configuración de alojamiento. Francés, alemán, neerlandés, español, italiano, portugués y polaco funcionan bien. El modelo está cómodo gestionando traducción, soporte al cliente multilingüe y generación de contenido en idiomas donde las alternativas alojadas en EE.UU. a veces tienen un estilo de salida anglocéntrico.

El alojamiento de OVH ofrece latencia europea predecible. El centro de datos de Gravelines está bien posicionado para el acceso de baja latencia desde la Europa continental y el Reino Unido. Para las aplicaciones sensibles a la latencia, el ida y vuelta es notablemente mejor que las rutas trasatlánticas a los endpoints de OpenAI en EE.UU.

Dónde falla

La brecha de capacidad frontier es real para las cargas de trabajo más difíciles. Razonamiento complejo de múltiples pasos, el tipo de síntesis de código que los modelos de razonamiento de la serie o gestionan bien, comprensión y generación de imágenes, interacción de voz en tiempo real. Ninguno de estos es abordado por gpt-oss-120b. Para esas cargas de trabajo hay que aceptar la ruta alojada en EE.UU. o buscar otros proveedores que combinen alta capacidad con alojamiento en la UE a través de diferentes familias de modelos.

El modelo es solo texto. Sin visión, sin audio, sin capacidad multimodal. Para las cargas de trabajo multimodales, OVH ofrece otras familias de modelos como Qwen2.5-VL a través del mismo patrón de endpoint, pero esas son diferentes linajes con diferentes perfiles de comportamiento.

La escala de 120b parámetros es grande pero no está en el techo absoluto de capacidad. Las cargas de trabajo que genuinamente necesitan un modelo de clase frontier sentirán la diferencia. Para las cargas de trabajo que encajan cómodamente dentro del envolvente de 120b, la diferencia no importa y la ventaja del alojamiento en la UE domina el cálculo de la compensación.

Cuándo elegirlo y qué más considerar

Para los clientes de la UE que construyen aplicaciones de texto de propósito general que quieren el linaje de OpenAI y la residencia de datos en la UE, gpt-oss-120b en OVH es el valor predeterminado correcto. La configuración resuelve un problema real que ha sido un bloqueador de adquisición para las empresas europeas y los compradores del sector público durante años.

Para las cargas de trabajo que no necesitan específicamente el linaje de OpenAI, el catálogo de OVH ofrece alternativas sólidas en el mismo envolvente de alojamiento. meta-llama-3_3-70b-instruct es la opción de peso abierto de Meta en un tier de capacidad similar. mistral-small-3.2-24b-instruct-2506 es un modelo de origen europeo que combina el alojamiento soberano de la UE con el entrenamiento de origen de la UE. qwen3-32b es una opción sólida de propósito general a una escala de parámetros más pequeña y menor coste.

Para las cargas de trabajo que necesitan una variante más pequeña, más rápida y más barata del mismo linaje de peso abierto de OpenAI, gpt-oss-20b es el hermano más pequeño. Para las cargas de trabajo que necesitan capacidad frontier real y pueden aceptar la inferencia alojada en EE.UU., la API directa de OpenAI con modelos de razonamiento y multimodales más nuevos es el camino alternativo. La elección depende de si el alojamiento soberano de la UE es un requisito estricto o una preferencia que puede relajarse para necesidades de capacidad específicas.

Última revisión técnica: 2026-05-22 — Tokonomix.ai

gpt-oss-120b — illustration 2
Última prueba automática
14 sept 2026 · 20:02 UTC · Benchmark de velocidad
Latencia P50
209 ms
Latencia P95
359 ms
Errores
0 / 6 ejecuciones
Última revisión por Equipo Tokonomix·24 de mayo de 2026