Aller au contenu
Tier C — Spécialiste
Fonctionne en :FranceCréé en :United States
OVH AI Endpoints (GRA)

gpt-oss-120b

Tier C — Spécialiste

Équipe éditoriale Tokonomix·Relu par Mes Kalkan··

GPT-OSS-120B est un grand modèle de langage proposé via OVH AI Endpoints, hébergé dans la région data center GRA (Gravelines, France) de l'entreprise. Ce modèle illustre la mise à disposition par OVH d'une infrastructure de modèles de langage open source, déployée sur son infrastructure cloud européenne. L'échelle de 120 milliards de paramètres en fait un modèle de taille conséquente, capable de gérer des tâches de traitement du langage naturel à usage général, notamment la génération de texte, la conversation, l'analyse et le raisonnement de base. Le modèle offre des capacités de génération de texte standard adaptées aux applications nécessitant des contenus longs et cohérents, des réponses aux questions, des résumés et des charges de travail NLP similaires. Bien que la taille spécifique de la fenêtre de contexte n'ait pas été documentée publiquement, le modèle suit les schémas d'architecture transformer conventionnels typiques des modèles de cette gamme de paramètres. OVH AI Endpoints fournit ce modèle via son infrastructure API, permettant aux développeurs d'intégrer des capacités de grands modèles de langage sans avoir à gérer les ressources de calcul sous-jacentes. Au sein de la gamme AI Endpoints d'OVH, GPT-OSS-120B figure parmi les options de modèles open source les plus volumineuses proposées aux clients recherchant des capacités substantielles de traitement linguistique tout en préservant la souveraineté des données au sein d'une infrastructure européenne. L'emplacement de déploiement GRA peut s'avérer particulièrement pertinent pour les utilisateurs soumis à des exigences de résidence des données dans le cadre des réglementations européennes. L'approche d'OVH consiste à fournir un accès à des modèles open source via son infrastructure cloud existante, offrant ainsi une alternative aux fournisseurs de modèles propriétaires tout en s'appuyant sur sa présence établie sur le marché européen de l'hébergement.

GPT-OSS-120B est un modèle open source de 120 milliards de paramètres hébergé dans l infrastructure européenne d OVH à Gravelines.

Synthèse benchmark Tokonomix
Section 01

Analyse de vitesse

Latence mesurée sur toutes les exécutions de benchmark. P50 (médiane) et P95 (95e percentile) donnent une image réaliste de la vitesse de réponse en charge normale et de pointe.

Latence P50 (médiane)Latence P95100 runs
133210440766047801808-2109-15ms
Section 02

Scores de qualité

Comment ce modèle se situe par rapport au reste du champ sur chaque catégorie de prompts, à partir d'un ajustement par paires sur les mêmes prompts. La note brute du juge figure sous chaque nombre.

60%
Génération de code
moyenne du juge 95
84%
Créatif
moyenne du juge 96
61%
Factuel
moyenne du juge 81
54%
Multilingue
moyenne du juge 98
70%
Raisonnement
moyenne du juge 86

Taux de victoire par catégorie : la fréquence à laquelle ce modèle bat un modèle moyen sur un prompt de cette catégorie. 50% est la moyenne, pas un échec. Ce n'est pas un pourcentage de bonnes réponses.

Section 03

Tarifs

Ce que vous payez par million de tokens en utilisant ce modèle sur Tokonomix, avec une estimation pour une conversation type.

💰
Tarifs API — gpt-oss-120b
$0.2100 par 1M de tokens d'entrée
$1.04 par 1M de tokens de sortie
≈ $0.0003 par conversation typique (800 tokens)
Prix entrée vs sortie (par 1M de tokens)
par 1M de tokens d'entrée$0.2100
par 1M de tokens de sortie$1.04
Section 04

Tokens par seconde

Débit en tokens par seconde, dérivé de la latence P50 mesurée. Plus haut est mieux ; les fluctuations reflètent la charge côté fournisseur.

Débit (tokens / s)1099 / avg 687
148789

Estimé à partir de la latence P50 × 200 tokens de sortie — le chiffre absolu dépend de cette hypothèse ; c'est la tendance qui compte.

Section 05

Forces & faiblesses

Basé sur les résultats de benchmarks et les retours communautaires agrégés sur des cas d'usage réels.

Forces

Hébergement données européen (GRA)Modèle open source120 milliards de paramètres robustesConformité données en EuropeInfrastructure OVH intégréeGénération textuelle généraliste

Faiblesses

Fenêtre de contexte non documentéeMoins précis que les modèles propriétaires top-tierLatence potentiellement supérieureDocumentation technique limitée
Section 06

Capacités

ownedBy: OpenAI
Section 07

Questions fréquentes

Pour les organisations ayant des exigences de souveraineté des données en Europe, l hébergement à Gravelines assure la résidence des données en UE.

La puissance des grands modèles open source avec l avantage de l hébergement en données européen chez OVH.

Synthèse benchmark Tokonomix
Section 08

Disponibilité

Disponibilité

La fréquence à laquelle ce modèle répond lorsqu'on l'appelle — mesurée sur de vraies requêtes API et des tests en direct au cours des 30 derniers jours. C'est indépendant de la qualité : ces chiffres indiquent seulement si le modèle répond, pas la qualité de sa réponse.

7 derniers jours

30 derniers jours

100.0%

n=1

Temps de réponse médian

7,695ms

n=1

Basé sur 386 mesures au cours des 30 derniers jours.

Détails techniques

Seuls les vrais appels API et les requêtes de test en direct sont comptés — les sondes internes et les benchmarks sont exclus.

Les appels avec une clé API personnalisée (BYOK) sont exclus : ces échecs sont spécifiques à la clé, pas un signe de défaillance du modèle.

Les appels échoués ne sont PAS inclus dans les scores de qualité — la qualité est mesurée uniquement sur les réponses réussies. Disponibilité et qualité sont des signaux indépendants.

Temps de réponse médian (p50) sur les appels réussis avec une durée enregistrée. Les valeurs extrêmes influencent moins la médiane que la moyenne.

Total des appels (30d)

1

Réponses OK (30d)

1

Total des appels (7d)

0

Réponses OK (7d)

0

Section 09

Verdicts benchmark Tokonomix

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-592/100 · 87 runs
76 correct7 partial4 wrong87% accuracy
2026-09-13

gpt-oss-120b quality plummets 14.7 points with notable latency regression

The gpt-oss-120b model experienced significant degradation across multiple dimensions in this benchmark window. Overall quality dropped sharply from 92.9 to 78.2, representing a 14.7 point decline that follows a previous 5 point drop. This marks consecutive windows of deterioration for the model. Performance across categories became highly inconsistent, with reasoning showing perfect scores at 100 while factual accuracy collapsed to just 52 points, down from unmeasured in the previous window. Coding capability also declined from 95 to 83. Latency regressed further, increasing 17 percent from 4243ms to 4959ms at the median, compounding previous latency issues. The dramatic variance in category performance suggests potential instability in the model deployment or configuration. The particularly concerning factual accuracy score of 52 indicates the model may struggle with knowledge-based queries. Users should exercise caution when relying on this model for fact-intensive applications and be prepared for longer response times. The consecutive quality drops across two benchmark windows warrant investigation into whether infrastructure or model changes at OVH GRA are impacting performance.

Qualité

78.2

Latence p50

4,959 ms

Exécutions de test

5

Quality dropped 14.7 points Factual accuracy critically low Latency increased 17% Reasoning performance perfect score
Section 10

Profil complet du modèle

gpt-oss-120b — illustration 1
OVH gpt-oss-120b : le modèle phare open-weight d'OpenAI hébergé sur une infrastructure souveraine européenne

OVH AI Endpoints sert gpt-oss-120b depuis son centre de données de Gravelines (France). C'est précisément cette combinaison qui constitue l'élément central de cette analyse. OpenAI a publié un modèle open-weight de 120 milliards de paramètres. OVH héberge l'inférence pour ce modèle au sein d'une infrastructure française, avec une exploitation nativement conforme au RGPD et des garanties de résidence des données dans l'Union européenne. Pour les équipes européennes qui attendaient un modèle hautement capable, issu de la lignée OpenAI, qu'elles puissent utiliser sans router leur trafic vers des endpoints d'inférence basés aux États-Unis, cette configuration constitue la voie qui s'est enfin ouverte.

Pourquoi la combinaison OpenAI plus OVH est importante

Le profil de capacités offert par gpt-oss-120b est plus proche de la frontière OpenAI que tout ce qui est aujourd'hui disponible sous un hébergement souverain européen. Les modèles open-weight d'autres éditeurs sont compétitifs sur les benchmarks, mais la lignée OpenAI apporte avec elle des habitudes de suivi d'instructions, une fiabilité dans la production de sorties structurées et des schémas de raisonnement sur lesquels les systèmes en production se sont calibrés pendant des années. Basculer vers une autre famille de modèles n'est jamais gratuit, même lorsque les scores de benchmarks paraissent comparables.

Héberger en France chez OVH vous donne le récit « accord de traitement des données » dont les clients européens ont réellement besoin. Le trafic reste à l'intérieur des frontières françaises. L'exploitation est régie par le droit français et européen relatif à la protection des données. La conversation DPA avec vos clients devient simple, d'une manière que l'appel à des endpoints OpenAI hébergés aux États-Unis n'atteint jamais tout à fait, peu importe la qualité des clauses de protection des données à la manière d'Anthropic.

Le compromis, c'est que vous renoncez au tout dernier comportement OpenAI. Les poids de gpt-oss-120b sont un instantané figé, et non un modèle de production mis à jour en continu. OpenAI continue de publier des modèles de raisonnement plus récents, des modèles d'images et des capacités multimodales via sa propre API, et ces évolutions ne se propagent pas vers la version open-weight. Pour les charges de travail où la capacité 120b open-weight suffit, c'est très bien. Pour les charges de travail qui dépendent de la frontière de l'état de l'art, ce n'est pas le bon outil.

Ce qu'il couvre bien

Génération de texte généraliste, suivi d'instructions, sortie structurée, conversation multi-tours. L'échelle de 120 milliards de paramètres est suffisante pour gérer un raisonnement modérément complexe, de la synthèse de code à une portée non triviale et la génération de contenus longs avec une structure cohérente. Pour la plupart des charges de travail qui tournaient auparavant sur des modèles de classe GPT-4 pour des tâches généralistes, gpt-oss-120b constitue une alternative crédible.

La couverture multilingue est solide sur l'ensemble des langues européennes, ce qui compte pour la base de clients européens visée par cette configuration d'hébergement. Le français, l'allemand, le néerlandais, l'espagnol, l'italien, le portugais et le polonais fonctionnent tous bien. Le modèle est à l'aise pour la traduction, le support client multilingue et la génération de contenus dans des langues où les alternatives hébergées aux États-Unis donnent parfois l'impression d'un style de sortie anglocentré.

L'hébergement OVH vous offre une latence européenne prévisible. Le centre de données de Gravelines est bien positionné pour un accès à faible latence depuis l'Europe continentale et le Royaume-Uni. Pour les applications sensibles à la latence, l'aller-retour est nettement meilleur que sur des routes transatlantiques vers des endpoints OpenAI hébergés aux États-Unis.

Là où il ne tient pas la distance

L'écart de capacités par rapport à la frontière est réel pour les charges de travail les plus difficiles. Raisonnement multi-étapes complexe, synthèse de code du type que les modèles de raisonnement de la série o gèrent bien, compréhension et génération d'images, interaction vocale en temps réel. Aucune de ces dimensions n'est couverte par gpt-oss-120b. Pour ces charges de travail, il faut soit accepter la voie hébergée aux États-Unis, soit se tourner vers d'autres fournisseurs qui combinent forte capacité et hébergement européen à travers d'autres familles de modèles.

Le modèle est exclusivement textuel. Pas de vision, pas d'audio, pas de capacité multimodale. Pour des charges de travail multimodales, OVH propose d'autres familles de modèles comme Qwen2.5-VL via le même schéma d'endpoint, mais il s'agit de lignées différentes au profil comportemental distinct.

L'échelle de 120 milliards de paramètres est importante, mais pas située au plafond absolu des capacités. Les charges de travail qui ont véritablement besoin d'un modèle de classe frontière ressentiront la différence. Pour les charges qui s'inscrivent confortablement dans l'enveloppe 120b, la différence ne compte pas et l'avantage de l'hébergement européen domine le calcul d'arbitrage.

Comment le choisir et quelles alternatives considérer

Pour les clients européens qui construisent des applications textuelles généralistes et qui veulent la lignée OpenAI conjuguée à la résidence des données dans l'UE, gpt-oss-120b sur OVH est le choix par défaut adéquat. La configuration résout un vrai problème qui a constitué un blocage achats pendant des années pour les entreprises européennes et les acheteurs du secteur public.

Pour les charges de travail qui n'exigent pas spécifiquement la lignée OpenAI, le catalogue OVH offre de solides alternatives dans la même enveloppe d'hébergement. meta-llama-3_3-70b-instruct est l'option open-weight de Meta à un niveau de capacité comparable. mistral-small-3.2-24b-instruct-2506 est un modèle d'origine européenne qui associe l'hébergement souverain européen à un entraînement d'origine européenne. qwen3-32b est une option généraliste solide à une échelle de paramètres plus réduite et un coût moindre.

Pour les charges de travail qui ont besoin d'une variante plus petite, plus rapide et moins coûteuse de la même lignée open-weight d'OpenAI, gpt-oss-20b est le petit frère. Pour les charges de travail qui requièrent une véritable capacité de frontière et peuvent accepter une inférence hébergée aux États-Unis, l'API directe d'OpenAI avec des modèles de raisonnement et multimodaux plus récents constitue la voie alternative. Le choix dépend du fait de savoir si l'hébergement souverain européen est une exigence ferme ou une préférence qui peut être assouplie pour des besoins de capacité spécifiques.

Dernière revue technique : 2026-05-22 — Tokonomix.ai

gpt-oss-120b — illustration 2
Dernier test automatisé
15 sept. 2026 · 02:04 UTC · Benchmark de vitesse
Latence P50
182 ms
Latence P95
382 ms
Erreurs
0 / 6 exécutions
Dernière revue par Équipe Tokonomix·26 mai 2026