Zum Inhalt
Tier C — Spezialist
Läuft in:FranceErstellt in:United States
OVH AI Endpoints (GRA)

gpt-oss-120b

Tier C — Spezialist

Tokonomix-Redaktionsteam·Geprüft von Mes Kalkan··

GPT-OSS-120B ist ein großes Sprachmodell, das über OVH AI Endpoints bereitgestellt wird und in der Rechenzentrumsregion GRA (Gravelines, Frankreich) des Unternehmens gehostet wird. Das Modell steht für OVHs Angebot an Open-Source-Sprachmodell-Infrastruktur, die auf der europäischen Cloud-Infrastruktur des Anbieters betrieben wird. Mit 120 Milliarden Parametern positioniert es sich als umfangreiches Modell, das allgemeine NLP-Aufgaben wie Textgenerierung, Konversation, Analyse und einfaches logisches Schließen bewältigen kann. Das Modell bietet standardmäßige Textgenerierungsfunktionen, die sich für Anwendungen eignen, die kohärente Langtexte, Fragenbeantwortung, Zusammenfassung und ähnliche NLP-Workloads erfordern. Auch wenn die genaue Größe des Kontextfensters nicht öffentlich dokumentiert ist, folgt das Modell den üblichen Transformer-Architekturmustern, die für Modelle dieser Parametergrößenordnung typisch sind. OVH AI Endpoints stellt das Modell über seine API-Infrastruktur bereit, sodass Entwickler die Funktionen großer Sprachmodelle integrieren können, ohne die zugrunde liegenden Rechenressourcen verwalten zu müssen. Innerhalb des AI-Endpoints-Portfolios von OVH zählt GPT-OSS-120B zu den größeren verfügbaren Open-Source-Modelloptionen für Kunden, die umfangreiche Sprachverarbeitungskapazitäten benötigen und gleichzeitig die Datenhoheit innerhalb europäischer Infrastruktur wahren wollen. Der Bereitstellungsstandort GRA dürfte insbesondere für Anwender mit Anforderungen an die Datenresidenz nach europäischen Vorschriften relevant sein. OVH verfolgt den Ansatz, Open-Source-Modelle über die bestehende Cloud-Infrastruktur zugänglich zu machen, und bietet damit eine Alternative zu proprietären Modellanbietern, gestützt auf die etablierte Marktpräsenz im europäischen Hosting-Geschäft.

GPT-OSS-120B auf OVH-Infrastruktur: 120 Milliarden Parameter mit europäischem Datenschutz und Datensouveränität.

Tokonomix-Benchmark-Zusammenfassung
Abschnitt 01

Geschwindigkeitsanalyse

Latenz über alle Benchmark-Läufe gemessen. P50 (Median) und P95 (95. Perzentil) zeigen ein realistisches Bild der Antwortgeschwindigkeit bei normaler und Spitzenlast.

P50-Latenz (Median)P95-Latenz100 runs
133210440766047801808-2109-14ms
Abschnitt 02

Qualitätswerte

Wie sich dieses Modell je Prompt-Kategorie zum übrigen Feld verhält, aus einem paarweisen Fit über dieselben Prompts. Die rohe Jury-Wertung steht unter jeder Zahl.

60%
Codegenerierung
Jury-Mittel 95
84%
Kreativ
Jury-Mittel 96
61%
Faktisch
Jury-Mittel 81
54%
Mehrsprachig
Jury-Mittel 98
70%
Schlussfolgern
Jury-Mittel 86

Gewinnrate je Kategorie: wie oft dieses Modell ein durchschnittliches Modell bei einem Prompt dieser Kategorie schlägt. 50% ist der Durchschnitt, keine schlechte Note. Es ist kein Prozentsatz richtiger Antworten.

Abschnitt 03

Preise

Was Sie pro Million Tokens zahlen, wenn Sie dieses Modell über Tokonomix nutzen, plus eine Schätzung für ein typisches Gespräch.

💰
API-Tarife — gpt-oss-120b
$0.2100 pro 1M Input-Tokens
$1.04 pro 1M Output-Tokens
≈ $0.0003 pro typischem Gespräch (800 Tokens)
Input- vs. Output-Preis (pro 1M Tokens)
pro 1M Input-Tokens$0.2100
pro 1M Output-Tokens$1.04
Abschnitt 04

Tokens pro Sekunde

Durchsatz in Tokens pro Sekunde, abgeleitet aus gemessener P50-Latenz. Höhere Werte sind besser; Schwankungen spiegeln die Provider-seitige Last wider.

Durchsatz (Tokens / s)957 / avg 684
148789

Geschätzt aus P50-Latenz × 200 Output-Tokens — die absolute Zahl hängt von dieser Annahme ab; entscheidend ist der Trend.

Abschnitt 05

Stärken & Schwächen

Basierend auf Benchmark-Ergebnissen und aggregiertem Community-Feedback zu realen Anwendungsfällen.

Stärken

Europäische Datenresidenz (Gravelines)DSGVO-konforme Infrastruktur120-Milliarden-Parameter-KapazitätAllgemeine NLP-AufgabenOVH Cloud IntegrationOpen-Source-Modell-Basis

Schwächen

Kontextgröße nicht dokumentiertKein proprietäres Flaggschiff-NiveauWeniger Ökosystem als GPT/Claude
Abschnitt 06

Fähigkeiten

ownedBy: OpenAI
Abschnitt 07

Häufig gestellte Fragen

Managed Inference auf europäischer Infrastruktur mit Datenresidenz in Frankreich – ideal für DSGVO-konforme Deployments.

Für europäische Unternehmen, die KI-Kapazitäten mit Datenresidenz-Anforderungen kombinieren müssen, ist OVH AI Endpoints ein pragmatischer Ansatz.

Tokonomix-Benchmark-Zusammenfassung
Abschnitt 08

Verfügbarkeit

Verfügbarkeit

Wie oft dieses Modell antwortet, wenn wir es aufrufen — gemessen anhand echter API-Anfragen und Live-Tests der letzten 30 Tage. Dies ist unabhängig von der Qualität: Diese Zahlen zeigen nur, ob das Modell antwortet, nicht wie gut die Antwort ist.

Letzte 7 Tage

Letzte 30 Tage

100.0%

n=1

Mediane Antwortzeit

7,695ms

n=1

Basierend auf 386 Messungen in den letzten 30 Tagen.

Technische Details

Nur echte API-Aufrufe und Live-Test-Anfragen werden gezählt — interne Proben und Benchmark-Läufe sind ausgeschlossen.

Aufrufe mit einem eigenen API-Schlüssel (BYOK) sind ausgeschlossen: Diese Fehler sind schlüsselspezifisch und kein Zeichen für Modellausfälle.

Fehlgeschlagene Aufrufe werden NICHT in Qualitätswerten berücksichtigt — Qualität wird nur für erfolgreiche Antworten gemessen. Verfügbarkeit und Qualität sind unabhängige Signale.

Mediane Antwortzeit (p50) über erfolgreiche Aufrufe mit aufgezeichneter Dauer. Ausreißer beeinflussen den Median weniger als den Durchschnitt.

Gesamte Aufrufe (30d)

1

OK-Antworten (30d)

1

Gesamte Aufrufe (7d)

0

OK-Antworten (7d)

0

Abschnitt 09

Tokonomix-Benchmark-Urteile

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-592/100 · 87 runs
76 correct7 partial4 wrong87% accuracy
2026-09-13

gpt-oss-120b quality plummets 14.7 points with notable latency regression

The gpt-oss-120b model experienced significant degradation across multiple dimensions in this benchmark window. Overall quality dropped sharply from 92.9 to 78.2, representing a 14.7 point decline that follows a previous 5 point drop. This marks consecutive windows of deterioration for the model. Performance across categories became highly inconsistent, with reasoning showing perfect scores at 100 while factual accuracy collapsed to just 52 points, down from unmeasured in the previous window. Coding capability also declined from 95 to 83. Latency regressed further, increasing 17 percent from 4243ms to 4959ms at the median, compounding previous latency issues. The dramatic variance in category performance suggests potential instability in the model deployment or configuration. The particularly concerning factual accuracy score of 52 indicates the model may struggle with knowledge-based queries. Users should exercise caution when relying on this model for fact-intensive applications and be prepared for longer response times. The consecutive quality drops across two benchmark windows warrant investigation into whether infrastructure or model changes at OVH GRA are impacting performance.

Qualität

78.2

Latenz p50

4,959 ms

Testläufe

5

Quality dropped 14.7 points Factual accuracy critically low Latency increased 17% Reasoning performance perfect score
Abschnitt 10

Vollständiges Modellprofil

gpt-oss-120b — illustration 1
OVH gpt-oss-120b: OpenAIs Open-Weight-Flaggschiff auf EU-souveräner Infrastruktur

OVH AI Endpoints betreibt gpt-oss-120b im Rechenzentrum Gravelines (Frankreich). Die eigentliche Geschichte ist diese Kombination. OpenAI hat ein Open-Weight-Modell mit 120 Milliarden Parametern veröffentlicht. OVH hostet die Inferenz dafür innerhalb französischer Infrastruktur, mit DSGVO-konformem Betrieb und garantierter EU-Datenresidenz. Für europäische Teams, die auf ein leistungsfähiges Modell aus der OpenAI-Linie gewartet haben, das sich nutzen lässt, ohne Traffic an US-basierte Inference-Endpoints zu senden, ist diese Konfiguration der Weg, der sich nun geöffnet hat.

Warum die Kombination aus OpenAI und OVH zählt

Das Fähigkeitsprofil von gpt-oss-120b liegt näher an OpenAIs Spitzenmodellen als alles andere, was unter EU-souveränem Hosting verfügbar ist. Open-Weight-Modelle anderer Anbieter sind in Benchmarks konkurrenzfähig, aber die OpenAI-Linie bringt Eigenheiten beim Instruction-Following, Zuverlässigkeit bei strukturierten Ausgaben und Reasoning-Muster mit, gegen die produktive Systeme jahrelang kalibriert wurden. Ein Wechsel zu einer anderen Modellfamilie ist nicht kostenlos, selbst wenn die Benchmark-Werte vergleichbar aussehen.

Das Hosting bei OVH in Frankreich liefert die Auftragsverarbeitungs-Story, die EU-Kunden tatsächlich brauchen. Der Traffic bleibt innerhalb der französischen Landesgrenzen. Der Betrieb unterliegt französischem und europäischem Datenrecht. Das AVV-Gespräch mit Ihren Kunden ist auf eine Weise geradlinig, wie es Aufrufe an US-basierte OpenAI-Endpoints nie ganz sind, egal wie gut die Datenschutzklauseln im Anthropic-Stil mittlerweile werden.

Der Kompromiss besteht darin, dass Sie das absolut aktuelle OpenAI-Verhalten aufgeben. Die Gewichte von gpt-oss-120b sind ein eingefrorener Snapshot, kein kontinuierlich aktualisiertes Produktivmodell. OpenAI veröffentlicht über seine eigene API weiterhin neuere Reasoning-Modelle, Bildmodelle und multimodale Fähigkeiten, und diese fließen nicht in das Open-Weight-Release ein. Für Workloads, bei denen die 120b-Fähigkeit des Open-Weight-Modells ausreicht, ist das in Ordnung. Für Workloads, die von der Spitzenklasse abhängen, ist das nicht das richtige Werkzeug.

Wo es gut abdeckt

Allzweck-Textgenerierung, Instruction-Following, strukturierte Ausgaben, Multi-Turn-Konversation. Die Größenordnung von 120 Milliarden Parametern reicht aus, um mäßig komplexes Reasoning, Code-Synthese in nicht-trivialem Umfang und lange, kohärent strukturierte Generierungen zu bewältigen. Für die meisten Workloads, die bisher auf Modellen der GPT-4-Klasse für allgemeine Aufgaben liefen, ist gpt-oss-120b eine glaubwürdige Alternative.

Die Mehrsprachigkeit ist über europäische Sprachen hinweg stark, was für die EU-Kundenbasis, auf die diese Hosting-Konfiguration zielt, entscheidend ist. Französisch, Deutsch, Niederländisch, Spanisch, Italienisch, Portugiesisch und Polnisch funktionieren alle gut. Das Modell beherrscht Übersetzung, mehrsprachigen Kundensupport und Content-Erstellung in Sprachen, in denen US-gehostete Alternativen im Ausgabestil mitunter anglozentrisch wirken.

Das OVH-Hosting bietet eine vorhersehbare europäische Latenz. Das Rechenzentrum Gravelines ist gut positioniert für latenzarme Zugriffe aus Kontinentaleuropa und Großbritannien. Für latenzsensitive Anwendungen ist die Round-Trip-Zeit spürbar besser als bei transatlantischen Routen zu US-gehosteten OpenAI-Endpoints.

Wo es nicht überzeugt

Die Lücke zur Spitzenklasse ist bei den schwierigsten Workloads real. Komplexes mehrstufiges Reasoning, die Art von Code-Synthese, die die Reasoning-Modelle der o-Serie gut bewältigen, Bildverständnis und Bildgenerierung, Echtzeit-Sprachinteraktion. Nichts davon wird von gpt-oss-120b abgedeckt. Für solche Workloads müssen Sie entweder den US-gehosteten Weg akzeptieren oder andere Anbieter prüfen, die hohe Leistungsfähigkeit mit EU-Hosting über andere Modellfamilien kombinieren.

Das Modell ist rein textbasiert. Kein Vision, kein Audio, keine multimodale Fähigkeit. Für multimodale Workloads bietet OVH andere Modellfamilien wie Qwen2.5-VL über dasselbe Endpoint-Muster an, aber das sind andere Linien mit anderen Verhaltensprofilen.

Die Größenordnung von 120 Milliarden Parametern ist groß, aber nicht an der absoluten Leistungsobergrenze. Workloads, die wirklich ein Modell der Spitzenklasse benötigen, werden den Unterschied spüren. Für Workloads, die bequem in den 120b-Rahmen passen, spielt der Unterschied keine Rolle, und der EU-Hosting-Vorteil dominiert die Abwägung.

Auswahl und Alternativen

Für EU-Kunden, die Allzweck-Textanwendungen entwickeln und sowohl die OpenAI-Linie als auch die EU-Datenresidenz wünschen, ist gpt-oss-120b auf OVH die richtige Standardwahl. Die Konfiguration löst ein reales Problem, das für europäische Unternehmen und Beschaffungsstellen im öffentlichen Sektor seit Jahren ein Blocker war.

Für Workloads, die nicht spezifisch die OpenAI-Linie benötigen, bietet der OVH-Katalog starke Alternativen im gleichen Hosting-Rahmen. meta-llama-3_3-70b-instruct ist die Open-Weight-Option von Meta auf vergleichbarem Leistungsniveau. mistral-small-3.2-24b-instruct-2506 ist ein Modell europäischer Herkunft, das EU-souveränes Hosting mit einem in der EU trainierten Modell kombiniert. qwen3-32b ist eine starke Allzweckoption mit kleinerer Parameterzahl und geringeren Kosten.

Für Workloads, die eine kleinere, schnellere und günstigere Variante derselben OpenAI-Open-Weight-Linie benötigen, ist gpt-oss-20b das kleinere Geschwistermodell. Für Workloads, die echte Spitzenfähigkeit benötigen und US-gehostete Inferenz akzeptieren können, ist die OpenAI-Direkt-API mit neueren Reasoning- und multimodalen Modellen der alternative Weg. Die Wahl hängt davon ab, ob EU-souveränes Hosting eine harte Anforderung oder eine Präferenz ist, die für spezifische Leistungsbedarfe gelockert werden kann.

Letzte technische Überprüfung: 22.05.2026 — Tokonomix.ai

gpt-oss-120b — illustration 2
Letzter automatisierter Test
14. Sept. 2026 · 20:02 UTC · Geschwindigkeits-Benchmark
P50-Latenz
209 ms
P95-Latenz
359 ms
Fehler
0 / 6 Läufe
Zuletzt geprüft von Tokonomix-Team·26. Mai 2026