İçeriğe geç
Seviye C — Uzman
Çalıştığı yer:FranceYapıldığı yer:United States
OVH AI Endpoints (GRA)

gpt-oss-120b

Seviye C — Uzman

Tokonomix Editöryel Ekibi·İnceleyen Mes Kalkan··

GPT-OSS-120B, OVH AI Endpoints aracılığıyla sunulan ve şirketin GRA (Gravelines, Fransa) veri merkezi bölgesinde barındırılan büyük bir dil modelidir. Bu model, OVH'nin açık kaynaklı dil modeli altyapısını Avrupa bulut altyapısı üzerinde dağıtarak sunmasını temsil etmektedir. 120 milyar parametrelik ölçek, modeli metin üretimi, sohbet, analiz ve temel akıl yürütme dahil olmak üzere genel amaçlı doğal dil işleme görevlerini yerine getirebilecek kapsamlı bir model konumuna yerleştirmektedir. Model; tutarlı uzun biçimli içerik, soru yanıtlama, özetleme ve benzeri NLP iş yükleri gerektiren uygulamalara uygun standart metin üretimi yetenekleri sunmaktadır. Spesifik bağlam penceresi boyutu kamuya açık olarak belgelenmemiş olsa da model, bu parametre aralığındaki modeller için tipik olan geleneksel transformer mimarisi kalıplarını takip etmektedir. OVH AI Endpoints, bu modeli API altyapısı aracılığıyla sunarak geliştiricilerin temel hesaplama kaynaklarını yönetmeden büyük dil modeli yeteneklerini entegre etmesine olanak tanımaktadır. OVH'nin AI Endpoints portföyü içinde GPT-OSS-120B, Avrupa altyapısı dahilinde veri egemenliğini korurken kapsamlı dil işleme yetenekleri arayan müşterilere sunulan daha büyük açık kaynaklı model seçeneklerinden biri olarak hizmet vermektedir. GRA dağıtım konumu, Avrupa düzenlemeleri kapsamında veri ikamet gereksinimleri olan kullanıcılar için özellikle önemli olabilir. OVH'nin yaklaşımı, açık kaynaklı modellere mevcut bulut altyapısı aracılığıyla erişim sağlamaya odaklanarak Avrupa barındırma pazarındaki yerleşik konumundan yararlanırken tescilli model sağlayıcılarına bir alternatif sunmaktadır.

Avrupa'da barındırılan bu model, GDPR uyumluluğu gerektiren kurumlar için güvenli bir seçenek sunuyor.

Tokonomix benchmark özeti
Bölüm 01

Hız analizi

Tüm benchmark çalıştırmalarında ölçülen gecikme. P50 (medyan) ve P95 (95. yüzdelik) normal ve yoğun yük altında yanıt hızının gerçekçi bir resmini verir.

P50 gecikme (medyan)P95 gecikme100 runs
133210440766047801808-2109-14ms
Bölüm 02

Kalite puanları

Bu modelin her soru kategorisinde sahanın geri kalanına göre nerede durduğu; aynı sorular üzerinde ikili karşılaştırmayla hesaplanır. Ham jüri puanı her sayının altındadır.

60%
Kod üretimi
jüri ortalaması 95
84%
Yaratıcı
jüri ortalaması 96
61%
Olgusal
jüri ortalaması 81
54%
Çok dilli
jüri ortalaması 98
70%
Akıl yürütme
jüri ortalaması 86

Kategori başına kazanma oranı: bu modelin o kategoriden bir soruda ortalama bir modeli ne sıklıkla yendiği. %50 ortalamadır, kalma notu değildir. Doğru cevap yüzdesi de değildir.

Bölüm 03

Fiyatlar

Bu modeli Tokonomix üzerinden kullandığınızda milyon token başına ödediğiniz tutar ve tipik bir konuşma için tahmini maliyet.

💰
API tarifeleri — gpt-oss-120b
$0.2100 1M giriş token başına
$1.04 1M çıkış token başına
≈ $0.0003 tipik konuşma başına (800 token)
Giriş vs çıkış fiyatı (1M token başına)
1M giriş token başına$0.2100
1M çıkış token başına$1.04
Bölüm 04

Saniye başına token

Ölçülen P50 gecikmesinden türetilen saniye başına token verimi. Yüksek daha iyidir; dalgalanmalar sağlayıcı tarafındaki yükü yansıtır.

Verim (token / s)957 / avg 684
148789

P50 gecikme × 200 çıkış token tahmininden hesaplandı — mutlak rakam bu varsayıma bağlıdır; önemli olan eğilimdir.

Bölüm 05

Güçlü & zayıf yönler

Benchmark sonuçları ve gerçek kullanım senaryolarına dair toplu topluluk geri bildirimine dayanır.

Güçlü yönler

GDPR uyumlu Avrupa altyapısıVeri egemenliği güvencesiGeniş parametre kapasitesiMetin üretimi ve özetlemeÇok turlu sohbet desteğiTalimat takibinde yüksek başarı

Zayıf yönler

Bölgesel altyapı gecikme değişkenliğiİnternet erişimi bulunmuyorGörsel işleme desteği yok
Bölüm 06

Yetenekler

ownedBy: OpenAI
Bölüm 07

Sık sorulan sorular

OVH GRA veri merkezinde barındırılan model, Avrupa veri egemenliği gereksinimlerini destekliyor.

OVH Avrupa altyapısı üzerindeki bu model, veri egemenliği açısından stratejik bir tercih.

Tokonomix benchmark özeti
Bölüm 08

Kullanılabilirlik

Kullanılabilirlik

Bu modelin çağrıldığında ne sıklıkla yanıt verdiği — son 30 gün içindeki gerçek API istekleri ve canlı testler üzerinden ölçülmüştür. Bu kaliteden bağımsızdır: bu sayılar yalnızca modelin yanıt verip vermediğini gösterir, yanıtın ne kadar iyi olduğunu değil.

Son 7 gün

Son 30 gün

100.0%

n=1

Medyan yanıt süresi

7,695ms

n=1

Baz alınan 386 ölçüm son 30 gün içinde.

Teknik detaylar

Yalnızca gerçek API çağrıları ve canlı test istekleri sayılır — dahili yoklamalar ve kıyaslama çalıştırmaları hariçtir.

Özel API anahtarıyla (BYOK) yapılan çağrılar hariçtir: bu hatalar anahtara özgüdür, model kesintisinin işareti değildir.

Başarısız çağrılar kalite puanlarına DAHİL EDİLMEZ — kalite yalnızca başarılı yanıtlar üzerinden ölçülür. Kullanılabilirlik ve kalite bağımsız sinyallerdir.

Kaydedilmiş süreye sahip başarılı çağrılarda medyan yanıt süresi (p50). Aykırı değerler medyanı ortalamadan daha az etkiler.

Toplam çağrı (30d)

1

OK yanıtlar (30d)

1

Toplam çağrı (7d)

0

OK yanıtlar (7d)

0

Bölüm 09

Tokonomix kıyaslama kararları

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-592/100 · 87 runs
76 correct7 partial4 wrong87% accuracy
2026-09-13

gpt-oss-120b quality plummets 14.7 points with notable latency regression

The gpt-oss-120b model experienced significant degradation across multiple dimensions in this benchmark window. Overall quality dropped sharply from 92.9 to 78.2, representing a 14.7 point decline that follows a previous 5 point drop. This marks consecutive windows of deterioration for the model. Performance across categories became highly inconsistent, with reasoning showing perfect scores at 100 while factual accuracy collapsed to just 52 points, down from unmeasured in the previous window. Coding capability also declined from 95 to 83. Latency regressed further, increasing 17 percent from 4243ms to 4959ms at the median, compounding previous latency issues. The dramatic variance in category performance suggests potential instability in the model deployment or configuration. The particularly concerning factual accuracy score of 52 indicates the model may struggle with knowledge-based queries. Users should exercise caution when relying on this model for fact-intensive applications and be prepared for longer response times. The consecutive quality drops across two benchmark windows warrant investigation into whether infrastructure or model changes at OVH GRA are impacting performance.

Kalite

78.2

Gecikme p50

4,959 ms

Test çalıştırmaları

5

Quality dropped 14.7 points Factual accuracy critically low Latency increased 17% Reasoning performance perfect score
Bölüm 10

Tam model profili

gpt-oss-120b — illustration 1
OVH gpt-oss-120b: OpenAI'ın açık ağırlıklı amiral gemisi AB egemen altyapısında barındırılıyor

OVH AI Endpoints, gpt-oss-120b'yi Gravelines (Fransa) veri merkezinden sunuyor. Asıl hikâye de bu kombinasyon. OpenAI, 120 milyar parametreli, açık ağırlıklı bir model yayımladı. OVH ise bu modelin çıkarımını, GDPR'a uyumlu doğal operasyonlar ve AB veri ikametgâhı garantileriyle birlikte Fransız altyapısı içinde barındırıyor. ABD merkezli çıkarım uç noktalarına trafik göndermek zorunda kalmadan kullanabilecekleri, yüksek yetenekli, OpenAI soyundan bir model bekleyen Avrupalı ekipler için açılan yol işte bu yapılandırma.

OpenAI ve OVH birlikteliği neden önemli

gpt-oss-120b'nin sunduğu yetenek profili, AB egemen barındırma altında mevcut olan diğer her şeye kıyasla OpenAI'ın sınırına en yakın olanı. Diğer sağlayıcılardan gelen açık ağırlıklı modeller karşılaştırmalarda rekabetçi olsa da OpenAI soyağacı, üretim sistemlerinin yıllardır kalibre ettiği talimat takibi alışkanlıklarını, yapılandırılmış çıktı güvenilirliğini ve muhakeme örüntülerini de beraberinde getiriyor. Farklı bir model ailesine geçiş, karşılaştırma puanları benzer görünse bile bedelsiz değil.

Fransa içinde OVH üzerinde barındırma, AB müşterilerinin gerçekten ihtiyaç duyduğu veri işleme sözleşmesi anlatısını size sağlıyor. Trafik Fransa sınırları içinde kalıyor. Operasyonlar Fransız ve Avrupa veri hukukuna tabi yürütülüyor. Müşterilerinizle yapacağınız DPA konuşması, Anthropic tarzı veri koruma şartları ne kadar iyileşirse iyileşsin ABD merkezli OpenAI uç noktalarını çağırırken hiçbir zaman tam olarak olmayan bir şekilde sade ve anlaşılır hale geliyor.

Bunun karşılığında, OpenAI'ın en son davranışından vazgeçiyorsunuz. gpt-oss-120b ağırlıkları sürekli güncellenen bir üretim modeli değil, sabit bir anlık görüntü. OpenAI kendi API'si üzerinden daha yeni muhakeme modelleri, görüntü modelleri ve çok modlu yetenekler sunmaya devam ediyor ve bunlar açık ağırlık sürümüne yansımıyor. Açık ağırlıklı 120b yeteneğinin yeterli olduğu iş yükleri için bu sorun değil. Sınır yetenekten medet uman iş yükleri için ise doğru araç bu değil.

Neyi iyi karşılıyor

Genel amaçlı metin üretimi, talimat takibi, yapılandırılmış çıktı, çok turlu diyalog. 120b parametre ölçeği; orta düzeyde karmaşık muhakemeyi, önemsiz olmayan kapsamda kod sentezini ve tutarlı yapıyla uzun biçim üretimi karşılayacak kadar büyük. Daha önce genel işler için GPT-4 sınıfı modellerde çalışan iş yüklerinin çoğu için gpt-oss-120b inanılır bir alternatif.

Çok dilli kapsama Avrupa dillerinde güçlü; bu da bu barındırma yapılandırmasının hedeflediği AB müşteri tabanı için önemli. Fransızca, Almanca, Felemenkçe, İspanyolca, İtalyanca, Portekizce ve Lehçe iyi çalışıyor. Model; çeviri, çok dilli müşteri desteği ve ABD'de barındırılan alternatiflerin çıktı tarzıyla zaman zaman Anglo-merkezli hissettiren dillerde içerik üretimi konusunda rahat.

OVH barındırması, öngörülebilir Avrupa gecikme süresi sunuyor. Gravelines veri merkezi, kıta Avrupası ve Birleşik Krallık'tan düşük gecikmeli erişim için iyi konumlanmış. Gecikme süresine duyarlı uygulamalar için gidiş-dönüş süresi, ABD'de barındırılan OpenAI uç noktalarına giden transatlantik rotalardan belirgin biçimde daha iyi.

Nerede yetersiz kalıyor

En zorlu iş yükleri için sınır yetenek açığı gerçek. Karmaşık çok adımlı muhakeme, o-serisi muhakeme modellerinin iyi karşıladığı türden kod sentezi, görüntü anlama ve üretimi, gerçek zamanlı ses etkileşimi. Bunların hiçbiri gpt-oss-120b tarafından ele alınmıyor. Bu iş yükleri için ya ABD merkezli barındırma yolunu kabul etmeniz ya da yüksek yeteneği farklı model aileleriyle AB barındırması altında birleştiren diğer sağlayıcılara bakmanız gerekiyor.

Model yalnızca metin üzerine. Görme yok, ses yok, çok modlu yetenek yok. Çok modlu iş yükleri için OVH, aynı uç nokta desenini kullanan Qwen2.5-VL gibi başka model aileleri sunuyor; ancak bunlar farklı davranış profillerine sahip farklı soyağaçları.

120b parametre ölçeği büyük ama mutlak yetenek tavanında değil. Gerçek anlamda sınır sınıfı bir modele ihtiyaç duyan iş yükleri farkı hissedecek. 120b zarfının içine rahatça oturan iş yükleri için fark önemli değil ve AB barındırma avantajı, ödünleşme hesabında baskın hale geliyor.

Seçimi ve değerlendirilecek diğer seçenekler

OpenAI soyağacını ve AB veri ikametgâhını isteyen, genel amaçlı metin uygulamaları geliştiren AB müşterileri için OVH üzerindeki gpt-oss-120b doğru varsayılan seçimdir. Bu yapılandırma; Avrupa kurumları ve kamu sektörü alıcıları için yıllardır tedarik açısından engel olan gerçek bir sorunu çözüyor.

Özellikle OpenAI soyağacına ihtiyaç duymayan iş yükleri için OVH'ın kataloğu, aynı barındırma zarfında güçlü alternatifler sunuyor. meta-llama-3_3-70b-instruct benzer yetenek katmanındaki Meta açık ağırlık seçeneği. mistral-small-3.2-24b-instruct-2506 ise AB egemen barındırmasını AB kökenli eğitimle birleştiren Avrupa kökenli bir model. qwen3-32b ise daha küçük parametre ölçeğinde ve daha düşük maliyetle güçlü bir genel amaçlı seçenek.

Aynı OpenAI açık ağırlık soyağacının daha küçük, daha hızlı ve daha ucuz bir varyantına ihtiyaç duyan iş yükleri için gpt-oss-20b küçük kardeşi konumunda. Gerçek sınır yeteneğine ihtiyaç duyan ve ABD'de barındırılan çıkarımı kabul edebilen iş yükleri için ise daha yeni muhakeme ve çok modlu modellere sahip doğrudan OpenAI API'si alternatif yoldur. Seçim, AB egemen barındırmasının katı bir gereklilik mi yoksa belirli yetenek ihtiyaçları için gevşetilebilecek bir tercih mi olduğuna bağlı.

Son teknik inceleme: 2026-05-22 — Tokonomix.ai

gpt-oss-120b — illustration 2
Son otomatik test
14 Eyl 2026 · 20:02 UTC · Hız testi
P50 gecikme
209 ms
P95 gecikme
359 ms
Hatalar
0 / 6 çalıştırma
Son inceleyen Tokonomix Ekibi·26 Mayıs 2026