İçeriğe geç
Seviye A — Öncü
Çalıştığı yer:USYapıldığı yer:United States
OpenAI

gpt-5.4

Seviye A — Öncü

Tokonomix Editöryel Ekibi·İnceleyen Mes Kalkan··

GPT-5.4, OpenAI tarafından genel amaçlı metin üretim görevleri için geliştirilmiş büyük bir dil modelidir. İçerik oluşturma, soru yanıtlama, kod üretimi, analiz ve sohbet tabanlı etkileşimler dahil olmak üzere geniş bir uygulama yelpazesinde insan benzeri metinleri işlemek ve üretmek üzere tasarlanmıştır. Model, standart metin üretim yetenekleriyle çalışır; metin girdilerini kabul eder ve eğitim sırasında öğrenilen örüntülere dayanarak tutarlı yanıtlar üretir. OpenAI'nin GPT serisinin bir parçası olarak bu model, önceki nesillerde oluşturulan mimarinin bir devamını temsil eder ve sıralı verileri işlemek için transformer tabanlı sinir ağlarını kullanır. GPT-5.4'ün bağlam penceresi boyutu kamuya açıklanmamıştır; ancak çok turlu sohbetleri ve orta uzunluktaki belgeleri işlemesi beklenmektedir. Model, metni tokenizasyon yoluyla işler ve otoregresif dil modellerinde yaygın olan olasılıksal örnekleme yöntemleriyle çıktı üretir. GPT-5.4, OpenAI'nin geniş dil modeli yelpazesinde metin üretim iş yükleri için standart bir seçenek olarak konumlanır. Çok modlu girdi, fonksiyon çağırma veya genişletilmiş bağlam işleme gibi özelleşmiş özellikler aramayan, güvenilir doğal dil işleme yeteneklerine ihtiyaç duyan kullanıcılara hizmet vermek üzere konumlandırılmıştır. Modele OpenAI'nin API altyapısı üzerinden erişilebilir; bu sayede çeşitli uygulamalara ve hizmetlere entegre edilebilir. GPT ailesindeki diğer modeller gibi, çeşitli internet metin verileri üzerinde eğitilmiştir; ancak spesifik eğitim ayrıntıları ve veri seti içerikleri sağlayıcı tarafından tam olarak açıklanmamıştır.

GPT-5.4, OpenAI'nin üst seviye dil modeli ailesinde güvenilir bir genel amaçlı seçenek olarak konumlanıyor ve metin üretiminde tutarlı bir performans sergiliyor.

Tokonomix değerlendirme notu
Bölüm 01

Hız analizi

Tüm benchmark çalıştırmalarında ölçülen gecikme. P50 (medyan) ve P95 (95. yüzdelik) normal ve yoğun yük altında yanıt hızının gerçekçi bir resmini verir.

P50 gecikme (medyan)P95 gecikme105 runs
449781715185225532992108-1009-05ms
Bölüm 02

Kalite puanları

Bu modelin her soru kategorisinde sahanın geri kalanına göre nerede durduğu; aynı sorular üzerinde ikili karşılaştırmayla hesaplanır. Ham jüri puanı her sayının altındadır.

65%
Kod üretimi
jüri ortalaması 99
89%
Yaratıcı
jüri ortalaması 97
57%
Olgusal
jüri ortalaması 86
66%
Çok dilli
jüri ortalaması 99
74%
Akıl yürütme
jüri ortalaması 99

Kategori başına kazanma oranı: bu modelin o kategoriden bir soruda ortalama bir modeli ne sıklıkla yendiği. %50 ortalamadır, kalma notu değildir. Doğru cevap yüzdesi de değildir.

Bölüm 03

Fiyat geçmişi

Milyon token başına doğrudan sağlayıcı tarifeleri, artı tipik bir konuşma maliyet tahmini.

💰
API tarifeleri — gpt-5.4
$2.50 1M giriş token başına
$15.00 1M çıkış token başına
≈ $0.0045 tipik konuşma başına (800 token)
Giriş vs çıkış fiyatı (1M token başına)
1M giriş token başına$2.50
1M çıkış token başına$15.00

Pricing over time

Input & output per 1M tokens · step-line = price changes

$2.50

input / 1M

— stable

$15.00

output / 1M

— stable

2026-05-242026-07-262026-08-30
Input
Output
Price change
⟳ synced weekly
Bölüm 04

Saniye başına token

Ölçülen P50 gecikmesinden türetilen saniye başına token verimi. Yüksek daha iyidir; dalgalanmalar sağlayıcı tarafındaki yükü yansıtır.

Verim (token / s)341 / avg 283
441144

P50 gecikme × 200 çıkış token tahmininden hesaplandı — mutlak rakam bu varsayıma bağlıdır; önemli olan eğilimdir.

Bölüm 05

Güçlü & zayıf yönler

Benchmark sonuçları ve gerçek kullanım senaryolarına dair toplu topluluk geri bildirimine dayanır.

Güçlü yönler

Akıcı ve tutarlı metin üretimiÇok turlu sohbet desteğiKod üretme ve açıklama yeteneğiGeniş genel bilgi tabanıÇok dilli metin işlemeOpenAI API üzerinden kolay entegrasyonAnalitik ve özetleme görevlerinde başarıA sınıfı genel performans seviyesi

Zayıf yönler

Açıklanmamış bağlam penceresi boyutuMultimodal giriş desteği belirsizBilgi kesim tarihi şeffaf değilFonksiyon çağrısı yetenekleri net değil
Bölüm 06

Yetenekler

toolssource: litellmvisionjson modepdf inputreasoningjson schemaparallel toolsprompt cachingmax output tokens: 128000
Bölüm 07

Sık sorulan sorular

Bağlam penceresi boyutu OpenAI tarafından kamuya açıklanmamıştır. Modelin çok turlu sohbetleri ve orta uzunlukta belgeleri işleyebilmesi beklenmektedir, ancak büyük belge iş akışları için resmi belgelerin kontrol edilmesi önerilir.

Özel modalite veya genişletilmiş bağlam gerektirmeyen üretim iş yükleri için sağlam bir tercih; ancak şeffaflık eksiklikleri ciddi kurumsal entegrasyonlarda dikkatli değerlendirme gerektiriyor.

Tokonomix editör değerlendirmesi
Bölüm 08

Kullanılabilirlik

Kullanılabilirlik

Bu modelin çağrıldığında ne sıklıkla yanıt verdiği — son 30 gün içindeki gerçek API istekleri ve canlı testler üzerinden ölçülmüştür. Bu kaliteden bağımsızdır: bu sayılar yalnızca modelin yanıt verip vermediğini gösterir, yanıtın ne kadar iyi olduğunu değil.

Son 7 gün

Son 30 gün

100.0%

n=36

Medyan yanıt süresi

7,057ms

n=36

Baz alınan 416 ölçüm son 30 gün içinde.

Teknik detaylar

Yalnızca gerçek API çağrıları ve canlı test istekleri sayılır — dahili yoklamalar ve kıyaslama çalıştırmaları hariçtir.

Özel API anahtarıyla (BYOK) yapılan çağrılar hariçtir: bu hatalar anahtara özgüdür, model kesintisinin işareti değildir.

Başarısız çağrılar kalite puanlarına DAHİL EDİLMEZ — kalite yalnızca başarılı yanıtlar üzerinden ölçülür. Kullanılabilirlik ve kalite bağımsız sinyallerdir.

Kaydedilmiş süreye sahip başarılı çağrılarda medyan yanıt süresi (p50). Aykırı değerler medyanı ortalamadan daha az etkiler.

Toplam çağrı (30d)

36

OK yanıtlar (30d)

36

Toplam çağrı (7d)

0

OK yanıtlar (7d)

0

Bölüm 09

Tokonomix kıyaslama kararları

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-596/100 · 45 runs
44 correct0 partial1 wrong98% accuracy
2026-08-30

Major quality leap with 12.8-point gain; 29% faster response times

GPT-5.4 demonstrates substantial improvements across nearly all measured dimensions in this benchmark window. The overall quality score jumped from 82.5 to 95.3, representing a 12.8-point increase that places this model among the top performers we've evaluated. Response latency improved significantly, with p50 times dropping from 2219ms to 1585ms, a 29% reduction that should be noticeable in production use. Coding performance reached a perfect 100 score, up 8 points from the previous window, while factual accuracy showed dramatic improvement, rising from 56 to 94. Creative writing capabilities scored 91, and reasoning tasks achieved 96, both strong results. The previous window's perfect multilingual score of 100 was not retested in this cycle, so we cannot confirm whether that capability remains at the same level. The addition of creative writing and reasoning categories to the test suite this window provides new insight into the model's capabilities. With only 5 test runs in each window, these results should be considered preliminary, but the consistency of improvements across categories suggests genuine advancement rather than statistical noise.

Kalite

95.3

Gecikme p50

1,585 ms

Test çalıştırmaları

5

Quality improved 12.8 points 29% faster response times Coding reached perfect score Factual accuracy up 38 points
Bölüm 10

Tam model profili

gpt-5.4 — illustration 1
GPT-5.4: konsolidasyon nesli

Not — ileriye dönük profil. Bu sayfa, ya erken önizleme aşamasında olan, ya duyurulmuş ancak henüz genel kullanıma sunulmamış, ya da yol haritası sinyallerine dayalı olarak öngörülen bir modeli açıklamaktadır. Teknik özellikler ve yetenekler, kamuya açık lansmandan önce değişebilir. Bu sayfadaki canlı kıyaslama verileri, test altyapımızın bugün erişebildiği uç noktayı yansıtır.

GPT-5.4, OpenAI'nin daha geniş 5.x ailesi içindeki orta döngü konsolidasyon sürümüdür. Temel bir mimari değişim değil, çarpıcı bir yetenek sıçraması da değil — aslında olan şu: önceki nesillerden bu yana üretim ortamlarında ekipleri rahatsız eden konuların özenli bir biçimde rafine edilmesi. Sınır durumlarda daha iyi talimat takibi. Daha sıkı yapılandırılmış çıktı davranışı. Destek biletlerinde sürekli karşımıza çıkan o niş konularda halüsinasyonun azaltılması. Pazarlamacılardan çok mühendislerin sevdiği türden bir sürüm.

5.4 aslında neyi değiştiriyor

Öne çıkan iyileştirmeler sessiz. Dağılım dışı gerçeklerde halüsinasyon oranı, 5.2 ve 5.3 ile karşılaştırıldığında düşmüş durumda. Bu azalma sıfır değil ve model, az bilinen konularda hâlâ kulağa makul gelen iddiaları kendinden emin bir şekilde uydurabiliyor. Ancak rutin sorgularda bunun gerçekleşme oranı anlamlı ölçüde düştü; bu durum üretimde daha az düzeltme gerektiren destek vakası olarak kendini gösteriyor.

Yapılandırılmış çıktı daha güvenilir. Derinlemesine iç içe geçmiş şemalara karşı JSON-mode çıktısı, önceki nesillere kıyasla daha tutarlı biçimde geçerli çıktı üretiyor. Paralel araç çağrılarıyla fonksiyon çağırma daha öngörülebilir davranıyor. Eskiden savunmacı ayrıştırma gerektiren sınır durumlar — neredeyse geçerli JSON, şemaya hafifçe uymayan çıktılar — artık daha az görülüyor.

Uzun bağlam tutarlılığı kademeli olarak iyileşti. Model, uzun istemlerin başında belirlenen kısıtları önceki nesle göre daha güvenilir biçimde koruyor. Sistem istemine kapsamlı talimatlar yerleştiren iş akışları için, uzun çalıştırmalarda daha az talimat gözden kaçırılıyor.

Bunların hiçbiri tek başına çarpıcı değil. Birlikte ele alındığında 5.4, "öncekinden istediğimiz şeyi yapan sürümü" bekleyen ekipler için doğru varsayılan haline geliyor.

Kaputun altında

GPT-5.4, iç içe geçmiş metin ve görüntü girdilerini kabul eden, yalnızca metin çıktısı veren bir transformer kod çözücüdür. Görüntü yetenekleri her zamanki yüzeyi kapsar: grafik ve diyagram anlama, OCR tarzı metin çıkarımı, belge düzeni ayrıştırma, sahne tanımlama. Çıktı yalnızca metin olarak kalır — bu uç noktadan görüntü üretimi veya ses çıktısı yoktur.

OpenAI; parametre sayılarını, uzman yönlendirme ayrıntılarını veya 5.2 ile 5.3'ten kesin mimari değişiklikleri yayımlamadı. Model, ailedeki önceki nesillerden daha uzun bağlam pencerelerini kabul ediyor; ancak zor akıl yürütme görevlerinde pratik tutarlılık tavanı, nominal token sınırının altında kalıyor.

Tokenizasyon, standart GPT-5 BPE sözlüğünü kullanır. Görüntü girdileri, kutucuk başına sabit bir token maliyetiyle kutucuk olarak kodlanır. Bu nesil için eğitim kesme tarihi 2026'nın başlarına denk geliyor; bu da modelin son olaylar ve güncel kütüphane sürümleri hakkında bildiklerinin sınırını önceki nesillere göre birkaç ay ileri taşıyor.

Bugün nerede konumlanıyor

Genel amaçlı işler için — sohbet, yapılandırılmış çıktı, görüntü destekli analiz, ajan döngüleri — GPT-5.4 şu anda sevk edilebilir modellerin en üst kademesinde yer alıyor. Zekâ liderlik tablosu, Anthropic'in en güçlü kademesi ve Google'ın eşdeğeri karşısındaki karşılaştırmalı konumu izliyor. Sıralamalar her hafta yeni sürümler çıktıkça değişiyor, ancak 5.4 herhangi bir kategoride baskın olmaktan çok, çoğu kategoride rekabetçi.

Eski bir snapshot'a sabitlemek için belirli nedenleriniz, maliyet için daha küçük bir kademe çalıştırma gereğiniz veya zor akıl yürütme için Pro kademesine yükseltme ihtiyacınız yoksa, model OpenAI yığını üzerinde yeni geliştirmeler için doğru varsayılandır.

İçerik iş akışları için geliştirilmiş uzun bağlam tutarlılığı, kapsamlı stil rehberleri içeren iş akışlarında karşılığını veriyor. Veri çıkarımı için daha sıkı yapılandırılmış çıktı davranışı, alt akıştaki temizleme işini azaltıyor.

Sınırların hâlâ olduğu yer

Halüsinasyon azaldı ama ortadan kalkmadı. Model, yaygın bilgi konularında iyi kalibre edilmiş durumda ve geniş çapta belgelenmiş teknik materyallerde güvenilir bir özgüvene sahip. Az bilinen tarihsel olaylarda, yeni niş yayınlarda ve küçük kuruluşlarda hâlâ uydurma yapacaktır. Herhangi bir spesifik olgusal iddiayı, doğrulanana kadar bir hipotez olarak ele alın.

Düşük kaynaklı diller, başlıca Avrupa ve Doğu Asya dillerinden hâlâ daha zayıf. Aradaki fark nesiller boyunca daraldı ancak kapanmadı. Yayına almadan önce hedef dilde örnek kontroller yapın.

Uzun bağlam tutarlılığı iyi ama sonsuz değil. Yaklaşık 100 bin token yoğun girdinin ötesinde, istemin başında belirlenen kısıtlar kaymaya başlar. Uzun istemleri, kritik kısıtları üretim noktasının yakınında tekrarlayacak şekilde yapılandırın.

Pro kademesi en zor akıl yürütme görevlerinde hâlâ kazanıyor. Temel 5.4, çoğu iş için harika bir varsayılan, ancak iş yükü gerçek belirsizlik altında derin çok adımlı planlama gerektirdiğinde seçeceğiniz model değil.

5.4'ün doğru varsayılan olduğu zamanlar

Genel sohbet, içerik üretimi, yapılandırılmış çıktı, görüntü destekli analiz ve orta karmaşıklıktaki ajan döngüleri için temel 5.4'ü seçin. Yapay zekâ iş yükü genellikle zor olmaktan çok geniş olan ekipler için en basit tek uç nokta seçimidir.

Bu nesillerin sınırlamalarının sürtünme yarattığı, önceki 5.x nesillerinden geçiş için onu seçin. İyileştirmeler gerçek ve yüksek hacimli trafikte birikerek belirginleşiyor.

Yelpazenin uzun biçimli ucundaki içerik iş akışları için 5.4 doğru varsayılandır. Metin ve görüntüyü birlikte içeren karma belge iş akışları için, görüntü yeteneği artı yapılandırılmış çıktı güvenilirliği onu doğal bir tercih haline getiriyor.

Ne zaman başka bir şey seçmeli

Etkileşimli otomatik tamamlama ve maliyet için optimize edilmiş toplu trafik için, 5.4 ailesindeki mini ve nano kademeleri iş yükünü daha düşük maliyet ve gecikmeyle karşılar.

Zor akıl yürütme iş yükleri için — derin planlamalı ajan döngüleri, son derece karmaşık şemalara karşı yapılandırılmış çıktı, birçok faktörün dikkatli tartılmasını gerektiren analizler — Pro kademesine yükseltin.

Koda özgü iş yükleri için, daha geniş 5.x ailesindeki Codex varyantları daha iyi ayarlanmıştır. Temel 5.4 işlevsel kod üretir ancak deyim kalitesinde bir kod uzmanıyla aynı seviyede değildir.

Tekrarlanabilirliğe duyarlı iş yükleri için, değişken gpt-5.4 slug'ını okumak yerine tarihli gpt-5.4-2026-03-05 snapshot'una sabitleyin.

Alternatifler

Üst kademe akıl yürütmenin OpenAI ekosistem uyumundan daha önemli olduğu iş yükleri için, Anthropic'in en güçlü akıl yürütme kademesi ve Google'ın eşdeğer teklifleri kendi spesifik iş yükünüzde kafa kafaya karşılaştırmayı hak ediyor.

Hava boşluklu veya katı veri yerleşimi gereksinimleri olan dağıtımlar için, açık ağırlıklı sınır modeller, hiçbir OpenAI uç noktasının sunmadığı yerleşim hikâyesini size sağlar. Doğruluk farkı önemli ölçüde daraldı ve çoğu iş yükü için uygulanabilir durumda.

Maliyet için optimize edilmiş rutin trafik için, temel 5.4 ile daha küçük kademedeki kardeşler arasında bir yönlendirici çalıştırmak, önemli olduğunda tam yeteneğe erişimi korurken faturayı yönetilebilir tutar.

Son teknik inceleme: 2026-05-22 — Tokonomix.ai

gpt-5.4 — illustration 2
Son otomatik test
5 Eyl 2026 · 08:02 UTC · Hız testi
P50 gecikme
587 ms
P95 gecikme
593 ms
Hatalar
0 / 6 çalıştırma
Son inceleyen Tokonomix Ekibi·26 Mayıs 2026