İçeriğe geç
Seviye B — Üretim
Çalıştığı yer:USYapıldığı yer:United States
$10.00
çıktı · 1M token başına (maliyet bazı)
Maliyet
4,774 ms
Yanıt hızı
100 / 100
Zeka

Karar — özetLIVE

LIVE
şimdi · 2026-07-26

GPT-5 shows significant quality decline with category instability

Quality score dropped 8% Factual accuracy critically low Latency increased 19% Multilingual capability at 100

The latest benchmark window reveals concerning performance degradation for GPT-5. The overall quality score dropped from 37.2 to 34.3, representing an 8% decline. More alarming is the categorical instability: coding capabilities have disappeared entirely from measurements, while reasoning shows a zero score. Factual accuracy has collapsed to just 2 out of 100, down from unmeasured in the previous window. Creative performance also declined from 45 to 35. The only bright spot is multilingual capability, which jumped from 0 to a perfect 100, suggesting either a focused improvement or measurement inconsistency between windows. Latency has also worsened, with p50 response times increasing 19% from 8765ms to 10430ms, making the model notably slower. The shifting category measurements across windows raise questions about result consistency. Users should exercise caution with factual queries and reasoning tasks, where the model currently shows critical weaknesses. The multilingual improvement may benefit international users, but overall trajectory suggests instability in the model's capabilities. These results warrant careful monitoring in subsequent benchmark windows to determine whether this represents temporary variance or a sustained decline in performance.

Quality

34.3

Latency p50

10,430 ms

Test runs

5

1 / 11

Görsel ve açıklamaLIVE

OpenAI

gpt-5-2025-08-07

Seviye B — Üretim

Tokonomix Editöryel Ekibi·İnceleyen Mes Kalkan··

GPT-5-2025-08-07, OpenAI'ın Ağustos 2025'te piyasaya sürdüğü son nesil dil modelidir. Bu model, GPT-4 serisine göre önemli bir mimari ilerleme sunarak geliştirilmiş muhakeme yetenekleri, artırılmış olgusal doğruluk ve çeşitli doğal dil işleme görevlerinde daha sağlam performans içerir. Karmaşık analiz, yaratıcı yazım, teknik dokümantasyon, kod üretimi ve çok adımlı problem çözme dahil olmak üzere genel amaçlı metin üretimi için tasarlanmıştır. Model, açıklanmamış bir bağlam penceresi boyutuna sahip standart metin üretim yetenekleri sunar. GPT-5, öncüllerine kıyasla mantıksal tutarlılıkta kayda değer iyileştirmeler, azaltılmış halüsinasyon oranları ve daha iyi talimat takibi gösterir. Önceki sürümlerden daha güncel bir bilgi kesme noktası üzerinde eğitilmiştir, ancak OpenAI belirli eğitim verisi kompozisyonunu veya parametre sayılarını açıklamamıştır. Model, özellikle uzun sohbetlerde tutarlılığı koruma ve kullanıcının örtük niyetini yorumlamayı gerektiren nüanslı talimatları işleme konusunda güçlü performans sergiler. OpenAI'ın model yelpazesinde GPT-5-2025-08-07, genel erişime açık en yetenekli model olarak en üst katmanda yer alır. GPT-4 Turbo ve GPT-4o gibi varyantları içeren GPT-4 ailesinin halefidir. Bu model, son teknoloji dil anlama ve üretim yetenekleri gerektiren kullanıcılar için OpenAI'ın amiral gemi ürünü olarak konumlandırılmıştır. Tarih damgalı sürüm tanımlayıcısı, Ağustos 2025'ten bu spesifik anlık görüntüyü belirtir ve OpenAI'ın üretim uygulamalarında tutarlılık ve tekrarlanabilirlik için sürümlenmiş yayınlar sürdürme geleneğini takip eder.

GPT-5-2025-08-07, OpenAI'ın genel amaçlı dil modelleri arasında en gelişmiş mimariyi sunan, mantıksal tutarlılık ve talimat takibinde önceki nesillere göre belirgin iyileştirmeler getiren yeni nesil modelidir.

Tokonomix model karşılaştırma analizi

Yetenekler

toolssource: litellmvisionjson modepdf inputreasoningjson schemaparallel toolsprompt cachingmax output tokens: 128000
gpt-5-2025-08-07 — illustration 1
GPT-5 (2025-08-07 anlık görüntüsü): sabitlenmiş orijinal

Bu, orijinal GPT-5 temel modelinin tarihli anlık görüntüsüdür; 7 Ağustos 2025'te yayımlanmış ve o noktada dondurulmuştur. Değişken gpt-5 etiketi, ona işaret eden ekipler altında ilerlemeye devam etse de, bu tarihli sürüm belirli bir ağırlık setini, belirli bir davranış profilini ve tek bir yeniden üretilebilir eseri yakalar. Bu da onu dar ama önemli bir iş kümesi için kullanışlı kılar: karşılaştırma temel çizgileri, düzenlenmiş iş akışları ve altı ay sonra aynı modele işaret edip aynı yanıtı almayı gerektiren her ürün.

Tarihli anlık görüntüler neden var

OpenAI her nesli iki farklı biçimde yayımlar. Değişken ad (gpt-5) o anda önerilen anlık görüntüyü izler. Tarihli ad (gpt-5-2025-08-07) ağırlıkların belirli bir sürümünü sabitler. Değişken etiket sessiz iyileştirmelerden yararlanır; tarihli etiket ise sizi asla şaşırtmamasının avantajını sunar.

Zaman içinde değerlendirme karşılaştırmaları için tarihli etiket tek dürüst seçimdir. Aralık ayında yayımladığınız kıyaslama raporunuz "GPT-5 testlerimizde X puan aldı" diyorsa ve birisi bunu Mayıs'ta değişken etikete karşı tekrar çalıştırırsa, aynı modeli karşılaştırmıyor olacaktır. Tarihli anlık görüntü bu sorunu çözer. 7 Ağustos 2025'teki davranış, OpenAI bu uç noktayı eninde sonunda kullanımdan kaldırana kadar, ne zaman buraya bağlanırsanız alacağınız davranıştır.

Bu anlık görüntü nedir

GPT-5, GPT-5 ailesinin ilk modeliydi ve çok modlu bir metin-ve-görsel ileri-cephe modeli olarak yayımlandı. 2025-08-07 anlık görüntüsü lansman davranışını yansıtır: OpenAI'nin 2025 ortasında kullandığı bilgi kesim tarihine kadarki eğitim verisi, orijinal güvenlik eğitimi geçişi, orijinal görsel-kodlayıcı kalibrasyonu, orijinal araç kullanımı davranışları.

Sonraki değişken etiket güncellemeleri bu özellikleri kaydırdı. Daha geniş 5.x serisi boyunca belgelenen değişiklikler arasında uç durumlarda iyileştirilmiş talimat takibi, belirli içerik kategorilerinde ayarlanmış reddetme davranışı ve görsel OCR'da artımlı iyileştirmeler yer aldı. Bu değişikliklerin hiçbiri bu anlık görüntüye dokunmuyor. Ağustos 2025'te ne aldıysanız, bugün de onu alıyorsunuz.

Kaputun altında

Model, araya eklenmiş metin ve görsel girdileri kabul eden ve yalnızca metin çıktısı üreten bir transformer dekoderdir. Parametre sayısı, uzman yönlendirme ayrıntıları ve mimari seçimlerin kesin biçimi kamuya açık değildir. Tokenizasyon, GPT-5 BPE sözlüğünü kullanır. Görsel girdiler, fayans başına sabit bir token maliyetiyle fayans-kodlanır; bu da çok sayfalı belge iş yüklerinde hızla birikir.

Bu anlık görüntü için eğitim kesim tarihi 2025 ortasındadır. Model, o döneme ait ana akım dil standartlarını ve framework sürümlerini bilir ve daha yeni olan her şey hakkında neşeyle uydurma yapar. Yakın olayları veya yeni kütüphane API'lerini içeren iş akışları için bu önemlidir — anlık görüntüyü sabitleyin, bilginin yaşlandığını kabul edin ve güncel olaylara dair sorguları modelin parametrik bilgisine güvenmek yerine arama veya web aramasıyla yönlendirin.

Bugün nerede duruyor

Daha geniş ileri-cephe model manzarasına karşı, GPT-5'in Ağustos 2025 anlık görüntüsü genel amaçlı görevlerde üst kademede, görsel-ağırlıklı işlerde ise üst-orta kademede konumlanır. Daha yeni 5.1, 5.2 ve sonraki anlık görüntüler çoğu metrikte onun önüne geçti. Zeka liderlik tablosu karşılaştırmalı sıralamayı izler.

Ağustos 2025'te sabitlenmiş bir anlık görüntü için bu beklenen örüntüdür. Amaç, Mayıs 2026'da mevcut en iyi mutlak model olmak değildir; amaç, karşılaştırmaların ve denetimlerin geçerli kalması için Mayıs 2026'da Ağustos 2025'tekiyle aynı model olmaktır.

Bu anlık görüntüye ne zaman sabitlenmeli

Yeniden üretilebilirlik en yüksek kaliteden daha değerli olduğunda gpt-5-2025-08-07'e başvurun. Belirgin kullanım durumları:

Zaman içinde değerlendirme karşılaştırmaları. Kıyaslama paketiniz bu anlık görüntü yayımlandığında ona karşı çalıştırıldıysa, değişken etiket yerine yine bu anlık görüntüye karşı çalıştırın. Aksi takdirde kendi değişikliğinizi değil, modelin evrimini ölçüyorsunuz demektir.

Denetim izlerinin belirli bir çıktıyı üreten kesin modeli tanımlaması gereken düzenlenmiş kararlar. Bir denetçi hangi sürümü kullandığınızı sorduğunda "gpt-5 kullandık" yetersiz bir cevaptır. "gpt-5-2025-08-07 kullandık" yeterlidir.

Kalite SLA'ları belirli bir model davranışına göre kalibre edilmiş müşteriye dönük özellikler. İstemleriniz ve birkaç örnekli örnekleriniz bu anlık görüntüye göre ayarlandıysa, yeniden ayarlama yapmadan daha yenisine geçmek ince gerilemeler riski taşır.

Kontrolün test süresi boyunca gerçekten sabit kalması gereken uzun soluklu A/B deneyleri.

Bu anlık görüntüye ne zaman sabitlenmemeli

Yeni özelliklerin geliştirilmesi için bundan kaçının. Bunun yerine değişken etiketi veya en son tarihli anlık görüntüyü kullanın; geliştirme yaparken mevcut en yetenekli modeli istersiniz, hâlâ çalışan en eskisini değil.

Daha yeni anlık görüntülerdeki kazanımların gerçek olduğu ve davranış kaymasının maliyetinin düşük olduğu genel amaçlı sohbet ve içerik iş akışları için bundan kaçının. 5.1, 5.2 ve sonraki anlık görüntüler aynı iş yüklerinde daha iyidir. Yalnızca geçmiş önem taşıdığında geçmişe sabitlenin.

2025 ortasından sonraki olaylara dair bilgiye dayanan herhangi bir istem çalıştırıyorsanız bundan kaçının. Model bilmiyor. Tahmin edecek. Tahminler bazen doğru görünecek, bazen ise tamamen yanlış olacak.

Operasyonel notlar

OpenAI, tarihli anlık görüntüler için kullanımdan kaldırma takvimleri yayımlar. Eski anlık görüntüler eninde sonunda kullanımdan kalkar. Bu, buna olduğunda, bu etikete sabitlenmiş kodunuz hata döndürmeye başlayacaktır. Önceden plan yapın: kullanımdan kaldırma duyurularına abone olun ve bir sonraki sabitleyeceğiniz anlık görüntüye doğru ileriye dönük bir yol sürdürün.

Görsel yeteneğin yük taşıdığı veri çıkarma iş akışları için Ağustos 2025 anlık görüntüsü yeterli düzeydedir ancak daha sonraki görsel-kodlayıcı iyileştirmeleri tarafından geride bırakılmıştır. İş izin veriyorsa, sabitlemeyi taşıyıp taşımayacağınıza karar vermeden önce birkaç hafta boyunca aynı belgeleri bu anlık görüntü ve daha yeni bir anlık görüntü üzerinden paralel olarak çalıştırın.

Alternatifler

Aynı tür sabitlenmiş yeniden üretilebilirliğe ihtiyaç duyan ancak farklı bir modele önem veren iş akışları için, her ileri-cephe sağlayıcısı artık değişken etiketlerinin yanında tarihli anlık görüntüler de yayımlıyor. Bu örüntü sektör standardıdır. Kalite ve modalite gereksinimlerinize uyan modeli seçin, ardından değişken sürümünü değil, tarihli sürümünü sabitleyin.

Rutin iş yüklerinde saf maliyet optimizasyonu için, 5.x ailesinin daha küçük üyeleri (mini ve nano kademeleri) genel amaçlı sohbetin gerçekte ihtiyaç duyduğu şeylerin çoğunu maliyetin küçük bir kısmına karşılar. Orada da yeniden üretilebilirliğe önem veriyorsanız o anlık görüntüleri de sabitleyin.

Son teknik inceleme: 2026-05-22 — Tokonomix.ai

gpt-5-2025-08-07 — illustration 2gpt-5-2025-08-07 — illustration 3

Sağlayıcı karşılaştırmasıLIVE

Sağlayıcı karşılaştırması
Bu modeli sunan her sağlayıcıyı karşılaştırın — maliyet temeli, kalite, gecikme ve çalışma süresi.
Azure OpenAI (EU - Sweden)AB
Girdi maliyetien iyi$1.25
Çıktı maliyeti$10.00
KaliteHenüz test edilmedi
Gecikme (p50)Henüz test edilmedi
Çalışma süresiHenüz test edilmedi
Maliyetler 1M token başına (maliyet temeli)
OpenAIABDBu sunum
Girdi maliyeti$1.25
Çıktı maliyeti$10.00
Kaliteen iyi100.0
Gecikme (p50)en iyi4,774 ms
Çalışma süresiHenüz test edilmedi
Maliyetler 1M token başına (maliyet temeli)

Konsensüs zekâsı

MODEL GENELİ

Konsensüs sinyalleri model geneli — henüz sağlayıcı başına ayrılmadı.

8.0

Ajan faydası (1–10)

Hassasiyet puanı

0

Benzersiz tespitler

0

Doğrulanmış istekler

Topluluk oylarıLIVE

Topluluk oyları
Gerçek ziyaretçiler ne düşünüyor — sağlayıcı başına.
Azure OpenAI (EU - Sweden)AB

Henüz topluluk oyu yok.

OpenAIABD

Henüz topluluk oyu yok.

Daha fazla sonuç — sağlayıcı başına

Kategoriye göre kalite

YaratıcıOlgusalÇok dilliAkıl yürütme

Oyun değerlendirmesi

Henüz veri yok.

Jüri kararı

Tamam 38%Kısmi 0%Yanlış 62%

Oyunlar ve arena

Henüz veri yok.

Hız ve sağlık

4,774 ms

Gecikme (p50)

Çalışma süresi

Soru & cevap — göz atLIVE

1 / 80
🧠 zekâOpenAImultilingual · 2026-07-26puan: 100

Bir mağazada %20 indirim uygulanıyor. 150 TL olan bir ürün indirimden sonra kaç TL olur?

%20 indirim, 150 TL’nin %20’si olan 30 TL’yi düşmek demektir. 150 − 30 = 120 TL Ya da 150 × 0,8 = 120 TL.

Test geçmişi — tüm sağlayıcılarLIVE

Zaman içinde kalite puanıen son 34
06-2807-26
Hız — zaman içinde p50 gecikme

Bu model birkaç farklı günde test edildiğinde bir trend görünür.