İçeriğe geç
Seviye C — Uzman
Çalıştığı yer:USYapıldığı yer:United States
$4.40
çıktı · 1M token başına (maliyet bazı)
Maliyet
630 ms
Yanıt hızı
Henüz test edilmedi
Zeka

Karar — özetLIVE

LIVE
şimdi · 2026-07-26

Quality drops 44 points as factual and reasoning scores fall to zero

Quality dropped 44 points Factual and reasoning at zero Creative score improved to 96 Multilingual reaches perfect 100

The o4-mini model has experienced a significant performance degradation in the current benchmark window, with overall quality falling from 93.0 to 48.9 out of 100. The most concerning development is the complete collapse of factual and reasoning capabilities, both now scoring zero compared to their absence from measurement in the previous window. This suggests either newly tested categories exposing critical gaps or actual regression in core competencies. On the positive side, the model maintains exceptional performance in specific areas. Creative tasks score an impressive 96, showing slight improvement from the previous 92. Multilingual capabilities have strengthened to a perfect 100, up from 87. However, coding performance is no longer measured in this window, making direct comparison impossible. Latency has increased modestly from 3887ms to 4098ms at the median, representing a 5.4% slowdown. With only 5 test runs in each window, sample size remains limited for drawing definitive conclusions. Users should be aware that while o4-mini excels at creative and multilingual tasks, it currently shows no measurable capability in factual accuracy or logical reasoning according to these benchmarks. This asymmetric performance profile makes the model suitable only for specific use cases.

Quality

48.9

Latency p50

4,098 ms

Test runs

5

1 / 10

Görsel ve açıklamaLIVE

OpenAI

o4-mini

Seviye C — Uzman

Tokonomix Editöryel Ekibi·İnceleyen Mes Kalkan··

o4-mini, OpenAI tarafından o-serisi ailesinin bir parçası olarak geliştirilen bir dil modelidir. Bu seri, GPT modellerinden farklı bir yaklaşım sunarak modelin karmaşık sorguları yanıt üretmeden önce çok adımlı analizle işlemesine imkân tanıyan genişletilmiş akıl yürütme yeteneklerini barındırır. o4-mini varyantı, mantıksal problem çözme ve analitik görevler gerektiren uygulamalar için akıl yürütme performansı ile hesaplama verimliliğini dengelemek üzere tasarlanmış, bu yelpazedeki daha kompakt bir sürüm olarak konumlanmaktadır. Model, standart metin üretme yeteneklerini destekler ve matematiksel akıl yürütme, kodlama desteği, bilimsel analiz ile sistematik düşünmenin değerli olduğu diğer alanlardaki kullanım senaryoları için tasarlanmıştır. OpenAI, parametre sayısı ve mimari hakkında belirli teknik ayrıntıları kamuya açıklamamış olsa da o-serisi modeller, karmaşık problemlerde yanıt kalitesini artırmak için çıkarım sırasında ek hesaplama kaynağı ayırma yetenekleriyle öne çıkmaktadır. o4-mini için bağlam penceresi boyutu şu an itibarıyla resmi olarak doğrulanmamıştır. OpenAI'ın model portföyünde o4-mini, GPT-4 serisinin yanında özelleşmiş bir rol üstlenir. GPT modelleri geniş kapsamlı sohbet yeteneği ve genel amaçlı metin üretimini ön plana çıkarırken, o-serisi daha derin analitik işleme gerektiren görevlere odaklanır. "mini" ifadesi, bu varyantın o4 ailesinin temel akıl yürütme özelliklerini korurken erişilebilirlik ve pratik dağıtım için optimize edildiğine işaret eder; bu da onu daha büyük model varyantlarının tüm kaynaklarına ihtiyaç duymadan gelişmiş problem çözme yetenekleri arayan geliştiriciler için uygun hale getirir.

OpenAI'nin kapsamlı eğitim verisi bu modelin geniş alan bilgisini destekliyor.

Tokonomix benchmark özeti

Yetenekler

toolssource: litellmvisionjson modepdf inputreasoningjson schemaprompt cachingmax output tokens: 100000
o4-mini — illustration 1
o4-mini: OpenAI'ın maliyet açısından verimli akıl yürütme modeli ve o3-mini'nin halefi

o4-mini, OpenAI'ın yüksek hacim katmanındaki akıl yürütme model serisinde o3-mini'nin yerini alan modeldir. Aynı akıl yürütme öncelikli üretim mimarisi, aynı geniş iş yükü konumlandırması, ancak ölçülebilir biçimde daha iyi doğruluk ve önceden o3-mini üzerinde çalışan problem türlerinde bir miktar daha iyi gecikme profili sunuyor. Eski mini üzerinde üretim iş akışları yürüten ekipler için doğru göç hedefi budur.

Mini katmanda elde ettikleriniz

o4-mini, hacimli iş yüklerine ölçeklenebilir bir maliyet profili ile akıl yürütme biçimli problemleri ele alır. Ölçekte kod incelemesi, yapılandırılmış belge analizi, orta karmaşıklıktaki kısıtlar üzerinde çok adımlı planlama, sözleşme maddesi çıkarımı, bilimsel literatür triyajı. Mini, tüm bunları rahatlıkla ve yüksek verimli dağıtımları ekonomik olarak uygulanabilir kılan çağrı başına maliyetle karşılar.

Akıl yürütme adımı hâlâ gerçekleşir. Akıl yürütme tokenleri için hâlâ ödeme yaparsınız. Model, bir cevap üretmek için hâlâ refleks bir modelden daha uzun süre alır. Mini katmanda tam o3 veya daha yeni akıl yürütme sınırına kıyasla vazgeçtiğiniz şey; en zor problemlerde bir miktar doğruluk ve modelin bir cevaba bağlanmadan önce keşfedebileceği aday çözüm uzayındaki bir miktar genişliktir.

Çoğu akıl yürütme iş yükü için bu takas avantajlıdır. Problemlerin büyük çoğunluğu mutlak kapasite tavanını gerektirmez. Bunlar, bir refleks modelin yapacağı türde hataları yakalayan bir tefekkür gerektirir ve bunu saatte binlerce sorguya ölçeklenebilir bir maliyetle gerektirir. Mini katman tam da bu tür çalışmalar için tasarlanmıştır.

Uzun bağlam kapasitesi devam ediyor. o4-mini uzun belgeli akıl yürütme iş yüklerini iyi şekilde ele alıyor, ancak kesin bağlam penceresi belirtimi her zaman belirgin biçimde belgelenmiyor. Mini katmanda uzun belge analizi için bu doğru araçtır.

Nerede işe yarar

Orta zorlukta yazılım mühendisliği. Kod incelemesi, yeniden düzenleme yardımı, sorunun belirtisinin bir veya iki adım ötesinde olduğu hata ayıklama. o4-mini, her sorgu için tam o3 çalıştırmanın maliyetini üstlenmeden faydalı bir eşli programlama katmanı olarak yeterli hatayı yakalar.

Hacimde belge analizi. Sözleşme inceleme hatları, düzenleyici dosyalama triyajı, araştırma makalesi taraması. Akıl yürütme adımı, örüntü eşleştirmenin kaçıracağı türde hataları yakalayacak kadar tefekkür ekler ve bunu dağıtımı ekonomik olarak uygulanabilir kılan bir birim maliyetle yapar.

Yapılandırılmış planlama iş yükleri. Orta kısıtlar altında kaynak tahsisi, çizelgeleme problemleri, çok adımlı karar ağaçları. Kısıtlar en karmaşık şekillerde etkileşime girmediği sürece mini bunları iyi yönetir; etkileşim karmaşıklaştığında tam o3 belirgin biçimde öne geçmeye başlar.

o3-mini'den göç hedefi. Ekiplerin bugün o4-mini'yi seçmesinin en yaygın nedeni, o3-mini'nin kullanımdan kaldırılma uçurumundan önce ondan göç etmektir. Geçiş, API yüzeyinde basittir ve davranış açısından genel olarak olumludur, ancak uygun bir yeniden doğrulamayı hak eder.

Nerede yetersiz kalır

Akıl yürütme sınırındaki en zor problemler. Bunlar için tam o3 veya tarihli anlık görüntüsü o3-2025-04-16 ölçülebilir biçimde öne geçer. Mini katman, sınırda rekabet etmek için tasarlanmadı; hacimli işe faydalı akıl yürütme getirmek için tasarlandı.

Gerçek zamanlı etkileşimli uygulamalar. Akıl yürütme gecikmesi, mini'yi saniye altı yanıt gerektiren sohbet UX'i ile uyumsuz kılar. Bu iş yükleri için refleks modelleri kullanın ve mini'yi asenkron akıl yürütme işine ayırın.

Basit özetleme ve çıkarım. Buna ihtiyaç duymayan görevlerde akıl yürütme hesaplaması boşa harcanır. Çağrı başına maliyetin akıl yürütme derinliğinden daha önemli olduğu bu iş yükleri için refleks modelleri kullanın.

Akışın önemli olduğu yaratıcı yazım. Mini, akıl yürütme modellerinin tipik düz tonuyla dikkatli ve doğru bir nesir üretir. Refleks modeller genellikle daha canlı yaratıcı çıktı üretir.

Onu seçmek veya yukarı çıkmak

Akıl yürütme katmanındaki yeni yapımlar için o4-mini, hacim katmanında doğru varsayılan seçimdir. Tarihli anlık görüntü o4-mini-2025-04-16, düzenlemeye tabi iş akışları veya üretim tekrarlanabilirliği için sabitlenecek sürümdür.

Gerçek anlamda sınır akıl yürütme gerektiren iş yükleri için yükseltme yolu tam o3 modelidir. Maliyetten bağımsız olarak maksimum doğruluk istediğiniz en zor problemler için o1-pro ve onun tarihli anlık görüntüsü hâlâ o1 neslinin genişletilmiş akıl yürütme yapılandırmasıyla mevcuttur.

Akıl yürütmenin yanı sıra tarama ve dış kaynak entegrasyonu gerektiren araştırma iş akışları için o4-mini-deep-research ve o4-mini-deep-research-2025-06-26, özel araştırma modu varyantlarıdır. Bunlar, standart o4-mini'nin tam olarak doğru araç olmadığı bir iş yükü şeklini ele alır.

o3-mini modelinden göç eden iş akışları için planlama sorusu, kabiliyetten ziyade zamanlamadır. o4-mini'ye karşı paralel değerlendirme kurun, iş yükünüzdeki farkları belgeleyin ve o3-mini kullanımdan kaldırılma uçurumundan önce geçişi tamamlayın. Geçiş genel olarak olumludur, ancak kör bir yer değiştirme yükseltmesinden ziyade düzgün bir doğrulamayı hak eder.

AB veri ikametgâhı, OpenAI akıl yürütme uç noktalarının hiçbirinde varsayılan olarak karşılanmaz. Bölgesel ağ geçidi deseni, düzenlemeye tabi Avrupa dağıtımları için geçerli geçici çözüm olmaya devam ediyor.

Son teknik inceleme: 2026-05-22 — Tokonomix.ai

o4-mini — illustration 2

Sağlayıcı karşılaştırmasıLIVE

Sağlayıcı karşılaştırması
Bu modeli sunan her sağlayıcıyı karşılaştırın — maliyet temeli, kalite, gecikme ve çalışma süresi.
Azure OpenAI (EU - Sweden)AB
Girdi maliyetien iyi$1.10
Çıktı maliyeti$4.40
KaliteHenüz test edilmedi
Gecikme (p50)Henüz test edilmedi
Çalışma süresiHenüz test edilmedi
Maliyetler 1M token başına (maliyet temeli)
OpenAIABDBu sunum
Girdi maliyeti$1.10
Çıktı maliyeti$4.40
KaliteHenüz test edilmedi
Gecikme (p50)en iyi630 ms
Çalışma süresiHenüz test edilmedi
Maliyetler 1M token başına (maliyet temeli)

Konsensüs zekâsı

MODEL GENELİPASİF

Konsensüs sinyalleri model geneli — henüz sağlayıcı başına ayrılmadı.

Konsensüs puanlaması bu model için hâlâ veri topluyor — henüz sinyal yok.

Topluluk oylarıLIVE

Topluluk oyları
Gerçek ziyaretçiler ne düşünüyor — sağlayıcı başına.
Azure OpenAI (EU - Sweden)AB

Henüz topluluk oyu yok.

OpenAIABD

Henüz topluluk oyu yok.

Daha fazla sonuç — sağlayıcı başına

Kategoriye göre kalite

YaratıcıOlgusalÇok dilliAkıl yürütme

Oyun değerlendirmesi

Henüz veri yok.

Jüri kararı

Tamam 76%Kısmi 0%Yanlış 24%

Oyunlar ve arena

Henüz veri yok.

Hız ve sağlık

630 ms

Gecikme (p50)

Çalışma süresi

Soru & cevap — göz atLIVE

1 / 80
🧠 zekâOpenAImultilingual · 2026-07-26puan: 100

Bir mağazada %20 indirim uygulanıyor. 150 TL olan bir ürün indirimden sonra kaç TL olur?

150 TL’lik ürünün %20’si = 150 × 0,20 = 30 TL İndirimli fiyatı = 150 – 30 = 120 TL

Test geçmişi — tüm sağlayıcılarLIVE

Zaman içinde kalite puanıen son 58
07-1907-26
Hız — zaman içinde p50 gecikmeen son 584 ms
07-1307-30