İçeriğe geç
Seviye C — Uzman
Çalıştığı yer:USYapıldığı yer:United States
$4.40
çıktı · 1M token başına (maliyet bazı)
Maliyet
1,354 ms
Yanıt hızı
Henüz test edilmedi
Zeka

Karar — özetLIVE

LIVE
şimdi · 2026-07-26

o3-mini shows quality decline and factual performance drop

Quality dropped 8.2 points Factual performance collapsed to 2/100 Latency increased 15 percent Multilingual stability maintained at 100

The o3-mini model experienced a notable quality decline in this benchmark window, with the overall score dropping 8.2 points from 66.2 to 58.0. The most concerning change is in factual performance, which collapsed from its previous level to just 2 out of 100, indicating significant reliability issues with fact-based queries. This represents a critical weakness that users should be aware of when deploying the model for knowledge-intensive tasks. On the positive side, multilingual capabilities remained strong at 100, maintaining consistency across both benchmark windows. Creative and reasoning tasks both scored 65, showing moderate competency in these areas. The emergence of category scores for creative and reasoning tasks, replacing the previous coding score of 99, suggests either a shift in test methodology or model capabilities. Latency increased from 3108ms to 3569ms at the median, representing a 15% slowdown that may impact user experience in latency-sensitive applications. With only five test runs in each window, these results provide an early signal of performance characteristics but should be validated with additional testing. Users requiring factual accuracy should exercise particular caution with this version.

Quality

58.0

Latency p50

3,569 ms

Test runs

5

1 / 11

Görsel ve açıklamaLIVE

OpenAI

o3-mini

Seviye C — Uzman · 200K token

Tokonomix Editöryel Ekibi·İnceleyen Mes Kalkan··

o3-mini, OpenAI tarafından o-serisi ailesinin bir parçası olarak geliştirilen, akıl yürütme odaklı bir dil modelidir. Matematiksel problem çözme, kod üretimi, bilimsel analiz ve yapılandırılmış karar verme gibi çok adımlı akıl yürütme gerektiren karmaşık analitik görevleri ele almak üzere tasarlanmıştır. Öncelikle hız veya konuşma akıcılığı için optimize edilen modellerin aksine, o3-mini bilinçli akıl yürütme süreçlerine ağırlık verir; bu da onu doğruluk ve mantıksal tutarlılığın kritik olduğu uygulamalar için özellikle uygun kılar. Model, 200.000 token'lık bir bağlam penceresini destekler; bu sayede kapsamlı belgeler, uzun kod tabanları veya önemli bağlam tutma gerektiren çok turlu etkileşimler boyunca tutarlılığı koruyabilir. Standart metin üretme yetenekleri sunarken, akıl yürütme performansını iyileştirmek için pekiştirmeli öğrenme tekniklerini uygular. Bu yaklaşım, modelin problemleri parçalara ayırmasına, ara adımları değerlendirmesine ve farklı alanlarda iyi gerekçelendirilmiş sonuçlara ulaşmasına olanak tanır. OpenAI'nin model yelpazesinde o3-mini, kompakt bir akıl yürütme modeli konumundadır; daha büyük akıl yürütme sistemlerinin hesaplama gereksinimleri ile daha küçük modellerin erişilebilirliği arasında bir denge sunar. o-serisindeki tam ölçekli modellerin kaynak yükü olmadan akıl yürütme yeteneklerine ihtiyaç duyan kullanıcılar için tasarlanmıştır. Model; tamamen üretken veya konuşmaya dayalı çıktılar yerine yapılandırılmış düşünmeden yararlanan görevlerde güvenilir performans arayan geliştiricilere, araştırmacılara ve kuruluşlara hizmet eder.

OpenAI'nin kapsamlı eğitim verisi bu modelin geniş alan bilgisini destekliyor.

Tokonomix benchmark özeti

Yetenekler

toolssource: litellmjson modereasoningjson schemaprompt cachingmax output tokens: 100000
o3-mini — illustration 1

⚠️ Kullanımdan kaldırılmış model. OpenAI bu modeli, benzer maliyette geliştirilmiş akıl yürütme doğruluğu sunan o4-mini (Nisan 2025) ile değiştirdi. Yeni projeler doğrudan o4-mini'yi hedeflemelidir. Mevcut o3-mini entegrasyonlarının, API uç noktası kapanmadan önce göç planı yapması gerekir.

o3-mini: hacim katmanında deliberasyonu mümkün kılan, maliyet açısından verimli akıl yürütme modeli

o3-mini, akıl yürütme tarzı üretimi yüksek hacimde uygulanabilir hâle getiren modeldi. o1 ve o3 sınırın ucunda uzatılmış düşünce zincirinin neler yapabileceğini gösterirken, o3-mini bu akıl yürütme derinliğinin önemli bir kısmını, çağrı başına maliyetin baskın olduğu iş yüklerine taşıyan varyanttı. Şu anda o4-mini lehine kullanımdan kaldırılmış durumda, ancak ne yaptığını ve soy ağacında nereye oturduğunu anlamak, mevcut o3-mini entegrasyonlarından göç planlayan ekipler için önemli.

o3-mini'nin farklı yaptığı şey

Mini varyant, daha büyük o3 modelinin önce-akıl-yürütme üretim örüntüsünü korudu, ancak daha küçük bir parametre bütçesi ve istek başına daha sıkı bir akıl yürütme bütçesi ile. Takas basitti: en zor problemlerde bir miktar düşük doğruluk karşılığında, tam o3'ün başaramadığı bir biçimde hacim iş yüklerine ölçeklenen bir maliyet profili.

Mutlak yetenek tavanını gerektirmeyen akıl yürütme iş yüklerinin büyük çoğunluğu için o3-mini doğru katmandı. Kod incelemesi, yapılandırılmış analiz görevleri, orta karmaşıklıktaki kısıt setleri üzerinde çok adımlı planlama, sözleşme maddesi çıkarma, bilimsel literatür ön elemesi. Bunların tümü, dağıtımı ekonomik olarak uygulanabilir kılan bir birim maliyetle mini'de iyi çalıştı.

200.000 token'lık bağlam penceresi ana modelden devralındı; bu, girdinin önemli boyutlarda olabildiği uzun belge iş akışları için kritikti. Mini, uzun bağlam yeteneğinden vazgeçmedi; maliyet verimliliği karşılığında biraz akıl yürütme derinliğinden vazgeçti.

Gecikme profili, refleks modelleri ile tam o3 arasında bir yerde duruyordu. Harcanacak daha az akıl yürütme hesabı olduğu için o3'ten daha hızlı, ancak akıl yürütme adımı hâlâ gerçekleştiğinden GPT-4o sınıfı refleks modellerden ölçülebilir biçimde daha yavaş.

Neden kullanımdan kaldırıldı

OpenAI, o3-mini'nin yerine Nisan 2025'te o4-mini'yi getirdi. Halef model, aynı iş yüklerinde benzer maliyetle daha iyi doğruluk sundu; bu da eski model üzerinde geliştirmeye devam etmeyi ticari olarak haklı çıkarmaz hâle getirdi. Kullanımdan kaldırma duyurusu, mevcut müşterilere iş akışlarını o4-mini'ye karşı doğrulamaları ve o3-mini uç noktası kapanmadan önce geçiş yapmaları için bir göç penceresi sağladı.

Göç hikâyesi API yüzeyinde basittir. Her iki model aynı istek ve yanıt şeklini paylaşır, dolayısıyla entegrasyon kodu değişmez. Değişen şey altta yatan davranıştır. o4-mini farklı bir akıl yürütme dağılımına sahip farklı bir modeldir ve o3-mini'nin belirli davranışına ayarlanmış istem örüntüleri, halef modelde eşdeğer veya daha iyi sonuçlara ulaşmak için ayarlama gerektirebilir.

Hâlâ o3-mini'de olan ekipler için planlama sorusu zamanlamadır. o4-mini'ye karşı paralel bir değerlendirme yolu yürütün, davranışsal farkları kendi spesifik iş yükünüzde belgeleyin ve kullanımdan kaldırma uçurumundan önce geçiş yapın. Kullanımdan kaldırma takvimi ayrıntılı olarak yayınlanmadı, ancak OpenAI'nin kullanımdan kaldırılmış akıl yürütme modellerindeki örüntüsü, önceden bildirimle birlikte birkaç aylık bir kapanma penceresi olmuştur.

Nerede yetersiz kaldı

Tüm akıl yürütme modelleri için geçerli olan sınırlamalar o3-mini için de geçerliydi. Gerçek zamanlı konuşma uygulamaları kötü bir uyumdu çünkü akıl yürütme gecikmesi sohbet UX'i ile uyumsuzdu. Basit özetleme ve çıkarım, akıl yürütme hesabını boşa harcadı. Yaratıcı yazım, tüm akıl yürütme modellerinin yönelme eğiliminde olduğu aynı dikkatli, düz prozayı üretti.

Akıl yürütme katmanı içinde o3-mini, mutlak yetenek tavanındaki problemler için doğru seçim değildi. En zor problemler için, maksimum doğruluğun maliyeti haklı çıkardığı durumlarda tam o3 veya o1-pro varyantlarıydı. Mini, hacim katmanıydı; asla maksimum doğruluk katmanı değildi.

Bunun yerine ne kullanmalı

Doğrudan halef, kayan takma adda o4-mini veya sabitlenmiş üretim için tarihli anlık görüntüde o4-mini-2025-04-16'dır. Göç yolu API yüzeyinde basittir, ancak kendi spesifik iş yükünüzde uygun bir doğrulamayı hak eder.

Mini katman yetenek zarfının ötesine geçen iş yükleri için, tam o3 veya tarihli anlık görüntüde o3-2025-04-16 yükseltme yoludur. Maliyet profili daha yüksektir ancak zor problemlerdeki doğruluk anlamlı biçimde daha iyidir.

Akıl yürütme ile birlikte harici kaynak entegrasyonuna ihtiyaç duyan araştırma iş akışları için o4-mini-deep-research, o4-mini ile aynı kuşakta yer alan adanmış araştırma modu varyantıdır.

Tarihli anlık görüntü o3-mini-2025-01-31, o3-mini'den göç planlarken bir kararlılık çıpasına ihtiyaç duyan ekipler için mevcut olmaya devam ediyor. Bunu yalnızca göç köprüsü dönemi için kullanın, yeni inşalar için değil. AB veri ikametgâhı bu uç noktaların hiçbirinde varsayılan olarak karşılanmaz.

Son teknik inceleme: 2026-05-22 — Tokonomix.ai

o3-mini — illustration 2o3-mini — illustration 3

Sağlayıcı karşılaştırmasıLIVE

Sağlayıcı karşılaştırması
Bu modeli sunan her sağlayıcıyı karşılaştırın — maliyet temeli, kalite, gecikme ve çalışma süresi.
Azure OpenAI (EU - Sweden)AB
Girdi maliyetien iyi$1.10
Çıktı maliyeti$4.40
KaliteHenüz test edilmedi
Gecikme (p50)Henüz test edilmedi
Çalışma süresiHenüz test edilmedi
Maliyetler 1M token başına (maliyet temeli)
OpenAIABDBu sunum
Girdi maliyeti$1.10
Çıktı maliyeti$4.40
KaliteHenüz test edilmedi
Gecikme (p50)en iyi1,354 ms
Çalışma süresiHenüz test edilmedi
Maliyetler 1M token başına (maliyet temeli)

Konsensüs zekâsı

MODEL GENELİPASİF

Konsensüs sinyalleri model geneli — henüz sağlayıcı başına ayrılmadı.

Konsensüs puanlaması bu model için hâlâ veri topluyor — henüz sinyal yok.

Topluluk oylarıLIVE

Topluluk oyları
Gerçek ziyaretçiler ne düşünüyor — sağlayıcı başına.
Azure OpenAI (EU - Sweden)AB

Henüz topluluk oyu yok.

OpenAIABD

Henüz topluluk oyu yok.

Daha fazla sonuç — sağlayıcı başına

Kategoriye göre kalite

YaratıcıOlgusalÇok dilliAkıl yürütme

Oyun değerlendirmesi

Henüz veri yok.

Jüri kararı

Tamam 67%Kısmi 14%Yanlış 19%

Oyunlar ve arena

Henüz veri yok.

Hız ve sağlık

1,354 ms

Gecikme (p50)

Çalışma süresi

Soru & cevap — göz atLIVE

1 / 80
🧠 zekâOpenAImultilingual · 2026-07-26puan: 100

Bir mağazada %20 indirim uygulanıyor. 150 TL olan bir ürün indirimden sonra kaç TL olur?

Ürünün indirim miktarını hesaplayalım: 150 TL'nin %20'si = 150 × 0.20 = 30 TL olur. İndirimli fiyat ise 150 TL - 30 TL = 120 TL'dir.

Test geçmişi — tüm sağlayıcılarLIVE

Zaman içinde kalite puanıen son 59
07-1907-26
Hız — zaman içinde p50 gecikmeen son 820 ms
07-1307-30