İçeriğe geç
Seviye C — Uzman
Çalıştığı yer:USYapıldığı yer:United States
$4.40
çıktı · 1M token başına (maliyet bazı)
Maliyet
1,738 ms
Yanıt hızı
100 / 100
Zeka

Karar — özetLIVE

LIVE
şimdi · 2026-07-26

o3-mini quality drops 46 points with reasoning scores falling to zero

Quality dropped 46 points Reasoning performance collapsed to zero Factual accuracy degraded significantly Latency improved slightly

The o3-mini model has experienced a significant performance decline in this benchmark window, with overall quality dropping from 99.3 to 53.4 points. The most concerning change is the reasoning category scoring zero, compared to strong performance in the previous window. Factual accuracy has also degraded substantially to just 22 points. However, the model maintains exceptional multilingual capabilities at 100 points and continues to deliver strong creative performance at 92 points. Response latency has actually improved slightly from 3360ms to 3147ms at the median, suggesting the performance issues are quality-related rather than infrastructure problems. The test methodology remains consistent with five runs in each window. Users relying on this model for reasoning tasks or factual question-answering should exercise caution and validate outputs carefully. The dramatic shift in capability distribution suggests potential changes to the model deployment, configuration, or underlying weights. Creative and multilingual use cases appear largely unaffected and may continue to perform reliably. OpenAI has not publicly addressed these benchmark changes at the time of this verdict.

Quality

53.4

Latency p50

3,147 ms

Test runs

5

1 / 11

Görsel ve açıklamaLIVE

OpenAI

o3-mini-2025-01-31

Seviye C — Uzman

Tokonomix Editöryel Ekibi·İnceleyen Mes Kalkan··

o3-mini-2025-01-31, OpenAI tarafından geliştirilen ve Ocak 2025'te o3 model serisinin bir parçası olarak piyasaya sürülen, akıl yürütmeye odaklı bir dil modelidir. Aynı ailedeki daha büyük modellerle karşılaştırıldığında gelişmiş akıl yürütme yeteneklerini artırılmış verimlilikle dengelemek üzere tasarlanmış kompakt bir varyantı temsil eder. Model, yanıt üretmeden önce karmaşık problemler üzerinde ek işlem döngüleri harcamasına olanak tanıyan genişletilmiş çıkarım zamanı hesaplaması kullanır. Bu mimari, onu özellikle çok adımlı mantıksal akıl yürütme, matematiksel problem çözme ve kod üretimi gerektiren görevler için uygun hale getirir. Model, OpenAI'nin o-serisi modelleriyle birlikte tanıtılan ve anlık yanıt üretimi yerine müzakereli problem çözmeyi vurgulayan akıl yürütme çerçevesi üzerine inşa edilmiştir. Parametre sayısı ve mimari hakkındaki spesifik teknik detaylar açıklanmamış olsa da, o3-mini, tam o3 modeline daha erişilebilir bir alternatif olarak konumlandırılmış ve daha az hesaplama kaynağı gerektirirken akıl yürütme kıyaslamalarında güçlü performans sunmaktadır. Bağlam penceresi boyutu, piyasaya sürüldüğü tarih itibarıyla OpenAI tarafından kamuoyuna açıklanmamıştır. OpenAI'nin model yelpazesi içinde o3-mini-2025-01-31, akıl yürütme kalitesinin öncelikli olduğu ancak kaynak kısıtlamalarının da göz önünde bulundurulduğu uygulamalar için daha hafif bir seçenek olarak diğer akıl yürütme odaklı modellerin yanında yer alır. Yazılım geliştirme desteği, bilimsel akıl yürütme, matematiksel hesaplama ve yapılandırılmış analitik görevler dahil olmak üzere kullanım senaryolarını hedefler. Model, o3 serisinin karakteristik özelliği olan zincir-düşünce akıl yürütme yaklaşımını korurken standart metin üretimi yeteneklerini destekler ve bu da onu hem genel amaçlı uygulamalar hem de özel akıl yürütme iş yükleri için uygun hale getirir.

o3-mini-2025-01-31, OpenAI'nin muhakeme odaklı model serisinin kompakt temsilcisi olarak, karmaşık mantıksal görevlerde büyük modellere yakın performansı daha az kaynak tüketimiyle sunmayı hedefliyor.

Tokonomix model analizi

Yetenekler

toolssource: litellmjson modereasoningjson schemaprompt cachingmax output tokens: 100000
o3-mini-2025-01-31 — illustration 1

⚠️ Kullanımdan kaldırılan model. OpenAI bu modelin yerine, benzer maliyette daha iyi akıl yürütme doğruluğu sunan o4-mini modelini (Nisan 2025) getirdi. Yeni projelerin doğrudan o4-mini'yi hedeflemesi gerekir. Mevcut o3-mini entegrasyonları, API uç noktası kapatılmadan önce geçiş planı yapmalıdır.

o3-mini-2025-01-31: OpenAI'nin kullanımdan kaldırılan hacim katmanı akıl yürütme modelinin tarihli anlık görüntüsü

o3-mini'nin Ocak 2025 tarihli takma adı, OpenAI'nin ilk hacim katmanı akıl yürütme modelinin üretim davranışını sabitleyen anlık görüntüyü yakalar. o3-mini artık o4-mini lehine kullanımdan kaldırıldığından, bu anlık görüntü dar ama gerçek bir amaca hizmet eder: o3-mini üzerinde çalışan ve halefine geçiş penceresi boyunca tutarlı davranışı sürdürmesi gereken üretim iş akışları için bir kararlılık çapası.

Bu anlık görüntü neyi temsil eder

Ocak anlık görüntüsü, kararlı üretim kullanımı için sunulduğu haliyle o3-mini'dir. Yetenek zarfı, kayan o3-mini sayfasının tanımladığı şeydir: mini katmanda akıl yürütme öncelikli üretim, 200.000 token bağlam penceresi, hacimli iş yüklerine ölçeklenen maliyet profili, tam o3'ün altında ancak refleks modellerinin akıl yürütme şekilli sorunlarda sunabileceğinden yüksek bir doğruluk seviyesi.

Bu anlık görüntüye göre kalibre edilmiş üretim dağıtımları çalıştıran ekipler için tarihli takma ad, OpenAI'nin o3-mini'ye yönelik yaşam döngüsü mesajlaşması istikrara kavuşurken güvenli sabitleme noktası olmuştur. Artık o4-mini lehine kullanımdan kaldırma duyurulduğuna göre, sabitlenmiş anlık görüntü uzun vadeli üretim kararlılığı yerine geçiş penceresine hizmet eder.

Sabitleme sözleşmesi hâlâ geçerlidir. Ocak anlık görüntüsünün ağırlıkları kaymayacak ve model davranışı ayağınızın altından değişmeyecek. Değişen şey, uç nokta kullanılabilirliği zaman çizelgesidir. OpenAI o3-mini uç noktasını kapattığında, tarihli takma ad da onunla birlikte gider. Bu uçurum gelmeden önce o4-mini'ye geçişi planlayın.

Geçiş penceresi

o3-mini-2025-01-31 üzerinde çalışan üretim dağıtımları için geçiş hedefi, kayan takma ad olarak o4-mini veya tarihli anlık görüntü olarak o4-mini-2025-04-16 modelidir. API yüzeyi açısından geçiş basittir. Her iki model de aynı istek ve yanıt şeklini paylaştığından, entegrasyon kodu değişmez.

Davranışsal farklar gerçektir ancak genellikle olumludur. o4-mini, o3-mini'nin belirli zayıf noktalarını iyileştirmek üzere eğitilmiştir: karmaşık kod sentezinde daha iyi doğruluk, etkileşim halindeki kısıtlamalar altında çok adımlı akıl yürütmede daha güvenilir performans ve ortalamada biraz daha iyi gecikme profili. Çoğu iş yükü, geçiş yaptığında gerilemeler yerine iyileşmeler görür.

o3-mini'nin belirli akıl yürütme dağılımına göre ayarlanmış istem desenlerinin, o4-mini'de eşdeğer sonuçlar elde etmek için ayarlanması gerekebilir. Test korpusunuzu her iki modelde de çalıştırdığınız, farkları belgelediğiniz ve farklar kabul edilebilir olduğunda geçiş yaptığınız paralel bir değerlendirme yolu planlayın. API yüzeyi aynı olsa bile geçişin bedava olduğunu varsaymayın.

Kullanımdan kaldırma zaman çizelgesi ince ayrıntılarıyla yayınlanmadı. OpenAI'nin kullanımdan kaldırılan akıl yürütme modellerindeki örüntüsü, açık önceden bildirim ile birlikte birkaç ay süren bir kapatma penceresi olmuştur. Kullanımdan kaldırma bildirimini beklemek yerine geçişi sürüm takviminize dahil edin.

Nerede başarısız olur ve hiçbir zaman ne olmadı

o3-mini'ye uygulanan aynı sınırlar bu anlık görüntü için de geçerlidir. Gerçek zamanlı konuşma uygulamaları uygun bir seçim değildir çünkü akıl yürütme gecikmesi sohbet kullanıcı deneyimiyle bağdaşmaz. Basit özetleme ve çıkarım, akıl yürütme hesaplamasını boşa harcar. Yaratıcı yazım, parıltısı olmayan, düz ve temkinli düzyazı üretir.

Akıl yürütme katmanı içinde, bu anlık görüntü hiçbir zaman maksimum doğruluk seçeneği olmadı. En zor problemler için tam o3 veya o1-pro ile bunların tarihli anlık görüntüleri uygun varyantlardı. Mini katman, sınır doğruluk katmanı değil, hacim açısından ekonomik katmandı.

Bu anlık görüntü üzerinde geçirilen süre boyunca mini katman yetenek zarfının ötesine büyüyen iş akışları için geçiş hedefi, aynı hacim katmanı yerine o4-mini'nin üzerinde, daha yüksek bir katmanda olabilir. İş yükünüz artık daha iyi doğruluk için daha yüksek maliyeti gerekçelendiriyorsa, o3-2025-04-16 tam o3'ün tarihli anlık görüntüsüdür. Aynı katman geçişine varsayılan olarak yönelmek yerine karşılaştırmayı düzgün bir şekilde yapın.

Pratik notlar

Kullanımdan kaldırma penceresi sırasında anlık görüntü yönetimi için operasyonel örüntü; halef modele karşı paralel değerlendirmeyi hemen kurmak, tam test korpusunuzdaki davranışsal farkları belgelemek ve kullanımdan kaldırma son tarihi baskısı altında değil, planlı bir sürümde geçiş yapmaktır. Kullanımdan kaldırılan anlık görüntülere sabitlenmiş birden fazla üretim iş akışı için, geçişleri rastgele sırayla işlemek yerine iş yükü riski ve gelir etkisine göre önceliklendirin.

Akıl yürütmenin yanı sıra harici kaynak entegrasyonu gerektiren araştırma iş akışları için, o4 neslindeki özel araştırma modu varyantı o4-mini-deep-research modelidir. Bu, o3-mini'nin bazen ele alacak şekilde zorlandığı ancak aslında pek uygun olmadığı iş yüklerini karşılar.

AB veri ikametgâhı, bu anlık görüntüde veya ilgili OpenAI akıl yürütme uç noktalarının herhangi birinde varsayılan olarak karşılanmaz. Bölgesel ağ geçidi örüntüsü, düzenlemeye tabi Avrupa dağıtımları için pratik geçici çözüm olmaya devam eder ve bu kısıt o4-mini'ye geçişle birlikte değişmez.

Son teknik inceleme: 2026-05-22 — Tokonomix.ai

o3-mini-2025-01-31 — illustration 2o3-mini-2025-01-31 — illustration 3

Sağlayıcı karşılaştırmasıLIVE

Sağlayıcı karşılaştırması
Bu modeli sunan her sağlayıcıyı karşılaştırın — maliyet temeli, kalite, gecikme ve çalışma süresi.
Azure OpenAI (EU - Sweden)AB
Girdi maliyetien iyi$1.10
Çıktı maliyeti$4.40
KaliteHenüz test edilmedi
Gecikme (p50)Henüz test edilmedi
Çalışma süresiHenüz test edilmedi
Maliyetler 1M token başına (maliyet temeli)
OpenAIABDBu sunum
Girdi maliyeti$1.10
Çıktı maliyeti$4.40
Kaliteen iyi100.0
Gecikme (p50)en iyi1,738 ms
Çalışma süresiHenüz test edilmedi
Maliyetler 1M token başına (maliyet temeli)

Konsensüs zekâsı

MODEL GENELİPASİF

Konsensüs sinyalleri model geneli — henüz sağlayıcı başına ayrılmadı.

Konsensüs puanlaması bu model için hâlâ veri topluyor — henüz sinyal yok.

Topluluk oylarıLIVE

Topluluk oyları
Gerçek ziyaretçiler ne düşünüyor — sağlayıcı başına.
Azure OpenAI (EU - Sweden)AB

Henüz topluluk oyu yok.

OpenAIABD

Henüz topluluk oyu yok.

Daha fazla sonuç — sağlayıcı başına

Kategoriye göre kalite

YaratıcıOlgusalÇok dilliAkıl yürütme

Oyun değerlendirmesi

Henüz veri yok.

Jüri kararı

Tamam 86%Kısmi 5%Yanlış 10%

Oyunlar ve arena

Henüz veri yok.

Hız ve sağlık

1,738 ms

Gecikme (p50)

Çalışma süresi

Soru & cevap — göz atLIVE

1 / 80
🧠 zekâOpenAImultilingual · 2026-07-26puan: 100

Bir mağazada %20 indirim uygulanıyor. 150 TL olan bir ürün indirimden sonra kaç TL olur?

Ürünün orijinal fiyatı 150 TL'dir. %20 indirim uygulandığında: İndirim miktarı = 150 TL × 0.20 = 30 TL Dolayısıyla, indirimli fiyat = 150 TL - 30 TL = 120 TL Sonuç olarak ürün 120 TL olur.

Test geçmişi — tüm sağlayıcılarLIVE

Zaman içinde kalite puanıen son 61
06-2807-26
Hız — zaman içinde p50 gecikme

Bu model birkaç farklı günde test edildiğinde bir trend görünür.