İçeriğe geç
Seviye C — Uzman
Çalıştığı yer:USYapıldığı yer:United States
OpenAI

o3

Seviye C — Uzman · 200K token

Tokonomix Editöryel Ekibi·İnceleyen Mes Kalkan··

o3, OpenAI tarafından geliştirilen ve şirketin üçüncü nesil akıl yürütme modellerinin bir parçası olarak yayımlanan, akıl yürütme odaklı bir büyük dil modelidir. İleri matematik, kodlama problemleri ve bilimsel analiz gibi çok adımlı akıl yürütme gerektiren karmaşık problem çözme görevlerini ele almak üzere tasarlanmıştır. Model, genişletilmiş düşünce zinciri işlemesi kullanır; bu sayede yanıt üretmeden önce zor problemler üzerinde daha fazla hesaplama süresi harcayarak değerlendirme yapabilir. Bu mimari, modeli özellikle yanıt hızından çok doğruluk ve mantıksal titizliğin öncelikli olduğu alanlar için uygun kılar. Model, 200.000 token'lık bir bağlam penceresini destekleyerek uzun belgeleri, kod tabanlarını ve uzun süreli konuşmaları tutarlılığını koruyarak işleyebilir. o3, standart metin üretme yeteneklerini sunar ve teknik dokümantasyondan analitik akıl yürütmeye kadar pek çok göreve uygulanabilir. Model, OpenAI'nin akıl yürütme modeli serisinde önemli bir ilerlemeyi temsil eder ve seleflerine kıyasla matematiksel problem çözme, yarışmacı programlama ve bilimsel akıl yürütmeyi ölçen kıyaslamalarda kayda değer iyileşmeler sergiler. OpenAI'nin model yelpazesi içinde o3, akıl yürütme konusunda uzmanlaşmış modellerin üst ucunda yer alır ve o1 serisinin halefidir. Genel amaçlı sohbet odaklı yapay zekâdan ziyade derin analitik yetenekler gerektiren kullanıcılar için bir araç olarak konumlandırılmıştır. Model; geleneksel dil modellerinin mantıksal tutarlılık veya karmaşık çıkarımda zorlanabileceği teknik açıdan zorlu problemler üzerinde çalışan araştırmacılar, geliştiriciler ve profesyoneller için tasarlanmıştır.

OpenAI'nin kapsamlı eğitim verisi bu modelin geniş alan bilgisini destekliyor.

Tokonomix benchmark özeti
Bölüm 01

Hız analizi

Tüm benchmark çalıştırmalarında ölçülen gecikme. P50 (medyan) ve P95 (95. yüzdelik) normal ve yoğun yük altında yanıt hızının gerçekçi bir resmini verir.

P50 gecikme (medyan)P95 gecikme100 runs
432136222923222415208-2109-14ms
Bölüm 02

Kalite puanları

Bu modelin her soru kategorisinde sahanın geri kalanına göre nerede durduğu; aynı sorular üzerinde ikili karşılaştırmayla hesaplanır. Ham jüri puanı her sayının altındadır.

65%
Kod üretimi
jüri ortalaması 79
88%
Yaratıcı
jüri ortalaması 95
57%
Olgusal
jüri ortalaması 93
53%
Çok dilli
jüri ortalaması 90
58%
Akıl yürütme
jüri ortalaması 63

Kategori başına kazanma oranı: bu modelin o kategoriden bir soruda ortalama bir modeli ne sıklıkla yendiği. %50 ortalamadır, kalma notu değildir. Doğru cevap yüzdesi de değildir.

Bölüm 03

Fiyatlar

Bu modeli Tokonomix üzerinden kullandığınızda milyon token başına ödediğiniz tutar ve tipik bir konuşma için tahmini maliyet.

💰
API tarifeleri — o3
$2.99 1M giriş token başına
$11.96 1M çıkış token başına
≈ $0.0042 tipik konuşma başına (800 token)
Giriş vs çıkış fiyatı (1M token başına)
1M giriş token başına$2.99
1M çıkış token başına$11.96
Bölüm 04

Saniye başına token

Ölçülen P50 gecikmesinden türetilen saniye başına token verimi. Yüksek daha iyidir; dalgalanmalar sağlayıcı tarafındaki yükü yansıtır.

Verim (token / s)243 / avg 290
459111

P50 gecikme × 200 çıkış token tahmininden hesaplandı — mutlak rakam bu varsayıma bağlıdır; önemli olan eğilimdir.

Bölüm 05

Güçlü & zayıf yönler

Benchmark sonuçları ve gerçek kullanım senaryolarına dair toplu topluluk geri bildirimine dayanır.

Güçlü yönler

200K token uzun bağlamÇok adımlı akıl yürütmeMatematik ve bilimsel analizMetin üretimi ve özetlemeÇok turlu sohbet desteğiTalimat takibinde yüksek başarı

Zayıf yönler

Zincir düşünme nedeniyle yüksek gecikmeİnternet erişimi bulunmuyorGörsel işleme desteği yok
Bölüm 06

Yetenekler

toolssource: litellmvisionjson modepdf inputreasoningjson schemaprompt cachingmax output tokens: 100000
Bölüm 07

Sık sorulan sorular

Çok adımlı matematik, algoritma analizi ve bilimsel akıl yürütmede öne çıkıyor. Zincir düşünme ile doğruluğu artırıyor.

OpenAI güvenlik katmanları ve içerik filtreleri modeli kurumsal ortamlara uygun kılıyor.

Tokonomix benchmark özeti
Bölüm 08

Kullanılabilirlik

Kullanılabilirlik

Henüz ölçüm verisi yok

Bu model için kullanılabilirlik istatistiklerini göstermek için yeterli API çağrısı henüz kaydedilmedi. Veri, model canlı trafik almaya başlayınca görünür.

Bölüm 09

Tokonomix kıyaslama kararları

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-583/100 · 49 runs
38 correct3 partial8 wrong78% accuracy
2026-09-13

o3 delivers frontier reasoning performance across mathematical and coding tasks

OpenAI's o3 model demonstrates exceptional performance on advanced reasoning benchmarks, achieving near-perfect scores on AIME 2024 (96.7%) and GPQA Diamond (87.7%), alongside a notable 71.7% on the competitive Codeforces platform. The model maintains robust capabilities across standard academic benchmarks including MMLU (91.8%) and MMLU-Pro (85.5%), while showing strong multilingual competency with 90.7% on MGSM. Vision capabilities remain competitive at 90.7% on MMLU-Vision, though slightly trailing some specialized models. The model supports an expanded feature set including native tool use, PDF input processing, structured outputs via JSON mode and schema, and prompt caching for efficiency. Mathematical reasoning particularly stands out with 96.7% on MATH-500, positioning o3 as a leading choice for technical and scientific applications. Code generation and debugging capabilities are reinforced by strong HumanEval (91.5%) and EvalPlus (86.0%) performance. The combination of reasoning depth, broad capability coverage, and practical features makes o3 well-suited for complex analytical tasks requiring multi-step problem solving.

Kalite

Gecikme p50

Test çalıştırmaları

0

Elite math reasoning performance Competitive programming capability added PDF and vision input support Structured output modes available
Bölüm 10

Tam model profili

o3 — illustration 1
o3: OpenAI'ın sınır akıl yürütme modeli ve o1'in anlamlı halefi

o3, o1'in öncülük ettiği akıl yürütme mimarisini alıp her cephede bir adım öne taşıyan modeldir. o1, uzatılmış düşünce zincirinin (chain-of-thought) üretim ortamında bir özellik olabileceğini kanıtlamışken, o3 bunu zor işler için varsayılan beklenti hâline getiriyor. o1'e kıyasla performans kazanımları matematik, bilimsel akıl yürütme, kod sentezi ve karmaşık planlama alanlarında ölçülebilir düzeyde. 200.000 token'lık bağlam penceresi korunuyor; dolayısıyla uzun belge üzerinde akıl yürütme birinci sınıf bir yetenek olarak yerinde duruyor.

o1'den o3'e ne değişti

En görünür iyileşme, token başına akıl yürütme derinliğinde. o3, akıl yürütme hesaplamasını daha verimli harcıyor; o1'in gözden kaçıracağı aday çözüm yollarını araştırıyor ve verimsiz dalları daha hızlı budayarak ilerliyor. Net sonuç, aynı iş yükünde o1 ile karşılaştırılabilir veya daha düşük gecikme süresiyle zor problemlerde daha yüksek doğruluk elde edilmesi.

Çok adımlı kod sentezi anlamlı şekilde daha iyi. Cevabın önemsiz olmayan bir algoritma yazmayı, birden fazla kütüphane çağrısını doğru biçimde entegre etmeyi ve gerçekten derlenip çalışan kod üretmeyi gerektirdiği problemlerde o1'e olan fark en belirgin biçimde ortaya çıkıyor. Geliştirme döngüsünde akıl yürütme modeli kullanan mühendislik ekipleri için o3, sorgu başına kazanılan zamanın "ilginç" eşiğinden "gerçek anlamda değerli" eşiğine geçtiği sürümdür.

Matematiksel akıl yürütme, özellikle birçok etkileşimli değişkeni takip etmeyi ya da birden fazla çerçeveyi sırayla uygulamayı gerektiren problemlerde gelişti. Yarışma düzeyindeki matematik ve uygulamalı fizik problemleri o3'te o1'e göre daha güvenilir biçimde sonuçlanıyor.

Ödünleşim örüntüsü aynı. GPT-4o sınıfı refleks modellerinin keskin düşük gecikmesinden vazgeçiyorsunuz. Karşılığında çok adımlı akıl yürütme gerektiren problemlerde belirgin biçimde daha yüksek doğruluk elde ediyorsunuz. Zor problemler için doğru cevap başına maliyet eğrisi, o3 ile o1'e göre anlamlı ölçüde daha iyi; bu, akıl yürütme iş yükleri için token başına manşet fiyatlandırmasından çok daha önemli bir metriktir.

Nerede işe yarıyor

Zorluk sınırındaki yazılım mühendisliği. Karmaşık algoritmalar yazmak, kök nedenin belirtiden uzak olduğu çetrefilli üretim sorunlarını ayıklamak, hatalı kodun gerçek bir maliyeti olduğu kritik sistem bileşenlerini yeniden düzenlemek. Akıl yürütme adımı, daha hızlı modellerin gönül rahatlığıyla sevk edeceği hataları yakalıyor.

Disiplinler arası bilimsel akıl yürütme. Fizik artı kimya artı istatistik ya da biyoloji artı mühendislik gerektiren çok alanlı problemler. o3, birden fazla çerçeveyi akıl yürütme sırasında o1'e göre daha iyi, refleks modellerin başarabileceğinden ise belirgin biçimde daha iyi aktif tutuyor.

Akıl yürütmeli uzun belge analizi. 200.000 token'lık bağlam ile akıl yürütme derinliğinin birleşimi, o3'ü karmaşık hukuki sözleşme analizi, destekleyici referanslarla araştırma makalesi sentezi veya onlarca dosyaya yayılan kod tabanı analiz parçaları gibi iş yüklerinde amaca uygun hâle getiriyor.

Etkileşimli kısıtlar altında stratejik planlama. Kaynak tahsisi, çizelgeleme, çok hedefli optimizasyon. Problemin, açık olmayan biçimlerde birbiriyle etkileşen birçok kısıtının olduğu ve yanlış bir basitleştirmenin yanlış cevap verdiği her yer.

Nerede tökezliyor

Gerçek zamanlı etkileşimli uygulamalar. Gecikme profili, saniyenin altında yanıt vermesi gereken sohbet arayüzleriyle uyumsuz. Bu iş yükleri için refleks modeller kullanın; her iki özelliği de istiyorsanız zor sıraları o3'e asenkron olarak yönlendirin.

Basit özetleme ve çıkarım. Boşa harcanmış akıl yürütme hesaplaması. Çağrı başına maliyetin akıl yürütme derinliğinden daha önemli olduğu bu iş yükleri için gpt-4o-mini veya diğer refleks modelleri kullanın.

Akışın önemli olduğu yaratıcı yazım. o3, o1 ile aynı düz duygusal tonda özenli bir nesir üretiyor. Refleks modeller genellikle daha canlı yaratıcı çıktı verir çünkü akıl yürütme öncelikli üretimle kısıtlı değillerdir.

İnce çağrı başına marjlı yüksek hacimli iş yükleri. o3'ün sorgu başına maliyeti, düşük birim gelirle saatte on binlerce sorgu işlediğiniz türden iş yüklerine ölçeklenmiyor. Bu şekildeki ihtiyaçlar için o4-mini, birçok iş yükünü çok daha düşük çağrı başına maliyetle karşılayan, maliyet açısından verimli akıl yürütme katmanıdır.

Tercih etmek veya yatay geçiş yapmak

Gerçek akıl yürütme derinliği gerektiren yeni inşalar için o3, OpenAI kataloğundaki doğru varsayılandır. Tarihli anlık görüntü o3-2025-04-16, düzenlenmiş iş akışları veya yeniden üretilebilirlik için sabitlenmesi gereken sürümdür. o4 ailesindeki daha yeni akıl yürütme katmanları, kabiliyet üzerinde daha ileri yinelemeyi temsil eder; maliyet açısından verimli orta katmanda o4-mini ve dış kaynak entegrasyonu gerektiren araştırma modu iş akışları için o4-mini-deep-research yer alır.

Daha önce o1 üzerinde çalışan iş yükleri için o3'e geçiş genellikle değerlidir. Aynı problemlerde karşılaştırılabilir maliyetle daha iyi doğruluk elde edersiniz. İş, kendi belirli prompt örüntülerinizin temiz biçimde aktarılıp aktarılmadığını yeniden doğrulamaktan ibarettir; çoğu durumda öyledirler ama her zaman değil.

Maliyetten bağımsız olarak maksimum doğruluğu zorlamak istediğiniz en zor problemler için, o1-pro, o1 kuşağının uzatılmış akıl yürütme varyantıydı. Maksimum akıl yürütme çabası için o3 katmanındaki eşdeğer, aynı mimari konumda ancak daha yeni temel modelle yer alır. Hangisinin ekonomik açıdan mantıklı olduğuna karar vermek için kendi belirli zor problem setinize karşı düzgün bir değerlendirme turu yürütün.

AB veri yerleşimi, herhangi bir OpenAI akıl yürütme uç noktasında varsayılan olarak karşılanmaz. Bölgesel ağ geçidi (regional-gateway) örüntüsü pratik geçici çözümdür.

Son teknik inceleme: 2026-05-22 — Tokonomix.ai

o3 — illustration 2
Son otomatik test
14 Eyl 2026 · 20:03 UTC · Hız testi
P50 gecikme
822 ms
P95 gecikme
Hatalar
2 / 6 çalıştırma
Son inceleyen Tokonomix Ekibi·26 Mayıs 2026