Hız analizi
Tüm benchmark çalıştırmalarında ölçülen gecikme. P50 (medyan) ve P95 (95. yüzdelik) normal ve yoğun yük altında yanıt hızının gerçekçi bir resmini verir.
Kalite puanları
Çeşitli görev kategorilerinde yargıç modelin puanlarından elde edilen değerlendirme sonuçları. Puanlar tutarlılık, doğruluk ve talimat takibini yansıtır.
Fiyat geçmişi
Milyon token başına doğrudan sağlayıcı tarifeleri, artı tipik bir konuşma maliyet tahmini.
Pricing over time
Input & output per 1M tokens · step-line = price changes
$0.0800
input / 1M
— stable
$0.2300
output / 1M
— stable
Saniye başına token
Ölçülen P50 gecikmesinden türetilen saniye başına token verimi. Yüksek daha iyidir; dalgalanmalar sağlayıcı tarafındaki yükü yansıtır.
P50 gecikme × 200 çıkış token tahmininden hesaplandı — mutlak rakam bu varsayıma bağlıdır; önemli olan eğilimdir.
Yetenekler
Kullanılabilirlik
Kullanılabilirlik
Bu modelin çağrıldığında ne sıklıkla yanıt verdiği — son 30 gün içindeki gerçek API istekleri ve canlı testler üzerinden ölçülmüştür. Bu kaliteden bağımsızdır: bu sayılar yalnızca modelin yanıt verip vermediğini gösterir, yanıtın ne kadar iyi olduğunu değil.
Son 7 gün
—
Son 30 gün
100.0%
n=33
Medyan yanıt süresi
145,961ms
n=33
Baz alınan 413 ölçüm son 30 gün içinde.
Teknik detaylar
Yalnızca gerçek API çağrıları ve canlı test istekleri sayılır — dahili yoklamalar ve kıyaslama çalıştırmaları hariçtir.
Özel API anahtarıyla (BYOK) yapılan çağrılar hariçtir: bu hatalar anahtara özgüdür, model kesintisinin işareti değildir.
Başarısız çağrılar kalite puanlarına DAHİL EDİLMEZ — kalite yalnızca başarılı yanıtlar üzerinden ölçülür. Kullanılabilirlik ve kalite bağımsız sinyallerdir.
Kaydedilmiş süreye sahip başarılı çağrılarda medyan yanıt süresi (p50). Aykırı değerler medyanı ortalamadan daha az etkiler.
Toplam çağrı (30d)
33
OK yanıtlar (30d)
33
Toplam çağrı (7d)
0
OK yanıtlar (7d)
0
Tokonomix kıyaslama kararları
Qwen3-32B shows 34% latency gain but factual score plummets to 35
The current benchmark window reveals a mixed performance picture for Qwen3-32B deployed on OVH AI Endpoints. While latency has improved substantially with p50 dropping from 24595ms to 16206ms, representing a 34% speed increase, the overall quality score has declined slightly from 73.4 to 72.3. The most concerning development is the dramatic collapse in factual performance, now scoring just 35 compared to the previous window where factual capabilities weren't measured but coding achieved 94. This suggests a significant regression in knowledge accuracy and reliability. On the positive side, multilingual capabilities have strengthened from 86 to 95, and reasoning performance stands strong at 83. Creative writing has rebounded impressively from 40 to 76, reversing the sharp decline noted in the previous period. The model appears to have shifted its strengths, excelling at multilingual tasks and creative generation while struggling with factual accuracy. Users requiring precise factual responses should exercise caution, while those focused on creative multilingual applications may find the current configuration more suitable. The latency improvements make the service more responsive overall, but the factual performance gap represents a critical weakness for general-purpose deployments.
Quality
72.3
Latency p50
16,206 ms
Test runs
5
Qwen3-32B
OVH AI Endpoints (GRA) tarafından
- Bağlam penceresi
- — tokens
- Giriş fiyatı
- $0.0800 / 1M
- Çıkış fiyatı
- $0.2300 / 1M
- Seviye
- Seviye B — Üretim
- Modalite
- Metin
- API türü
- REST · akış
- Benchmark çalıştırmaları
- 301
OVH AI Endpoints (GRA) tarafından daha fazla