Hız analizi
Tüm benchmark çalıştırmalarında ölçülen gecikme. P50 (medyan) ve P95 (95. yüzdelik) normal ve yoğun yük altında yanıt hızının gerçekçi bir resmini verir.
Kalite puanları
Bu modelin her soru kategorisinde sahanın geri kalanına göre nerede durduğu; aynı sorular üzerinde ikili karşılaştırmayla hesaplanır. Ham jüri puanı her sayının altındadır.
Kategori başına kazanma oranı: bu modelin o kategoriden bir soruda ortalama bir modeli ne sıklıkla yendiği. %50 ortalamadır, kalma notu değildir. Doğru cevap yüzdesi de değildir.
Fiyatlar
Bu modeli Tokonomix üzerinden kullandığınızda milyon token başına ödediğiniz tutar ve tipik bir konuşma için tahmini maliyet.
Saniye başına token
Ölçülen P50 gecikmesinden türetilen saniye başına token verimi. Yüksek daha iyidir; dalgalanmalar sağlayıcı tarafındaki yükü yansıtır.
P50 gecikme × 200 çıkış token tahmininden hesaplandı — mutlak rakam bu varsayıma bağlıdır; önemli olan eğilimdir.
Yetenekler
Kullanılabilirlik
Kullanılabilirlik
Bu modelin çağrıldığında ne sıklıkla yanıt verdiği — son 30 gün içindeki gerçek API istekleri ve canlı testler üzerinden ölçülmüştür. Bu kaliteden bağımsızdır: bu sayılar yalnızca modelin yanıt verip vermediğini gösterir, yanıtın ne kadar iyi olduğunu değil.
Son 7 gün
100.0%
n=6
Son 30 gün
100.0%
n=6
Medyan yanıt süresi
50,588ms
n=6
Baz alınan 391 ölçüm son 30 gün içinde.
Teknik detaylar
Yalnızca gerçek API çağrıları ve canlı test istekleri sayılır — dahili yoklamalar ve kıyaslama çalıştırmaları hariçtir.
Özel API anahtarıyla (BYOK) yapılan çağrılar hariçtir: bu hatalar anahtara özgüdür, model kesintisinin işareti değildir.
Başarısız çağrılar kalite puanlarına DAHİL EDİLMEZ — kalite yalnızca başarılı yanıtlar üzerinden ölçülür. Kullanılabilirlik ve kalite bağımsız sinyallerdir.
Kaydedilmiş süreye sahip başarılı çağrılarda medyan yanıt süresi (p50). Aykırı değerler medyanı ortalamadan daha az etkiler.
Toplam çağrı (30d)
6
OK yanıtlar (30d)
6
Toplam çağrı (7d)
6
OK yanıtlar (7d)
6
Tokonomix kıyaslama kararları
Qwen3-32B drops to 56.8 quality, latency improves 17% to 18.0s
Qwen3-32B shows a mixed performance shift in this benchmark window, with overall quality declining slightly from 58.0 to 56.8 while latency improved meaningfully from 21.7s to 18.0s. The 17% latency improvement brings response times closer to acceptable levels, though they remain notably high for a 32B parameter model. Category performance reveals dramatic swings: reasoning capability jumped impressively to 89 from a previous coding score of 52, and coding maintained strong performance at 72. However, factual accuracy collapsed to just 10, a concerning regression that suggests significant reliability issues with knowledge-based queries. The previous window's multilingual strength at 91 and creative capabilities are not represented in current testing categories, making direct comparison incomplete. This benchmarking period captures only 5 test runs, matching the previous window's sample size. Users should exercise caution with factual queries given the severe accuracy drop, while those prioritizing reasoning tasks may find improved utility. The latency gains are welcome but the model still requires substantial patience per request. Overall trajectory remains uncertain given the quality decline despite operational improvements.
Kalite
56.8
Gecikme p50
17,953 ms
Test çalıştırmaları
5
Qwen3-32B
OVH AI Endpoints (GRA) tarafından
- Yayın tarihi
- 29 Nisan 2025
- Bağlam penceresi
- — tokens
- Giriş fiyatı
- $0.2100 / 1M
- Çıkış fiyatı
- $0.6000 / 1M
- Seviye
- Seviye B — Üretim
- Modalite
- Metin
- API türü
- REST · akış
- Benchmark çalıştırmaları
- 522
OVH AI Endpoints (GRA) tarafından daha fazla