İçeriğe geç
Seviye B — Üretim
Çalıştığı yer:FranceYapıldığı yer:China
OVH AI Endpoints (GRA)

Qwen3-Coder-30B-A3B-Instruct

Seviye B — Üretim

Tokonomix Editöryel Ekibi·İnceleyen Mes Kalkan··
Bölüm 01

Hız analizi

Tüm benchmark çalıştırmalarında ölçülen gecikme. P50 (medyan) ve P95 (95. yüzdelik) normal ve yoğun yük altında yanıt hızının gerçekçi bir resmini verir.

P50 gecikme (medyan)P95 gecikme100 runs
60792015780236403150008-2109-14ms
Bölüm 02

Kalite puanları

Bu modelin her soru kategorisinde sahanın geri kalanına göre nerede durduğu; aynı sorular üzerinde ikili karşılaştırmayla hesaplanır. Ham jüri puanı her sayının altındadır.

55%
Kod üretimi
jüri ortalaması 92
36%
Yaratıcı
jüri ortalaması 78
57%
Olgusal
jüri ortalaması 77
53%
Çok dilli
jüri ortalaması 98
64%
Akıl yürütme
jüri ortalaması 93

Kategori başına kazanma oranı: bu modelin o kategoriden bir soruda ortalama bir modeli ne sıklıkla yendiği. %50 ortalamadır, kalma notu değildir. Doğru cevap yüzdesi de değildir.

Bölüm 03

Fiyatlar

Bu modeli Tokonomix üzerinden kullandığınızda milyon token başına ödediğiniz tutar ve tipik bir konuşma için tahmini maliyet.

💰
API tarifeleri — Qwen3-Coder-30B-A3B-Instruct
$0.1900 1M giriş token başına
$0.6800 1M çıkış token başına
≈ $0.0003 tipik konuşma başına (800 token)
Giriş vs çıkış fiyatı (1M token başına)
1M giriş token başına$0.1900
1M çıkış token başına$0.6800
Bölüm 04

Saniye başına token

Ölçülen P50 gecikmesinden türetilen saniye başına token verimi. Yüksek daha iyidir; dalgalanmalar sağlayıcı tarafındaki yükü yansıtır.

Verim (token / s)2439 / avg 1626
328420

P50 gecikme × 200 çıkış token tahmininden hesaplandı — mutlak rakam bu varsayıma bağlıdır; önemli olan eğilimdir.

Bölüm 05

Yetenekler

ownedBy: Qwen
Bölüm 06

Kullanılabilirlik

Kullanılabilirlik

Henüz ölçüm verisi yok

Bu model için kullanılabilirlik istatistiklerini göstermek için yeterli API çağrısı henüz kaydedilmedi. Veri, model canlı trafik almaya başlayınca görünür.

Bölüm 07

Tokonomix kıyaslama kararları

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-589/100 · 82 runs
68 correct4 partial10 wrong83% accuracy
2026-09-13

Quality falls 9.5 points to 75.2 with near-doubled latency

Qwen3-Coder-30B-A3B-Instruct demonstrates significant performance degradation in this benchmark window. Overall quality dropped from 84.7 to 75.2, representing a 9.5 point decline that follows a previous 6.5 point decrease. This marks a concerning downward trend across consecutive windows. Latency deteriorated substantially, with p50 response times increasing 93% from 2009ms to 3886ms, nearly doubling the wait time for users. Category performance shows mixed results with sharp variations. Reasoning achieved a perfect 100 score, indicating strong logical capabilities. However, coding performance plummeted from 94 to 69, a 25 point drop that undermines the model's core positioning as a coding specialist. Factual accuracy scored 57, though this represents a new category without direct comparison. The previous window's multilingual and creative categories were not tested in the current period. The combination of declining quality metrics and significantly increased latency suggests potential infrastructure or model configuration issues. Users should expect notably slower responses and reduced coding performance compared to the previous benchmark period. The perfect reasoning score provides limited consolation given the substantial regression in the model's primary coding capabilities.

Kalite

75.2

Gecikme p50

3,886 ms

Test çalıştırmaları

5

Quality dropped 9.5 points Latency increased 93% Coding score fell from 94 to 69 Perfect reasoning score achieved
Son otomatik test
14 Eyl 2026 · 20:02 UTC · Hız testi
P50 gecikme
82 ms
P95 gecikme
84 ms
Hatalar
0 / 6 çalıştırma
Son inceleyen Tokonomix Ekibi·14 Eylül 2026