İçeriğe geç
Seviye C — Uzman
Çalıştığı yer:FranceYapıldığı yer:France
OVH AI Endpoints (GRA)

Mistral-Nemo-Instruct-2407

Seviye C — Uzman

Tokonomix Editöryel Ekibi·İnceleyen Mes Kalkan··
Bölüm 01

Hız analizi

Tüm benchmark çalıştırmalarında ölçülen gecikme. P50 (medyan) ve P95 (95. yüzdelik) normal ve yoğun yük altında yanıt hızının gerçekçi bir resmini verir.

P50 gecikme (medyan)P95 gecikme100 runs
7456710601553204608-2109-14ms
Bölüm 02

Kalite puanları

Bu modelin her soru kategorisinde sahanın geri kalanına göre nerede durduğu; aynı sorular üzerinde ikili karşılaştırmayla hesaplanır. Ham jüri puanı her sayının altındadır.

42%
Kod üretimi
jüri ortalaması 89
10%
Yaratıcı
jüri ortalaması 61
29%
Olgusal
jüri ortalaması 57
39%
Çok dilli
jüri ortalaması 89
36%
Akıl yürütme
jüri ortalaması 68

Kategori başına kazanma oranı: bu modelin o kategoriden bir soruda ortalama bir modeli ne sıklıkla yendiği. %50 ortalamadır, kalma notu değildir. Doğru cevap yüzdesi de değildir.

Bölüm 03

Fiyatlar

Bu modeli Tokonomix üzerinden kullandığınızda milyon token başına ödediğiniz tutar ve tipik bir konuşma için tahmini maliyet.

💰
API tarifeleri — Mistral-Nemo-Instruct-2407
$0.3400 1M giriş token başına
$0.3400 1M çıkış token başına
≈ $0.0003 tipik konuşma başına (800 token)
Giriş vs çıkış fiyatı (1M token başına)
1M giriş token başına$0.3400
1M çıkış token başına$0.3400
Bölüm 04

Saniye başına token

Ölçülen P50 gecikmesinden türetilen saniye başına token verimi. Yüksek daha iyidir; dalgalanmalar sağlayıcı tarafındaki yükü yansıtır.

Verim (token / s)1266 / avg 1641
2651195

P50 gecikme × 200 çıkış token tahmininden hesaplandı — mutlak rakam bu varsayıma bağlıdır; önemli olan eğilimdir.

Bölüm 05

Yetenekler

ownedBy: mistralai
Bölüm 06

Kullanılabilirlik

Kullanılabilirlik

Henüz ölçüm verisi yok

Bu model için kullanılabilirlik istatistiklerini göstermek için yeterli API çağrısı henüz kaydedilmedi. Veri, model canlı trafik almaya başlayınca görünür.

Bölüm 07

Tokonomix kıyaslama kararları

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a20/100 · 1 runs
0 correct1 partial0 wrong0% accuracy
claude-sonnet-4-576/100 · 81 runs
52 correct10 partial19 wrong64% accuracy
2026-09-13

Quality drops 33 points to 49.5 as latency more than doubles

Mistral-Nemo-Instruct-2407 experienced a significant performance regression in this benchmark window, with overall quality declining from 82.6 to 49.5 points. The model's latency deteriorated substantially, with p50 response times increasing from 3969ms to 8587ms, representing a 116% slowdown. Category performance shows mixed results with a dramatic shift in capability distribution. Coding performance declined from 95 to 69 points, though it remains the model's strongest area. Reasoning performance dropped from previous levels to 66 points. Most notably, factual accuracy collapsed to just 14 points, indicating serious issues with knowledge retrieval and accuracy. The multilingual and creative categories, which showed strong scores of 100 and 53 respectively in the previous window, were not measured in this evaluation period. These combined regressions in both quality and speed suggest potential infrastructure issues or model serving problems affecting the OVH AI Endpoints deployment in the GRA region. Users should exercise caution with factual queries and expect significantly slower response times until these issues are investigated and resolved.

Kalite

49.5

Gecikme p50

8,587 ms

Test çalıştırmaları

5

Quality dropped 33 points Latency doubled to 8.6s Factual accuracy collapsed to 14 Coding performance declined to 69
Son otomatik test
14 Eyl 2026 · 20:02 UTC · Hız testi
P50 gecikme
158 ms
P95 gecikme
190 ms
Hatalar
0 / 6 çalıştırma
Son inceleyen Tokonomix Ekibi·14 Eylül 2026