Naar inhoud
Tier C — Specialist
Draait in:FranceGemaakt in:France
OVH AI Endpoints (GRA)

Mistral-Nemo-Instruct-2407

Tier C — Specialist

Tokonomix-redactie·Gecontroleerd door Mes Kalkan··
Sectie 01

Snelheidsanalyse

Latency gemeten over alle benchmark-runs. P50 (mediaan) en P95 (95e percentiel) geven een realistisch beeld van de responssnelheid onder normale en piekbelasting.

P50 latency (mediaan)P95 latency100 runs
7456710601553204608-2109-14ms
Sectie 02

Kwaliteitsscores

Hoe dit model zich per promptcategorie verhoudt tot de rest van het veld, uit een paarsgewijze berekening over dezelfde prompts. Het ruwe jurycijfer staat onder elk getal.

42%
Code generatie
jurygemiddelde 89
10%
Creatief
jurygemiddelde 61
29%
Feitelijk
jurygemiddelde 57
39%
Meertaligheid
jurygemiddelde 89
36%
Redeneren
jurygemiddelde 68

Winstpercentage per categorie: hoe vaak dit model een gemiddeld model verslaat op een prompt uit die categorie. 50% is gemiddeld, geen onvoldoende. Het is geen percentage goede antwoorden.

Sectie 03

Prijzen

Wat je per miljoen tokens betaalt als je dit model via Tokonomix gebruikt, plus een schatting voor een gemiddeld gesprek.

💰
API-tarieven — Mistral-Nemo-Instruct-2407
$0.3400 per 1M input-tokens
$0.3400 per 1M output-tokens
≈ $0.0003 per typisch gesprek (800 tokens)
Input vs output prijs (per 1M tokens)
per 1M input-tokens$0.3400
per 1M output-tokens$0.3400
Sectie 04

Tokens per seconde

Doorvoersnelheid in tokens per seconde, afgeleid uit gemeten P50-latency. Hogere waarden zijn beter; fluctuaties weerspiegelen serverbelasting bij de provider.

Doorvoer (tokens / s)1266 / avg 1641
2651195

Geschat uit P50-latency × 200 output-tokens — het absolute getal hangt af van deze aanname; de trend is wat telt.

Sectie 05

Mogelijkheden

ownedBy: mistralai
Sectie 06

Beschikbaarheid

Beschikbaarheid

Nog geen meetdata

Er zijn nog niet genoeg API-aanroepen geregistreerd om beschikbaarheidsstatistieken voor dit model te tonen. Data verschijnt zodra het model live verkeer ontvangt.

Sectie 07

Tokonomix benchmark-oordelen

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a20/100 · 1 runs
0 correct1 partial0 wrong0% accuracy
claude-sonnet-4-576/100 · 81 runs
52 correct10 partial19 wrong64% accuracy
2026-09-13

Quality drops 33 points to 49.5 as latency more than doubles

Mistral-Nemo-Instruct-2407 experienced a significant performance regression in this benchmark window, with overall quality declining from 82.6 to 49.5 points. The model's latency deteriorated substantially, with p50 response times increasing from 3969ms to 8587ms, representing a 116% slowdown. Category performance shows mixed results with a dramatic shift in capability distribution. Coding performance declined from 95 to 69 points, though it remains the model's strongest area. Reasoning performance dropped from previous levels to 66 points. Most notably, factual accuracy collapsed to just 14 points, indicating serious issues with knowledge retrieval and accuracy. The multilingual and creative categories, which showed strong scores of 100 and 53 respectively in the previous window, were not measured in this evaluation period. These combined regressions in both quality and speed suggest potential infrastructure issues or model serving problems affecting the OVH AI Endpoints deployment in the GRA region. Users should exercise caution with factual queries and expect significantly slower response times until these issues are investigated and resolved.

Kwaliteit

49.5

Latency p50

8,587 ms

Testruns

5

Quality dropped 33 points Latency doubled to 8.6s Factual accuracy collapsed to 14 Coding performance declined to 69
Laatste automatische test
14 sep 2026 · 20:02 UTC · Snelheidstest
P50 latency
158 ms
P95 latency
190 ms
Fouten
0 / 6 runs
Laatst beoordeeld door Tokonomix-team·14 september 2026