Zum Inhalt
Tier B — Produktion
Läuft in:FranceErstellt in:France
OVH AI Endpoints (GRA)

Mistral-Small-3.2-24B-Instruct-2506

Tier B — Produktion

Tokonomix-Redaktionsteam·Geprüft von Mes Kalkan··
Abschnitt 01

Geschwindigkeitsanalyse

Latenz über alle Benchmark-Läufe gemessen. P50 (Median) und P95 (95. Perzentil) zeigen ein realistisches Bild der Antwortgeschwindigkeit bei normaler und Spitzenlast.

P50-Latenz (Median)P95-Latenz100 runs
7036467222107981437408-2109-14ms
Abschnitt 02

Qualitätswerte

Wie sich dieses Modell je Prompt-Kategorie zum übrigen Feld verhält, aus einem paarweisen Fit über dieselben Prompts. Die rohe Jury-Wertung steht unter jeder Zahl.

66%
Codegenerierung
Jury-Mittel 98
41%
Kreativ
Jury-Mittel 86
46%
Faktisch
Jury-Mittel 70
50%
Mehrsprachig
Jury-Mittel 98
61%
Schlussfolgern
Jury-Mittel 96

Gewinnrate je Kategorie: wie oft dieses Modell ein durchschnittliches Modell bei einem Prompt dieser Kategorie schlägt. 50% ist der Durchschnitt, keine schlechte Note. Es ist kein Prozentsatz richtiger Antworten.

Abschnitt 03

Preise

Was Sie pro Million Tokens zahlen, wenn Sie dieses Modell über Tokonomix nutzen, plus eine Schätzung für ein typisches Gespräch.

💰
API-Tarife — Mistral-Small-3.2-24B-Instruct-2506
$0.2400 pro 1M Input-Tokens
$0.7300 pro 1M Output-Tokens
≈ $0.0003 pro typischem Gespräch (800 Tokens)
Input- vs. Output-Preis (pro 1M Tokens)
pro 1M Input-Tokens$0.2400
pro 1M Output-Tokens$0.7300
Abschnitt 04

Tokens pro Sekunde

Durchsatz in Tokens pro Sekunde, abgeleitet aus gemessener P50-Latenz. Höhere Werte sind besser; Schwankungen spiegeln die Provider-seitige Last wider.

Durchsatz (Tokens / s)1149 / avg 1317
282184

Geschätzt aus P50-Latenz × 200 Output-Tokens — die absolute Zahl hängt von dieser Annahme ab; entscheidend ist der Trend.

Abschnitt 05

Fähigkeiten

ownedBy: mistralai
Abschnitt 06

Verfügbarkeit

Verfügbarkeit

Wie oft dieses Modell antwortet, wenn wir es aufrufen — gemessen anhand echter API-Anfragen und Live-Tests der letzten 30 Tage. Dies ist unabhängig von der Qualität: Diese Zahlen zeigen nur, ob das Modell antwortet, nicht wie gut die Antwort ist.

Letzte 7 Tage

100.0%

n=819

Letzte 30 Tage

100.0%

n=2,307

Mediane Antwortzeit

1,905ms

n=2,307

Basierend auf 2,692 Messungen in den letzten 30 Tagen.

Technische Details

Nur echte API-Aufrufe und Live-Test-Anfragen werden gezählt — interne Proben und Benchmark-Läufe sind ausgeschlossen.

Aufrufe mit einem eigenen API-Schlüssel (BYOK) sind ausgeschlossen: Diese Fehler sind schlüsselspezifisch und kein Zeichen für Modellausfälle.

Fehlgeschlagene Aufrufe werden NICHT in Qualitätswerten berücksichtigt — Qualität wird nur für erfolgreiche Antworten gemessen. Verfügbarkeit und Qualität sind unabhängige Signale.

Mediane Antwortzeit (p50) über erfolgreiche Aufrufe mit aufgezeichneter Dauer. Ausreißer beeinflussen den Median weniger als den Durchschnitt.

Gesamte Aufrufe (30d)

2,307

OK-Antworten (30d)

2,307

Gesamte Aufrufe (7d)

819

OK-Antworten (7d)

819

Bildqualitäts-Pilot (2026-06-10)

Recall

9.4%

n=300

Fehlalarmrate

12.1%

n=300

Abschnitt 07

Tokonomix-Benchmark-Urteile

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-591/100 · 83 runs
73 correct7 partial3 wrong88% accuracy
2026-09-13

Quality plummets 17.1 points to 70.7 amid doubled latency and coverage shift

Mistral-Small-3.2-24B-Instruct-2506 experiences a significant performance decline in this benchmark window, with overall quality dropping from 87.8 to 70.7 points. This 17.1-point decrease represents the continuation of a downward trend observed in the previous period. Latency has deteriorated substantially, with the median response time nearly doubling from 4102ms to 8162ms, a 99% increase that will impact real-world application responsiveness. Category performance reveals an unusual pattern. Coding remains exceptional at 96, maintaining near-perfect scores across both windows. Reasoning achieved a perfect 100 score in current testing. However, factual accuracy collapsed to just 16 points, representing a critical weakness. The benchmark window also shows a shift in category coverage, with multilingual and creative categories from the previous period replaced by factual and reasoning assessments in the current window. The dramatic decline in factual performance combined with significantly slower response times raises concerns about model reliability for knowledge-based tasks. While coding and reasoning capabilities remain strong, the overall trajectory suggests potential infrastructure or configuration issues affecting both speed and accuracy.

Qualität

70.7

Latenz p50

8,162 ms

Testläufe

5

Quality dropped 17.1 points Latency doubled to 8162ms Factual accuracy critically low Perfect reasoning score achieved
Letzter automatisierter Test
14. Sept. 2026 · 20:02 UTC · Geschwindigkeits-Benchmark
P50-Latenz
174 ms
P95-Latenz
691 ms
Fehler
0 / 6 Läufe
Zuletzt geprüft von Tokonomix-Team·14. September 2026