Zum Inhalt
Tier A — Frontier
Läuft in:USErstellt in:United States

Einstellungsdatum

Der Anbieter nennt den 24. Juli 2027 als vorläufiges Einstellungsdatum. Das Modell ist derzeit wie gewohnt verfügbar.

Anthropic

Claude Opus 5

Tier A — Frontier · 1M Tokens

Tokonomix-Redaktionsteam·Geprüft von Mes Kalkan··
Abschnitt 01

Geschwindigkeitsanalyse

Latenz über alle Benchmark-Läufe gemessen. P50 (Median) und P95 (95. Perzentil) zeigen ein realistisches Bild der Antwortgeschwindigkeit bei normaler und Spitzenlast.

P50-Latenz (Median)P95-Latenz100 runs
97141197267104141356208-2109-14ms
Abschnitt 02

Qualitätswerte

Wie sich dieses Modell je Prompt-Kategorie zum übrigen Feld verhält, aus einem paarweisen Fit über dieselben Prompts. Die rohe Jury-Wertung steht unter jeder Zahl.

31%
Codegenerierung
Jury-Mittel 69
86%
Kreativ
Jury-Mittel 92
53%
Faktisch
Jury-Mittel 86
41%
Mehrsprachig
Jury-Mittel 88
55%
Schlussfolgern
Jury-Mittel 88

Gewinnrate je Kategorie: wie oft dieses Modell ein durchschnittliches Modell bei einem Prompt dieser Kategorie schlägt. 50% ist der Durchschnitt, keine schlechte Note. Es ist kein Prozentsatz richtiger Antworten.

Abschnitt 03

Preise

Was Sie pro Million Tokens zahlen, wenn Sie dieses Modell über Tokonomix nutzen, plus eine Schätzung für ein typisches Gespräch.

💰
API-Tarife — Claude Opus 5
$6.50 pro 1M Input-Tokens
$32.50 pro 1M Output-Tokens
≈ $0.0104 pro typischem Gespräch (800 Tokens)
Input- vs. Output-Preis (pro 1M Tokens)
pro 1M Input-Tokens$6.50
pro 1M Output-Tokens$32.50
Abschnitt 04

Tokens pro Sekunde

Durchsatz in Tokens pro Sekunde, abgeleitet aus gemessener P50-Latenz. Höhere Werte sind besser; Schwankungen spiegeln die Provider-seitige Last wider.

Durchsatz (Tokens / s)107 / avg 133
20419

Geschätzt aus P50-Latenz × 200 Output-Tokens — die absolute Zahl hängt von dieser Annahme ab; entscheidend ist der Trend.

Abschnitt 05

Fähigkeiten

toolssource: manualvisionjson modepdf inputreasoningjson schemaprompt cachingmax output tokens: 128000
Abschnitt 06

Verfügbarkeit

Verfügbarkeit

Wie oft dieses Modell antwortet, wenn wir es aufrufen — gemessen anhand echter API-Anfragen und Live-Tests der letzten 30 Tage. Dies ist unabhängig von der Qualität: Diese Zahlen zeigen nur, ob das Modell antwortet, nicht wie gut die Antwort ist.

Letzte 7 Tage

88.6%

n=44

Letzte 30 Tage

91.7%

n=72

Mediane Antwortzeit

25,106ms

n=66

Basierend auf 457 Messungen in den letzten 30 Tagen.

Technische Details

Nur echte API-Aufrufe und Live-Test-Anfragen werden gezählt — interne Proben und Benchmark-Läufe sind ausgeschlossen.

Aufrufe mit einem eigenen API-Schlüssel (BYOK) sind ausgeschlossen: Diese Fehler sind schlüsselspezifisch und kein Zeichen für Modellausfälle.

Fehlgeschlagene Aufrufe werden NICHT in Qualitätswerten berücksichtigt — Qualität wird nur für erfolgreiche Antworten gemessen. Verfügbarkeit und Qualität sind unabhängige Signale.

Mediane Antwortzeit (p50) über erfolgreiche Aufrufe mit aufgezeichneter Dauer. Ausreißer beeinflussen den Median weniger als den Durchschnitt.

Gesamte Aufrufe (30d)

72

OK-Antworten (30d)

66

Gesamte Aufrufe (7d)

44

OK-Antworten (7d)

39

Abschnitt 07

Tokonomix-Benchmark-Urteile

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-583/100 · 38 runs
29 correct4 partial5 wrong76% accuracy
2026-09-13

Claude Opus 5 shows quality decline, particularly in coding performance

Claude Opus 5's overall quality score has dropped to 85.3 from 92.0 in the previous benchmark window, representing a 6.7 point decline. The most significant regression appears in coding performance, which fell from 92 to 64, a substantial 28-point decrease that suggests potential issues with code generation or analysis capabilities. Factual accuracy remains a bright spot, achieving a perfect 100 score, while reasoning performance stayed strong at 92. The model's latency has increased slightly from 8541ms to 9811ms at the median, representing about 15% slower response times. The current benchmark window includes fewer test runs (4 versus 5), though this should not materially affect score validity. The previous window included creative and multilingual category testing, which were not evaluated in the current window, making direct comparison limited to the available categories. Users relying on Claude Opus 5 for coding tasks should exercise additional caution and validation, while those focused on factual retrieval and reasoning can expect continued strong performance. The quality decline warrants monitoring in subsequent benchmark windows to determine if this represents a temporary anomaly or a sustained trend.

Qualität

85.3

Latenz p50

9,811 ms

Testläufe

4

Coding score dropped 28 points Overall quality down 6.7 points Latency increased 15 percent Factual accuracy remains perfect
Abschnitt 08

Vollständiges Modellprofil

Claude Opus 5 — Modell-Deep-Dive

Claude Opus 5 ist Anthropics neues Flaggschiff der Opus-Reihe, veröffentlicht am 24. Juli 2026 als Nachfolger von Opus 4.8. Anthropic positioniert das Modell "für komplexes agentisches Coding und Enterprise-Arbeit", und es ist nun das Standardmodell in Claude Code, Anthropics eigenem Coding-Agenten. Verfügbar über die Claude API (Modell-ID claude-opus-5), Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry und Claude Platform on AWS.

Preis und Kontextfenster

Laut Anthropic "erreicht Opus 5 einen Großteil der Fähigkeiten von Fable 5 zum halben Preis" — eine Aussage von Anthropic selbst, nicht unabhängig verifiziert. Das Kontextfenster umfasst 1.000.000 Token, die maximale Ausgabe liegt bei 128k Token pro synchronem Aufruf — genug, um große Codebasen oder lange Dokumentensammlungen in einem Kontext zu erfassen.

Adaptive Thinking und Wissensstand

Statt des manuellen budget_tokens-Parameters aus dem älteren Extended-Thinking-Mechanismus nutzt Opus 5 Adaptive Thinking, gesteuert über einen effort-Parameter mit fünf Stufen: low, medium, high, xhigh und max (Standard: high). Die Trainingsdaten reichen zuverlässig bis Mai 2026 — laut Anthropic der aktuellste Wissensstand aller derzeit verfügbaren Claude-Modelle.

Langfristige Autonomie

Anthropics zentrale Aussage zu Opus 5 betrifft die Durchhaltefähigkeit bei langen, unbeaufsichtigten Aufgaben: stundenlanges eigenständiges Arbeiten, Erholung von eigenen Fehlern, Umgehen von Blockaden statt Stillstand, sowie zwischenzeitliche Kontrolle der eigenen Arbeit. Anthropic belegt dies mit eigenen Zahlen: 43,3% auf Frontier-Bench v0.1 (gegenüber 18,7% bei Opus 4.8) und 68,8% auf DeepSWE v1.1 (gegenüber 59,0% bei Opus 4.8). Dies sind Anthropics eigene veröffentlichte Werte, nicht unabhängig von Tokonomix reproduziert.

Besseres Urteilsvermögen

Zusätzlich nennt Anthropic verbessertes Urteilsvermögen: Das Modell stellt bei mehrdeutigen Anweisungen häufiger eine Rückfrage, bevor es rät, widerspricht eher bei fehlerhaften oder unzureichend spezifizierten Vorgaben statt sie wörtlich auszuführen, und bedenkt häufiger die Folgen einer Änderung vor der Umsetzung. Für diese Aussage liefert Anthropic keine quantitative Messung — sie beschreibt eine qualitative Designabsicht.

Wann Opus 5 wählen

Anthropic positioniert Opus 5 als neue Standardwahl für komplexe, agentische Coding- und Enterprise-Aufgaben sowie als günstigere Alternative zu Fable 5 mit nach eigener Aussage vergleichbaren Fähigkeiten in vielen Bereichen. Für einfachere Aufgaben — kurze Chats, Klassifikation, leichte Extraktion — bleibt ein kleineres, günstigeres Modell meist die effizientere Wahl; Opus 5 ist für langwierige, komplexe Aufgaben mit hohem Einsatz konzipiert, nicht für hochvolumige einfache Arbeit.

Verfügbarkeit auf Tokonomix

Claude Opus 5 ist auf Tokonomix unter dem Slug claude-opus-5 gelistet, Tier A, US-gehostet über Anthropic direct. Unabhängige Benchmark-Werte aus Tokonomix' eigenen Testläufen liegen noch nicht vor und erscheinen automatisch auf dieser Seite, sobald das Modell im nächsten Testzyklus berücksichtigt wird.

Letzter automatisierter Test
14. Sept. 2026 · 20:02 UTC · Geschwindigkeits-Benchmark
P50-Latenz
1862 ms
P95-Latenz
2597 ms
Fehler
0 / 6 Läufe
Zuletzt geprüft von Tokonomix-Team·15. September 2026