Zum Inhalt
Tier A — Frontier
Läuft in:USErstellt in:United States

Einstellungsdatum

Der Anbieter nennt den 28. Mai 2027 als vorläufiges Einstellungsdatum. Das Modell ist derzeit wie gewohnt verfügbar.

Anthropic

Claude Opus 4.8

Tier A — Frontier · 1M Tokens

Tokonomix-Redaktionsteam·Geprüft von Mes Kalkan··

Claude Opus 4.8 setzt Anthropics Flaggschiff-Linie fort und liefert messbar zuverlässigere Code-Analyse sowie deutlich längere autonome Läufe — bei identischen Preisen wie Opus 4.7.

Tokonomix Modellanalyse
Abschnitt 01

Geschwindigkeitsanalyse

Latenz über alle Benchmark-Läufe gemessen. P50 (Median) und P95 (95. Perzentil) zeigen ein realistisches Bild der Antwortgeschwindigkeit bei normaler und Spitzenlast.

P50-Latenz (Median)P95-Latenz100 runs
702138320652746342708-2109-14ms
Abschnitt 02

Qualitätswerte

Wie sich dieses Modell je Prompt-Kategorie zum übrigen Feld verhält, aus einem paarweisen Fit über dieselben Prompts. Die rohe Jury-Wertung steht unter jeder Zahl.

48%
Codegenerierung
Jury-Mittel 94
44%
Kreativ
Jury-Mittel 87
72%
Faktisch
Jury-Mittel 88
58%
Mehrsprachig
Jury-Mittel 98
67%
Schlussfolgern
Jury-Mittel 99

Gewinnrate je Kategorie: wie oft dieses Modell ein durchschnittliches Modell bei einem Prompt dieser Kategorie schlägt. 50% ist der Durchschnitt, keine schlechte Note. Es ist kein Prozentsatz richtiger Antworten.

Abschnitt 03

Preise

Was Sie pro Million Tokens zahlen, wenn Sie dieses Modell über Tokonomix nutzen, plus eine Schätzung für ein typisches Gespräch.

💰
API-Tarife — Claude Opus 4.8
$6.50 pro 1M Input-Tokens
$32.50 pro 1M Output-Tokens
≈ $0.0104 pro typischem Gespräch (800 Tokens)
Input- vs. Output-Preis (pro 1M Tokens)
pro 1M Input-Tokens$6.50
pro 1M Output-Tokens$32.50
Abschnitt 04

Tokens pro Sekunde

Durchsatz in Tokens pro Sekunde, abgeleitet aus gemessener P50-Latenz. Höhere Werte sind besser; Schwankungen spiegeln die Provider-seitige Last wider.

Durchsatz (Tokens / s)203 / avg 185
28373

Geschätzt aus P50-Latenz × 200 Output-Tokens — die absolute Zahl hängt von dieser Annahme ab; entscheidend ist der Trend.

Abschnitt 05

Stärken & Schwächen

Basierend auf Benchmark-Ergebnissen und aggregiertem Community-Feedback zu realen Anwendungsfällen.

Stärken

4× weniger übersehene Code-FehlerLängere autonome Läufe ohne Abbruch1 Million Token KontextfensterAdaptive Thinking für schwierige AufgabenSchärferes Urteil über eigenen FortschrittVision und multimodale EingabenZuverlässiges Tool-Use in Agenten-PipelinesGleicher Preis wie Opus 4.7

Schwächen

Höhere Latenz als Sonnet 4.6 oder Haiku 4.5Deutlich teurer als leichtere Modelle für einfache AufgabenKein Extended-Thinking-Modus verfügbarKnowledge-Cutoff schränkt tagesaktuelle Informationen ein
Abschnitt 06

Fähigkeiten

toolssource: litellmvisionjson modepdf inputreasoningjson schemaprompt cachingmax output tokens: 128000
Abschnitt 07

Häufig gestellte Fragen

Ja, wenn Code-Review oder autonome Agenten-Workflows im Einsatz sind. Die rund 4× geringere Rate übersehener Code-Fehler und die verbesserte Selbstbeurteilung des Fortschritts reduzieren manuelle Nachkontrolle spürbar. Für rein textbasierte Aufgaben ohne Fehlerkritikalität ist der Unterschied geringer.

Für Teams, die komplexe, mehrstufige Workflows automatisieren wollen, ist Opus 4.8 derzeit die robusteste Wahl im Anthropic-Portfolio — sofern Latenz und Kosten im Verhältnis zum Aufgabengewicht stehen.

Tokonomix Redaktion
Abschnitt 08

Verfügbarkeit

Verfügbarkeit

Wie oft dieses Modell antwortet, wenn wir es aufrufen — gemessen anhand echter API-Anfragen und Live-Tests der letzten 30 Tage. Dies ist unabhängig von der Qualität: Diese Zahlen zeigen nur, ob das Modell antwortet, nicht wie gut die Antwort ist.

Letzte 7 Tage

100.0%

n=53

Letzte 30 Tage

100.0%

n=56

Mediane Antwortzeit

8,130ms

n=56

Basierend auf 441 Messungen in den letzten 30 Tagen.

Technische Details

Nur echte API-Aufrufe und Live-Test-Anfragen werden gezählt — interne Proben und Benchmark-Läufe sind ausgeschlossen.

Aufrufe mit einem eigenen API-Schlüssel (BYOK) sind ausgeschlossen: Diese Fehler sind schlüsselspezifisch und kein Zeichen für Modellausfälle.

Fehlgeschlagene Aufrufe werden NICHT in Qualitätswerten berücksichtigt — Qualität wird nur für erfolgreiche Antworten gemessen. Verfügbarkeit und Qualität sind unabhängige Signale.

Mediane Antwortzeit (p50) über erfolgreiche Aufrufe mit aufgezeichneter Dauer. Ausreißer beeinflussen den Median weniger als den Durchschnitt.

Gesamte Aufrufe (30d)

56

OK-Antworten (30d)

56

Gesamte Aufrufe (7d)

53

OK-Antworten (7d)

53

Abschnitt 09

Tokonomix-Benchmark-Urteile

⚖️
Endorsed by 2 judges
Independent LLM judges evaluated this model on our weekly intelligence tests
cohere/command-a100/100 · 1 runs
1 correct0 partial0 wrong100% accuracy
claude-sonnet-4-594/100 · 80 runs
74 correct4 partial2 wrong93% accuracy
2026-09-13

Claude Opus 4.8 adds seven capabilities but lacks performance benchmarks

Claude Opus 4.8 introduces a significant expansion of capabilities without accompanying performance data. The model now supports seven new features: tools, vision, JSON mode, PDF input, reasoning, JSON schema, and prompt caching. These additions represent a substantial broadening of the model's functionality, particularly with the inclusion of multimodal capabilities through vision and PDF input, as well as structured output options via JSON mode and schema support. The reasoning capability suggests enhanced analytical features, while prompt caching could improve efficiency for repetitive tasks. However, no benchmark scores are available in the current window, making it impossible to assess the model's actual performance across standard evaluation metrics or compare it to previous versions or competitors. Users gain access to a more versatile model with expanded input and output formats, but without performance data, it remains unclear whether these new capabilities come with any trade-offs in speed, accuracy, or other quality metrics. The absence of benchmarks is notable given that this appears to be a major feature release.

Qualität

Latenz p50

Testläufe

0

Seven new capabilities added Multimodal support via vision Structured output with JSON No benchmark data available
Abschnitt 10

Vollständiges Modellprofil

Claude Opus 4.8 von Anthropic

Veröffentlicht am 28. Mai 2026. Anthropics neues Flaggschiff. Gegenüber Opus 4.7: rund 4× geringere Wahrscheinlichkeit für übersehene Code-Fehler, schärferes Urteilsvermögen über den eigenen Fortschritt, längere autonome Läufe.

Vollständiger redaktioneller Text folgt — Seite befüllt aus offiziellen Anthropic-Release-Daten am 29. Mai 2026.

Letzter automatisierter Test
14. Sept. 2026 · 20:02 UTC · Geschwindigkeits-Benchmark
P50-Latenz
987 ms
P95-Latenz
1118 ms
Fehler
0 / 6 Läufe
Zuletzt geprüft von Tokonomix-Team·15. September 2026