Claude Opus 5 veröffentlicht: Annäherung an die hochmoderne Intelligenz von Fable 5 zum halben Preis, mit über 4,8 in der wissenschaftlichen Bewertung
Anthropic hat am 24. Juli Claude Opus 5 veröffentlicht: Zum gleichen Preis wie Opus 4.8 aktualisiert es SOTA in mehreren Benchmarks wie Frontier-Bench und CursorBench. Der ARC-AGI 3-Score ist dreimal so hoch wie der des suboptimalen Modells und wird als das Modell mit der „höchsten Ausrichtung und geringsten Täuschung in der Geschichte“ bezeichnet.
Anthropic ließ am 24. Juli eine sorgfältig berechnete Schachfigur fallen: Claude Opus 5 wurde offiziell veröffentlicht – der Preis ist genau der gleiche wie Opus 4.8, aber die Leistung ist „nahe am Flaggschiff zum halben Preis“ und dringt in die leeren Bereiche seiner High-End- und Mittelklasse-Produktlinien ein. Die offizielle Positionierung ist sehr einfach: Dies ist ein hochmodernes Modell, das täglich verwendet werden kann, und es ist natürlich zum Standardmodell von Claude Max und zum leistungsstärksten Modell von Claude Pro geworden.
Benchmark-Ergebnisse: SOTA vs. „3x das Nächstbeste“
Die harten Daten von Opus 5 hinterlassen auf fast jeder Tonleiter eine „erdrückende“ Fußnote:
- Frontier-Bench v0.1: Übertrifft alle anderen Modelle und erreicht mehr als die doppelte Leistung von Opus 4.8 bei geringeren Kosten pro Aufgabe
- CursorBench 3.2: Der höchste Aufwand unterscheidet sich nur 0,5 % vom Spitzenwert in Fable 5, und die Kosten betragen nur die Hälfte davon
- ARC-AGI 3: Erzielt 3x höhere Werte als das nächstbeste Modell
- Zapier AutomationBench: Bei den gleichen Einzelaufgabenkosten beträgt die Erfolgsquote etwa das 1,5-fache der des suboptimalen Modells
- OSWorld 2.0: Übertrifft das beste Ergebnis von Fable 5 bei über einem Drittel der Kosten
Die wissenschaftliche Bewertung ist sogar besser als 4,8: Alle Life-Science-Bewertungen sind überlegen, die interne Bewertung der organischen Chemie ist 10,2 Prozentpunkte höher als 4,8 und die proteinbezogenen Aufgaben sind 7,7 Prozentpunkte höher.
Preise und neue technische Möglichkeiten
Opus 5 ist ab heute auf allen Plattformen verfügbar, kostet 5 $/Million Input-Tokens, 25 $/Million Output-Tokens (wie Opus 4.8) und bietet den Schnellmodus (etwa 2,5-mal schneller, 2-facher Preis). Zwei gleichzeitige Betas sind die Aufmerksamkeit des Engineering-Teams wert: Tool-Änderungen während der Sitzung (Prompt-Cache wird nicht mehr ungültig gemacht, die Kostenstruktur langer Sitzungen wird erheblich verbessert) und Automatisches API-Rollback (ein offizieller Versuch, die Fehlertoleranz herabzustufen).
Auf der Ebene der Ausrichtung machte Anthropic eine seltene Aussage: Opus 5 ist sein „am besten ausgerichtetes und am wenigsten irreführendes Modell aller Zeiten“ mit einem Ausrichtungswert von 2,3. Im Einklang mit dem am 30. Juni vorgestellten Branchenrahmenwerk „Jailbreak Severity Score“ vermarktet Anthropic neben der Leistung auch Sicherheitsfunktionen als Verkaufsargument.
Aus Branchensicht besteht die tiefgreifende Bedeutung der Opus-5-Kartenposition darin, dass Fable 5 (modernstes Flaggschiff) und Sonnet 5 (groß angelegte Hauptstreitmacht) jeweils die beiden Enden besetzen, während Opus 5 den mittleren Bereich mit dem „Flaggschiff zum halben Preis“ ausfüllt. Dies ist eigentlich eine direkte Spiegelreaktion auf die dreistufige Preisgestaltung von OpenAI GPT-5.6 (Sol/Terra/Luna). Für Entwickler und Hersteller auf beiden Seiten dieses „Kosten-Leistungs-Verhältnisses“ überlassen sie die Wahl derselben Variablen – den Dollarkosten pro Intelligenzeinheit.
Mehrere Richtungen, die es wert sind, in Zukunft verfolgt zu werden:
- ARC-AGI 3-Bewertungsmethodik: Nachdem OpenAI am 29. Juli bekannt gab, dass „zwei Einstellungen die Punktzahl verdreifachen“, muss die horizontale Vergleichbarkeit der ARC-AGI 3-Zahlen jedes Unternehmens erneut überprüft werden.
- Die tatsächlichen Kostenauswirkungen von Tool-Änderungen während der Sitzung: Die sofortige Cache-Aufbewahrungsrate ist die zentrale Kostenvariable für lange Agentenaufgaben.
- Durchdringung von Opus 5 in wissenschaftlichen Computerszenarien: Kann die Führungsrolle bei Life-Science-Bewertungen in tatsächliche Käufe durch medizinische und biopharmazeutische Kunden umgesetzt werden?
- Folgeaktionen von Fable 5: Nachdem sich das Flaggschiff „zum halben Preis genähert“ hat, wird der Upgrade-Rhythmus für das Flaggschiff der nächsten Generation von Anthropic gezwungen sein, voranzukommen.
Bewertungen