Anthropics neues Flaggschiff-Modell Claude Opus 5 dominiert den ARC-AGI-3-Benchmark mit einem nie dagewesenen Score von 30,2 Prozent. Der vorherige Rekordhalter GPT-5.6 Sol kam auf magere 7,8 Prozent. Opus 5 löst fünf bisher ungelöste Aufgaben, davon vier auf menschlichem Niveau.
ARC-AGI-3: Der Test für echtes Denken
Der ARC-AGI-3-Benchmark misst etwas, das herkömmliche Tests nicht erfassen. Er prüft, wie gut ein KI-Modell völlig neue Aufgaben löst, die es nie beim Training gesehen hat. Das Format funktioniert wie ein Spiel. Das Modell muss Regeln einer unbekannten Umgebung erkennen, einen Plan erstellen und Schritt für Schritt ausführen. Deshalb gilt der Test als Maßstab für echtes logisches Denken statt bloß auswendig gelerntes Wissen.
Opus 5 erreichte 30,2 Prozent auf diesem Benchmark. Das ist fast das Vierfache des bisherigen Rekords von GPT-5.6 Sol mit 7,8 Prozent. Zudem knackte das Modell fünf der 25 öffentlichen Demo-Umgebungen. Vier davon schaffte es auf menschlichem Niveau oder darüber. Auf der älteren ARC-AGI-2-Version kommt Opus 5 auf 90,4 Prozent, auf ARC-AGI-1 sogar auf 97,5 Prozent.
Neues Verhalten: Algebra aus dem Nichts
Besonders bemerkenswert ist, was Forscher während der Tests beobachteten. Opus 5 übersetzte Aufgaben spontan in algebraische Notation und formulierte eigenständig Reflexionsgleichungen. Dieses Verhalten hatten Prüfer bisher bei keinem Modell gesehen. Die ARC-Prize-Organisatoren führen den Vorsprung auf stärkeres logisches Denken zurück. Es ermögliche autonome Exploration, Planung und Ausführung in unbekannten Umgebungen.
Allerdings deuten unabhängige Tests auf einen differenzierteren Befund hin. Auf dem Witness-Benchmark erzielte Opus 5 43,4 Punkte und lag damit statistisch auf Augenhöhe mit Kimi K3 und Fable 5. Der Sprung gegenüber dem Vorgänger fiel dort deutlich kleiner aus als bei ARC-AGI-3. Entwickler Guanghan Ning schließt daraus, dass das Modell gezielt auf puzzleähnliche Aufgaben trainiert worden sein könnte. ARC Prize-Mitgründer Greg Kamradt hält dagegen: Ein einzelnes ungewöhnliches Spiel sei kein Beweis für enge Gewinne.
Halber Preis, gleiche Leistung
Jenseits der Benchmarks bietet Opus 5 ein aggressives Preis-Leistungs-Verhältnis. Bei 5 Dollar pro Million Eingabe-Token und 25 Dollar pro Million Ausgabe-Token kostet es genauso viel wie der Vorgänger Opus 4.8. Im Vergleich zu Fable 5 sinken die durchschnittlichen Task-Kosten um 54 Prozent. Auf der Artificial Analysis Intelligence Index führt Opus 5 mit 61 Punkten, knapp vor Fable 5 mit 60 und GPT-5.6 Sol mit 59.
Ein neuer Fast-Modus läuft 2,5-mal schneller, kostet aber das Doppelte. Entwickler erhalten zudem zwei neue API-Funktionen: Werkzeugwechsel mitten im Gespräch ohne Cache-Verlust und automatische Fallbacks. Diese leiten blockierte Anfragen an ein anderes Modell weiter statt sie abzulehnen.
Sicherheit und Verfügbarkeit
Anthropic bezeichnet Opus 5 als das bislang am besten ausgerichtete Modell. Die Rate irreführenden Verhaltens liegt bei 2,3 auf der internen Skala. Das ist der niedrigste Wert aller aktuellen Claude-Modelle. Sicherheitsfilter greifen rund 85 Prozent seltener ein als bei Fable 5. Cybersicherheitstraining wurde bewusst weggelassen. Dennoch verbessern sich diese Aufgaben durch die allgemein höhere Leistung. Ein neues Cyber-Verifikationsprogramm bietet eingeschränkten Zugriff für qualifizierte Nutzer.
Opus 5 ist ab sofort auf Claude.ai, der API, Amazon Bedrock, Google Cloud und Microsoft Foundry verfügbar. Es wird das Standardmodell für Claude Max und das stärkste Modell auf Claude Pro. Damit hat Anthropic innerhalb von acht Wochen vier Modelle veröffentlicht und deckt nun alle Preisklassen ab: vom Budget-Segment mit Sonnet 5 bis zum Premium-Flaggschiff Fable 5.