Claude Opus 5: Fast Frontier-Niveau zum halben Preis — und wo GPT trotzdem gewinnt

Claude Opus 5 bringt fast Fable-5-Intelligenz zum halben Preis. Wo es GPT-5.6 schlägt — und wo GPT gewinnt. Der ehrliche Benchmark-Check.

Anthropic hat seinem neuen Modell eine echte Falle gestellt. Die Aufgabe: Hier ist die 2D-Zeichnung eines Maschinenbauteils, schreib Code, der das Teil in FreeCAD als 3D-Modell nachbaut. FreeCAD, die kostenlose CAD-Software, kennen viele aus dem Konstruktionsalltag. Der Haken: Das Modell durfte die Zeichnung gar nicht sehen. Kein Bild-Input, keine Vision. Nur die nackte Aufgabe.

Und jetzt kommt der Teil, der hängen bleibt. Statt aufzugeben oder sich irgendwas zusammenzureimen, hat Opus 5 sich kurzerhand sein eigenes Werkzeug gebaut: ein Computer-Vision-Programm, von Grund auf selbst geschrieben. Code, der die rohen Pixel ausliest, die Kanten und Formen findet und die Geometrie aus einem Bild zieht, das es technisch gar nicht anschauen konnte. Danach hat es das komplette Bauteil in 3D rekonstruiert — und zwar nicht per Zufallstreffer, sondern wiederholt. Anthropic sagt, kein Konkurrenzmodell habe die Aufgabe in fünf Versuchen gelöst.

Das ist der eigentliche Punkt an Opus 5, mehr noch als jede einzelne Benchmark-Zahl: Wenn das Modell gegen eine Wand läuft, baut es sich sein eigenes Werkzeug, um drumherum zu kommen.

Was Claude Opus 5 eigentlich ist

Kurz die Fakten. Claude Opus 5 ist das neueste Modell von Anthropic (den Machern von Claude) und seit dem 24. Juli 2026 live: auf Claude.ai, über die Claude-API, in Claude Code und in Claude Cowork. Die Modell-ID lautet schlicht claude-opus-5.

Um zu verstehen, warum das interessant ist, muss man Anthropics Modell-Stufen kennen. Ganz oben thront Fable 5, das schlaueste und teuerste Frontier-Modell. Direkt darunter sitzt die Opus-Reihe, das Arbeitstier für den ganzen Tag. Der Clou an Opus 5: Es holt sich einen großen Teil der Fable-5-Intelligenz, und das zu einem Bruchteil der Kosten. Ein Cursor-Gründer hat es so formuliert: „Fast Fable-5-Intelligenz zu Opus-Tempo und Opus-Preis." t3n bringt es in der Überschrift trocken auf den Punkt: „So gut wie Fable 5, aber nur halb so teuer".

Beim Preis lohnt sich der genaue Blick, gerade wenn im Mittelstand jemand die Cloud-Rechnung im Auge behält. Opus 5 kostet 5 US-Dollar pro Million Input-Token und 25 US-Dollar pro Million Output-Token, exakt gleich viel wie der Vorgänger Opus 4.8. Der „halbe Preis" bezieht sich also auf das Frontier-Niveau (Fable 5), nicht darauf, dass Opus 5 billiger als 4.8 wäre. Pro Token zahlst du dasselbe wie vorher, bekommst aber deutlich mehr Modell fürs Geld. (Ein Token ist ungefähr ein Dreiviertel-Wort, eine Million Token sind rund 750.000 Wörter.)

Zwei Sachen kommen mit dem Launch dazu, und das sind genau diese zwei, nicht irgendwelche anderen. Erstens kannst du einem Modell die Werkzeuge jetzt mitten im Gespräch austauschen, ohne neu zu starten. Zweitens kann die API bei einem fehlgeschlagenen Opus-5-Request automatisch auf das ältere Opus 4.8 zurückfallen — ein Sicherheitsnetz für Apps, die im Live-Betrieb laufen. Auf Claude Max ist Opus 5 ab sofort der Standard, auf Claude Pro das stärkste Modell, das du auswählen kannst.

Anthropics offizielle Claude-Opus-5-Ankündigung vom 24. Juli 2026: Opus 5 wird neuer Standard auf Claude Max und stärkstes Modell auf Claude Pro
Claude Opus 5 Ankündigung
Anthropics Launch-Seite, 24. Juli 2026: Opus 5 ist der neue Standard auf Claude Max und das stärkste Modell auf Claude Pro. Quelle: Anthropic.

Warum „neuartige Probleme" zählen

Die FreeCAD-Geschichte ist kein Gimmick, sie zeigt genau das, worauf es bei echter Arbeit ankommt. Die meisten Aufgaben im Alltag sind nämlich der Fall, den vorher niemand aufgeschrieben hat: die Ausnahme, das kaputte Dateiformat, der Kunde, der sich einfach nicht ans Schema hält.

Genau da liegt Opus 5 vorn. Auf ARC-AGI-3, einem Test für Problemlösen ohne auswendig gelernte Muster, kommt es auf rund das Dreifache des nächstbesten Modells. Kein Trick mit Trainingsdaten, die man schon mal gesehen hat, sondern die Fähigkeit, sich einen Weg durch etwas Ungewohntes zu bahnen. Das ist der Muskel, der zählt, wenn dein konkretes Problem eben nicht im Handbuch steht.

Die Benchmarks — ehrlich betrachtet

Jetzt zu den Zahlen. Wichtig vorweg, und das kann man kaum oft genug sagen: Das sind Anthropics eigene Messungen, Opus 5 gegen GPT-5.6 „Sol". Selbst gemessen, nicht von einer unabhängigen Stelle geprüft. Trotzdem lohnt der Blick, weil das Muster verräterisch ist.

Anthropics offizielle Benchmark-Tabelle: Claude Opus 5 vs GPT-5.6 Sol in acht Tests, Opus 5 führt bei den meisten, aber nicht bei allen
Claude Opus 5 vs GPT-5.6 Sol
Anthropics offizieller Vergleich, GPT-5.6 Sol in der rechten Spalte: Opus 5 führt bei den meisten Tests, aber eben nicht bei allen. Quelle: Anthropic.

Bei den meisten von Anthropic gewählten Tests führt Opus 5:

  • Frontier-Bench (agentisches Coding im Terminal): 43,3 % gegen 34,4 %
  • GDPval-AA (Wissensarbeit): 1.861 gegen 1.736
  • ARC-AGI-3 (neuartige Probleme): 30,2 % gegen 7,8 %
  • OSWorld 2.0 (Computernutzung): 70,6 % gegen 62,6 %
  • AutomationBench (Geschäftsabläufe): 26,0 % gegen 18,1 %
  • BrowseComp (Websuche): quasi gleichauf, 90,8 % gegen 90,4 %

Sieht nach einem klaren Sieg aus. Ist es aber nicht — und hier wird’s ehrlich. Bei DeepSWE, dem praxisnahen Coding-Test, gewinnt GPT-5.6 Sol: 72,7 % gegen 68,8 %. Und das schlägt nicht nur Opus 5, sondern sogar Fable 5. Also ausgerechnet dort, wo viele Entwickler tatsächlich arbeiten, liegt GPT vorn. Bei HealthBench (professionelle Gesundheitsfragen) ist es knapp: 60,5 % für GPT gegen 59,8 % für Opus — ein Wimpernschlag, aber eben zugunsten von GPT.

Zwei Vorbehalte gehören dazu, und die sind kein Kleingedrucktes.

Erstens hat Anthropic sowohl die Tests als auch den Gegner selbst ausgesucht. Jedes Labor stellt sich ins beste Licht — das ist kein Betrug, sondern genau der Grund, warum man auf die Unabhängigen wartet.

Zweitens: Die unabhängigen Prüfer haben Opus 5 noch gar nicht bewertet. Auf dem Intelligenz-Index von Artificial Analysis (gehört keinem der beiden Konzerne) steht aktuell: Fable 5 = 60, GPT-5.6 Sol = 59, Opus 4.8 = 56. Opus 5 fehlt dort noch. Sobald es dort landet, glaub dieser Zahl mehr als jedem Launch-Chart. Und die großen deutschen Fachredaktionen wie heise oder Golem haben ihre eigenen Tests zum Start ebenfalls noch nicht draußen. Kurz abwarten lohnt sich also.

Und der Post, der gerade rumgeht, Opus 5 schlage GPT bei SWE-Bench Pro? Unbestätigtes Gerücht. Anthropics Tabelle nutzt SWE-Bench Pro überhaupt nicht. Und beim Coding-Test, den sie zeigt (DeepSWE), gewinnt GPT. Also: mit Vorsicht genießen.

Zur Einordnung nach oben macht Opus 5 gegen die eigenen Geschwister ebenfalls Boden gut. Auf CursorBench 3.2 kommt es bis auf 0,5 % an Fable 5 heran — beim halben Preis. Das ist die eine Zahl, die die ganze These trägt: fast Frontier, ohne den Frontier-Preis.

Was es (noch) nicht kann — und die offenen Fragen

Damit hier keine Euphorie aufkommt, die das Modell nicht einlöst: Opus 5 ist nicht Anthropics stärkstes Modell. Das bleibt Fable 5. Für Läufe, die stundenlang autonom vor sich hin arbeiten, verweist Anthropic weiterhin auf Fable 5. Opus 5 ist die Preis-Leistungs-Wahl, nicht die Speerspitze.

Interessant ist der eine Bereich, in dem Opus 5 mit Absicht schwächer ist: Cybersecurity. Beim Finden von Software-Schwachstellen ist es etwa so gut wie ein spezialisiertes Modell namens Mythos 5. Beim Bauen eines Exploits, um diese Lücken auch auszunutzen, liegt es dagegen weit dahinter — und zwar bewusst. Sprich: die offene Tür erkennen, ohne besonders gut darin zu sein, sie einzutreten. Das ist ausbalanciert, nicht vergessen.

Offen ist außerdem das Kontextfenster. Die breitere Opus-Reihe läuft seit Monaten mit 1 Million Token (rund 750.000 Wörter), und frühe Berichte gehen davon aus, dass Opus 5 das behält. Nur: Anthropics eigene Doku nennt Opus 5 an genau dieser Stelle noch nicht. Also: 1 Million ist wahrscheinlich, aber offiziell unbestätigt. Und wie gesagt, die Benchmarks sind selbst gemessen: eine Richtung, kein Evangelium.

Was das konkret für dich heißt

Kommt drauf an, was du machst.

Du zahlst schon für Pro oder Max? Dann bist du längst umgestellt, ganz ohne Klick. Trau dem Ding ruhig die schwereren Sachen zu: den verworrenen Report, die Tabelle, bei der du selbst den Faden verloren hast, statt es in Mini-Schritten an die Hand zu nehmen.

Du schreibst, planst oder analysierst beruflich? Dann ist Opus 5 ein starker Daily-Driver zu einem Preis, der die Finanzabteilung nicht in Schnappatmung versetzt. Gerade bei den echt schrägen, vorlagenfreien Aufgaben spielt es seine Stärke aus.

Du programmierst oder baust Automatisierungen? Das sind die lauten Zahlen: Coding und Agenten, fast Frontier-Niveau zum halben Preis, dazu der Werkzeug-Tausch mitten im Gespräch. Aber teste es an deinem eigenen Code, nicht am Marketing-Chart. Und behalt den Token-Verbrauch im Auge. Ein Modell, das pro Token billiger ist, kann am Ende teurer werden, wenn es einfach länger nachdenkt.

Du überlegst, Claude oder ChatGPT? Wechsle nicht wegen des Benchmarks dieser Woche. Such nach dem, was zu dir passt: Oberfläche, Schreibstil, die Tools, in denen du eh schon steckst. Die beiden liegen nah genug beieinander, dass der Fit mehr zählt als zwei Punkte im Ranking. Wenn du das systematisch angehen willst, hilft der Kurs ChatGPT-Alternativen im Vergleich beim Sortieren.

Fazit

Opus 5 ist nicht das schlaueste Modell da draußen — und Anthropic behauptet das auch gar nicht. Was es kann: Frontier-Nähe auf ein Arbeitstier-Preisniveau ziehen. Und es hat gezeigt, dass es sich, wenn nötig, selbst ein Werkzeug baut, um ein Problem zu knacken.

Die eigentliche Lektion steckt aber woanders. Egal, welches Labor diesen Monat vorn liegt — das Nützlichste, was du tun kannst, ist, gut genug mit den Tools zu werden, die du schon hast, um ein neues an echter Arbeit zu beurteilen. Schnell, an deinem eigenen Fall. Wenn du da bei null anfängst, sind die KI-Grundlagen ein guter Startpunkt.

Quellen: Anthropic: Introducing Claude Opus 5 · t3n: „So gut wie Fable 5, aber nur halb so teuer" · CNBC zu Opus 5 und den Kosten

Echte KI-Skills aufbauen

Schritt-für-Schritt-Kurse mit Quizzes und Zertifikaten für den Lebenslauf