KI
Claude Opus 5.5 ist da: Benchmarks, Preise und der Vergleich mit Fable und GPT-6

Anthropic hat am 22. September 2026 Claude Opus 5.5 veröffentlicht, das erste Modell der Claude-5.5-Familie. Es arbeitet laut Anthropic bei den meisten Aufgaben auf dem Niveau von Claude Fable 5.1, kostet im Betrieb rund 40 Prozent weniger als Opus 5 und schreibt über 30 Prozent schneller. Über die API kostet es 4 Dollar je 1 Million Eingabe-Tokens und 20 Dollar je 1 Million Ausgabe-Tokens, in der Claude-App ist es ab dem Pro-Abo enthalten. Im unabhängigen Intelligence Index von Artificial Analysis führt Opus 5.5 mit 58 Punkten vor Fable 5.1 und GPT-6 Astra (je 53). OpenAIs am selben Tag erschienenes GPT-6 Sol ist je Token halb so teuer, liegt im Index aber bei 48 Punkten.
Claude Opus 5.5 ist da: Was hat Anthropic veröffentlicht?
Anthropic hat am 22. September 2026 Claude Opus 5.5 veröffentlicht, das erste Modell der neuen Claude-5.5-Familie. Die Kernaussage der Ankündigung passt in einen Satz: Opus 5.5 arbeitet bei den meisten Aufgaben auf dem Niveau von Claude Fable 5.1 und kostet im Betrieb rund 40 Prozent weniger als Opus 5. Es ist ab sofort auf allen Plattformen verfügbar, also in der Claude-App, in Claude Code, über die API sowie bei Amazon Web Services, Google Cloud und Microsoft Azure.
Die Zahlen in Kurzform: 66,4 Prozent im Coding-Test Terminal-Bench 4.0 (Fable 5.1: 55,8), Platz 1 im unabhängigen Intelligence Index von Artificial Analysis und ein API-Preis von 4 Dollar je 1 Million Eingabe-Tokens und 20 Dollar je 1 Million Ausgabe-Tokens. Das Lesen aus dem Cache, das bei Agenten und beim Programmieren den Großteil der Kosten ausmacht, fällt von 0,50 auf 0,20 Dollar.
Und die zweite Nachricht des Tages: Nur Minuten später hat OpenAI GPT-6 Sol und GPT-6 Luna vorgestellt und die Preise dieser Klasse halbiert. Deshalb vergleiche ich in diesem Beitrag nicht nur mit Anthropics eigenen Modellen, sondern auch mit GPT-6 Sol und GPT-6 Astra, und zwar mit den Daten aus den Anbieter-Dokumentationen, von Artificial Analysis und aus der LM Arena.
Was kann Claude Opus 5.5? Die Benchmarks im Überblick
Anthropic hat zum Start eine Vergleichstabelle mit neun Tests veröffentlicht. Ich habe sie unten 1:1 übernommen und die Spalten gegen die Originalseite geprüft. Opus 5.5 führt in sieben von neun Zeilen, zwei gehen an GPT-6 Astra.
Claude Opus 5.5 im Benchmark-Vergleich (höher = besser)
| Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol | |
|---|---|---|---|---|---|
| Agentisches CodingTerminal-Bench 4.0 | 66,4 % | 55,8 % | 52,3 % | 57,9 % | 37,3 % |
| Agentisches CodingFrontierCode v1.1 (Main) | 54,4 % | 50,3 % | 48,0 % | 53,3 % | 47,5 % |
| Agentisches CodingCursorBench 4.0 | 57,8 % | 51,8 % | 46,6 % | - | 41,7 % |
| WissensarbeitGDPval-AA v2.1, Elo | 1846 | 1735 | 1708 | 1542 | 1588 |
| Büro-Workflows automatisierenAutomationBench | 40,0 % | 31,4 % | 26,9 % | 41,4 % | 28,8 % |
| Fachübergreifendes DenkenHumanity's Last Exam, mit Werkzeugen | 67,7 % | 65,6 % | 63,6 % | 57,2 % | - |
| Wissenschaftliches Arbeiten im TerminalTerminal-Bench-Science 0.1 | 58,7 % | 52,6 % | 29,0 % | 64,6 % | 22,4 % |
| Computer bedienenOSWorld 2.0, Teilwertung | 81,8 % | 80,7 % | 74,0 % | - | - |
| Diagramme lesenChartography, mit Werkzeugen | 89,0 % | 88,4 % | 83,4 % | - | - |
Quelle: Anthropic, Vergleichstabelle zur Ankündigung von Claude Opus 5.5, Stand 22. September 2026. Lachsfarben hinterlegt = Bestwert der Zeile, umrandet = Opus 5.5. Opus 5.5 lief mit adaptivem Denken auf der Stufe max, beim Terminal-Bench 4.0 auf xhigh. Griffen die Schutzfilter ein, hat Anthropic die Aufgabe mit Opus 4.8 oder Opus 5 zu Ende führen lassen, was die Werte von Opus 5.5 laut Anthropic eher drückt. Die Werte von GPT-6 Astra und GPT-5.6 Sol stammen aus OpenAIs Angaben bzw. aus Zapiers öffentlichem Leaderboard. Leere Zellen: kein Wert angegeben.
Drei Punkte fallen auf. Erstens der Abstand beim agentischen Coding: Im Terminal-Bench 4.0 liegt Opus 5.5 gut zehn Punkte vor Fable 5.1 und achteinhalb vor GPT-6 Astra. Zweitens die Wissensarbeit: Im GDPval-AA, einem Test mit echten Aufgaben aus 44 Berufen, kommt Opus 5.5 auf 1.846 Elo-Punkte, Fable 5.1 auf 1.735 und Astra auf 1.542. Drittens das Bedienen eines Computers: 81,8 Prozent im OSWorld 2.0 gegen 74,0 Prozent beim Vorgänger.
Wo Opus 5.5 nicht führt: Beim Automatisieren von Büro-Workflows liegt GPT-6 Astra mit 41,4 knapp vor Opus 5.5 mit 40,0 Prozent, und beim wissenschaftlichen Arbeiten im Terminal deutlich mit 64,6 zu 58,7 Prozent. Zum ersten Wert gehört eine Einschränkung aus der Fußnote: Zapier hat Opus 5.5 ohne Ersatzmodell getestet, jeder Eingriff der Schutzfilter zählte als Fehlschlag.
Ehrlich dazugesagt: Anthropic schreibt selbst, dass Benchmark-Abstände auf diesem Niveau immer weniger über die Praxis aussagen und der Unterschied zu Fable 5.1 im eigenen Einsatz kleiner sei, als die Zahlen vermuten lassen. Und ein Detail für Genaue: Für GPT-6 Astra nennt Anthropic im Terminal-Bench 4.0 57,9 Prozent, OpenAI selbst hatte zum Start 57,7 Prozent angegeben. Für GPT-5.6 Sol steht bei AutomationBench hier 28,8 Prozent aus Zapiers Leaderboard, OpenAI hatte 18,1 Prozent genannt. Die Messaufbauten unterscheiden sich, ich übernehme die Werte so, wie Anthropic sie veröffentlicht.
Was die Tester konkret berichten
- Große Migrationen: Ein Tester hat eine Code-Migration über 680.000 Zeilen in weniger als einem Tag abgeschlossen. Ein anderer hat eine Codebasis mit 200.000 Zeilen in unter drei Stunden geprüft und repariert, Opus 5 brauchte dafür über 20 Stunden und das 2,5-Fache an Tokens.
- Ladezeiten: Bei der Aufgabe, die Ladezeiten aller Seiten einer Web-App zu senken, war Opus 5.5 in 39 von 40 Durchläufen erfolgreich. Opus 5 schaffte kleinere Verbesserungen und veränderte dabei das Verhalten der App.
- C nach Rust: Opus 5.5 und Fable 5.1 sollten die Lastverteilungs-Software HAProxy von C nach Rust übersetzen. Beide bestanden fast alle Regressionstests, Opus 5.5 war nach 9,5 statt 12 Stunden fertig und 51 Prozent günstiger.
- Recherche ohne Erfindungen: Bei einem Quartalsbericht, dessen Zahlen und Zitate automatisch gegen die Quellen geprüft wurden, kamen 16 von 18 Berichten von Opus 5.5 durch. Fable 5.1 und Opus 5 schafften es in keinem Versuch, weil jede erfundene Zahl zum Ausschluss führte.
- Code-Reviews: Laut Deloitte fand Opus 5.5 schon auf der niedrigsten Denk-Stufe 72 Prozent der bekannten Fehler, Opus 5 auf hoher Stufe 56 Prozent.
Opus 5.5 oder Fable 5.1: Welches Claude-Modell solltest du nehmen?
Die kürzeste Antwort steht in Anthropics eigener Dokumentation: Wer unsicher ist, soll mit Claude Opus 5.5 anfangen. Fable 5.1 empfiehlt Anthropic nur noch für besonders anspruchsvolles Denken, sehr lange eigenständige Aufgaben oder wenn Opus 5.5 auch auf höherer Denk-Stufe nicht reicht. So klar hat Anthropic das beim Vorgänger nicht formuliert.
| Claude Fable 5.1 | Claude Opus 5.5 | Claude Sonnet 5 | Claude Haiku 4.5 | |
|---|---|---|---|---|
| Gedacht für | Anspruchsvolles Denken, sehr lange Agenten-Aufgaben | Lange Coding- und Wissensarbeit | Tempo und Intelligenz | Höchstes Tempo |
| Preis je 1 Mio. Tokens | 10 $ / 50 $ | 4 $ / 20 $ | 2 $ / 10 $ | 1 $ / 5 $ |
| Geschwindigkeit | Langsamer | Mittel | Schnell | Am schnellsten |
| Denken | Adaptiv, immer an | Adaptiv, immer an | Adaptiv | Erweitert |
| Standard-Denkstufe | high | medium | high | keine |
| Kontextfenster | 1 Mio. Tokens | 1 Mio. Tokens | 1 Mio. Tokens | 200.000 Tokens |
| Max. Ausgabe | 128.000 Tokens | 128.000 Tokens | 128.000 Tokens | 64.000 Tokens |
| Wissensstand | Juni 2026 | Juni 2026 | Januar 2026 | Februar 2025 |
Meine Einordnung: Für Programmieren, Recherche, Texte und Analysen ist Opus 5.5 ab heute die Standardwahl. Fable 5.1 lohnt sich, wenn eine Aufgabe über viele Stunden allein laufen soll oder Opus 5.5 an einer schweren Denkaufgabe scheitert. Dafür zahlst du den zweieinhalbfachen Token-Preis und wartest länger. Sonnet 5.5 und Haiku 5.5 sind für die kommenden Wochen angekündigt, bis dahin bleiben Sonnet 5 und Haiku 4.5 die günstigen Alternativen.
Claude Opus 5.5 gegen GPT-6 Sol und Astra: Wer liegt vorn?
OpenAI hat GPT-6 Sol und Luna am selben Tag veröffentlicht und die Preise dieser Klasse gegenüber den Aktionspreisen von GPT-5.6 halbiert. Damit gibt es jetzt drei direkte Duelle: Opus 5.5 gegen GPT-6 Sol im Preis, Opus 5.5 gegen GPT-6 Astra in der Leistung und Fable 5.1 gegen Astra an der Spitze.
| Modell | Eingabe je 1 Mio. Tokens | Ausgabe je 1 Mio. Tokens | Cache lesen | Kontextfenster |
|---|---|---|---|---|
| Claude Opus 5.5 | 4,00 $ | 20,00 $ | 0,20 $ | 1 Mio. Tokens |
| Claude Fable 5.1 | 10,00 $ | 50,00 $ | 0,25 $ | 1 Mio. Tokens |
| Claude Sonnet 5 | 2,00 $ | 10,00 $ | 0,20 $ | 1 Mio. Tokens |
| GPT-6 Astra | 10,00 $ | 50,00 $ | 1,00 $ | 1,05 Mio. Tokens |
| GPT-6 Sol | 2,00 $ | 10,00 $ | 0,20 $ | 1,05 Mio. Tokens |
| GPT-6 Luna | 0,10 $ | 0,50 $ | 0,01 $ | 1,05 Mio. Tokens |
Opus 5.5 gegen GPT-6 Sol: Sol kostet je Token genau die Hälfte. OpenAI rechnet vor, dass Sol auf der Stufe xhigh im AutomationBench 33,2 Prozent für 0,27 Dollar je Aufgabe erreicht und damit Claude Opus 5 auf der höchsten Stufe schlägt, bei 9 Prozent der Kosten. OpenAI vergleicht dabei mit Opus 5, nicht mit dem am selben Tag erschienenen Opus 5.5, das in Anthropics Tabelle auf 40,0 Prozent kommt. Beim Programmieren nennt OpenAI für Sol 68,8 Prozent im DeepSWE v1.1, gut einen Punkt hinter dem besten Wert von Fable 5. Einen direkten Vergleich mit Opus 5.5 hat OpenAI nicht veröffentlicht.
Opus 5.5 gegen GPT-6 Astra: Hier ist die Lage klarer. Laut Anthropic schlägt Opus 5.5 auf der Standardstufe im FrontierCode GPT-6 Astra bei rund 20 Prozent der Kosten je Aufgabe, im Terminal-Bench 4.0 zieht es bei rund 40 Prozent der Kosten gleich, und im GDPval-AA schlägt Opus 5.5 auf der Stufe medium Astra auf der Stufe max für etwa ein Fünftel der Kosten. Das sind Anthropics Zahlen, aber sie decken sich mit dem, was Artificial Analysis unabhängig misst (nächster Abschnitt).
Für deutsche Nutzer wichtig: GPT-6 Sol und Luna laufen in ChatGPT zunächst nur in ChatGPT Work und Codex für Plus, Pro, Business, Enterprise und Edu, im normalen Chat sind sie noch nicht verfügbar. Luna bekommen auch Free und Go, aber nur in der Desktop-App. Opus 5.5 steht dagegen in der Claude-App ab dem Pro-Abo direkt im Modellmenü.
Welches KI-Modell ist gerade das beste? Der unabhängige Index
Herstellerzahlen sind das eine. Artificial Analysis misst alle großen Modelle mit denselben zehn Tests und veröffentlicht dazu, was eine Aufgabe tatsächlich kostet. Opus 5.5 ist dort bereits gelistet, und das Ergebnis ist eindeutig:
Artificial Analysis Intelligence Index v4.3.2
- Claude Opus 5.5Stufe max · 5,98 $ je Aufgabe58Platz 1 im Gesamtindex, fünf Punkte vor Fable 5.1 und GPT-6 Astra.
- Claude Fable 5.1Stufe max · 7,63 $ je Aufgabe53Anthropics teureres Topmodell, hier gleichauf mit GPT-6 Astra.
- GPT-6 AstraStufe max · 3,26 $ je Aufgabe53OpenAIs Spitzenmodell vom 3. September 2026.
- GPT-6 SolStufe max · 1,06 $ je Aufgabe48Seit 22. September 2026, OpenAIs günstigere Alltagsklasse.
- Grok 4.7Stufe xhigh · 3,74 $ je Aufgabe46Das Spitzenmodell von xAI.
- Kimi K3Stufe max · 2,00 $ je Aufgabe44Das Spitzenmodell von Moonshot AI.
- Gemini 3.8 FlashStufe high · 1,24 $ je Aufgabe41Googles schnelles Modell, mit Abstand das schnellste im Feld.
- Claude Sonnet 5Stufe max · 5,09 $ je Aufgabe38Anthropics Mittelklasse, der Nachfolger Sonnet 5.5 ist angekündigt.
- GPT-6 LunaStufe max · 0,07 $ je Aufgabe37OpenAIs günstigstes Modell, 7 Cent je Aufgabe.
Unabhängiger Gesamtindex von Artificial Analysis (Version 4.3.2, zehn Einzeltests, darunter GDPval-AA v2.1, Terminal-Bench 4.0, Humanity's Last Exam und AA-Omniscience), abgerufen am 23. September 2026. Je Modell die stärkste Denk-Stufe. Höher ist besser. Die Version 4.3.2 ist neu skaliert, die Punkte sind nicht mit älteren Index-Versionen vergleichbar.
Opus 5.5 führt mit 58 Punkten vor Fable 5.1 und GPT-6 Astra (je 53). Das ist bemerkenswert, weil Anthropic in der eigenen Ankündigung eher zurückhaltend formuliert. Die Rangliste allein reicht aber nicht, denn die stärkste Denk-Stufe ist auch die teuerste. Deshalb habe ich die Grafik nachgebaut, mit der Artificial Analysis Leistung und Kosten gegeneinander aufträgt:
Intelligenz gegen Kosten je Aufgabe
- Anthropic
- OpenAI
- xAI
- Moonshot
Alle Werte als Tabelle
| Modell | Intelligence Index | Kosten je Index-Aufgabe (log) |
|---|---|---|
| Claude Opus 5.5 (max) | 58 | 5,98 $ |
| Claude Opus 5.5 (xhigh) | 56 | 3,46 $ |
| Claude Opus 5.5 (high) | 54 | 1,82 $ |
| GPT-6 Astra (max) | 53 | 3,26 $ |
| Claude Fable 5.1 (xhigh) | 53 | 5,98 $ |
| Claude Fable 5.1 (max) | 53 | 7,63 $ |
| GPT-6 Astra (xhigh) | 52 | 2,31 $ |
| Claude Opus 5.5 (medium) | 51 | 1,34 $ |
| GPT-6 Astra (high) | 51 | 1,73 $ |
| Claude Fable 5.1 (high) | 51 | 3,91 $ |
| GPT-6 Astra (medium) | 50 | 1,54 $ |
| GPT-6 Sol (max) | 48 | 1,06 $ |
| Grok 4.7 (xhigh) | 46 | 3,74 $ |
| GPT-6 Sol (xhigh) | 44 | 0,53 $ |
| Kimi K3 (max) | 44 | 2,00 $ |
| GPT-6 Sol (high) | 43 | 0,37 $ |
| Claude Opus 5.5 (low) | 42 | 0,55 $ |
| Gemini 3.8 Flash (high) | 41 | 1,24 $ |
Quelle: Artificial Analysis, Intelligence Index v4.3.2 und Spalte Kosten je Aufgabe, abgerufen am 23. September 2026. Die Linien verbinden die Denk-Stufen eines Modells (low bis max). x-Achse logarithmisch. Oben links ist besser: mehr Leistung für weniger Geld.
Was die Grafik zeigt:
- Opus 5.5 auf Stufe high schlägt GPT-6 Astra auf Stufe max. 54 gegen 53 Punkte, bei 1,82 gegen 3,26 Dollar je Aufgabe. Also mehr Leistung für gut die Hälfte des Geldes.
- Opus 5.5 auf Stufe medium schlägt GPT-6 Sol auf Stufe max. 51 gegen 48 Punkte, bei 1,34 gegen 1,06 Dollar. Sol ist etwas günstiger, Opus 5.5 spürbar besser.
- Im Billigsegment gewinnt OpenAI. Unterhalb von etwa einem Dollar je Aufgabe liefert GPT-6 Sol mehr Punkte als Opus 5.5 auf Stufe low (44 gegen 42 bei gleichen Kosten). Wer sehr viele einfache Aufgaben hat, ist mit Sol oder Luna günstiger unterwegs.
- Die Stufe max ist teuer. Von xhigh auf max steigen die Kosten bei Opus 5.5 um 73 Prozent, der Index nur um zwei Punkte. Für die meisten Aufgaben reicht high oder xhigh.
Einschränkung: Artificial Analysis misst Opus 5.5 mit Ersatzmodell, also so, wie es im echten Betrieb läuft. Greifen die Schutzfilter, übernimmt ein älteres Modell. Opus 5 taucht in der neuen Index-Version 4.3.2 nicht mehr auf, und die Punkte sind nicht mit den Werten vergleichbar, die ich in früheren Beiträgen genannt habe, weil der Index neu skaliert wurde.
Was sagt die LM Arena zu Claude Opus 5.5?
Die LM Arena (inzwischen unter arena.ai) funktioniert anders als Benchmarks: Nutzer bekommen zwei anonyme Antworten und wählen die bessere, daraus entsteht eine Elo-Rangliste. Das misst, was Menschen tatsächlich besser finden. Opus 5.5 ist dort am 23. September noch nicht gelistet, neue Modelle brauchen erst einige tausend Stimmen. Die Ranglisten zeigen aber, gegen wen Opus 5.5 antreten muss. Ich habe die drei relevanten Tabellen nachgebaut.
LM Arena WebDev: Websites und Web-Apps bauen
- GPT-6 Astra (max)Platz 1 · ±12 · 4.230 Stimmen1.793Führt das WebDev-Ranking seit dem Start klar an.
- Claude Fable 5.1 (max)Platz 2 · ±11 · 4.887 Stimmen1.755Bestes Claude-Modell im Web-Ranking.
- Claude Opus 5 (max)Platz 3 · ±7 · 14.251 Stimmen1.691Der direkte Vorgänger von Opus 5.5.
- Kimi K3 (max)Platz 7 · ±7 · 13.140 Stimmen1.658Das Spitzenmodell von Moonshot AI.
- Grok 4.7 (xhigh)Platz 10 · ±17 · 1.425 Stimmen1.632Das Spitzenmodell von xAI.
- GPT-5.6 Sol (xhigh, Codex)Platz 15 · ±6 · 14.266 Stimmen1.617OpenAIs Vorgänger aus dem Juli.
- Gemini 3.8 Flash (high)Platz 22 · ±9 · 6.558 Stimmen1.583Googles schnelles Modell, Wert noch vorläufig.
- Claude Sonnet 5 (high)Platz 31 · ±7 · 11.511 Stimmen1.538Anthropics Mittelklasse.
Quelle: arena.ai, Leaderboard Code Arena / WebDev, Stand 22. September 2026, 735.398 Stimmen. Elo-Werte aus Blindvergleichen echter Nutzer, höher ist besser. Die Balken beginnen bei 1.500 Punkten, damit die Abstände sichtbar werden. Auswahl der großen Anbieter, die Platzierung steht in der Detailzeile. Claude Opus 5.5 ist noch nicht gelistet.
Beim Bauen von Websites und Web-Apps führt GPT-6 Astra mit deutlichem Abstand. Das deckt sich nicht mit Anthropics Coding-Zahlen und zeigt den Unterschied der Messmethoden: Die WebDev-Arena bewertet, welches Ergebnis Nutzern besser gefällt, also auch Optik und Gestaltung. Anthropic berichtet, dass Opus 5.5 bei einem Spiel aus einem einzigen Prompt wegen Grafik und Feinschliff vor allen anderen Claude-Modellen lag. Ob das gegen Astra reicht, zeigt die Arena in den nächsten Wochen.
LM Arena Text: Gesamtwertung
- Claude Fable 5 (high)Platz 1 · ±5 · 30.057 Stimmen1.506Das ältere Fable 5 steht weiter an der Spitze.
- Claude Fable 5.1 (max)Platz 5 · ±8 · 5.783 Stimmen1.498Noch wenige Stimmen, der Wert kann sich bewegen.
- Gemini 3.8 Flash (high)Platz 9 · ±9 · 5.076 Stimmen1.493Bestes Google-Modell, Wert vorläufig.
- Claude Opus 5 (high)Platz 10 · ±4 · 42.617 Stimmen1.493Der Vorgänger von Opus 5.5.
- Kimi K3 (max)Platz 17 · ±5 · 20.987 Stimmen1.485Das Spitzenmodell von Moonshot AI.
- GPT-5.6 Sol (xhigh)Platz 18 · ±5 · 27.069 Stimmen1.483OpenAIs Vorgänger aus dem Juli.
- GPT-6 Astra (max)Platz 24 · ±12 · 2.693 Stimmen1.480Im reinen Chat überraschend weit hinten, bei nur 2.693 Stimmen.
- Grok 4.20 beta1Platz 30 · ±5 · 26.599 Stimmen1.475Das bestplatzierte Grok-Modell im Text-Ranking.
Quelle: arena.ai, Text Arena Overall, Stand 13. September 2026, 8.146.274 Stimmen über 402 Modelle. Die Balken beginnen bei 1.450 Punkten. Die Abstände an der Spitze liegen innerhalb der Fehlerbalken, die Plätze 1 bis 10 sind statistisch kaum zu trennen.
Im reinen Text-Chat liegen die Claude-Modelle traditionell vorn, allerdings mit Abständen innerhalb der Fehlerbalken. Auffällig ist GPT-6 Astra auf Platz 24, bei allerdings erst 2.693 Stimmen.
LM Arena Agent: Net Improvement in Prozent
- Claude Fable 5.1 (max)Platz 1 · 4,35 $ je Aufgabe13,71Führt bei Agenten-Aufgaben, ist aber auch am teuersten.
- GPT-6 Astra (max)Platz 2 · 2,90 $ je Aufgabe11,54Knapp dahinter, deutlich günstiger je Aufgabe.
- Claude Opus 5 (high)Platz 3 · 2,24 $ je Aufgabe10,25Der Vorgänger von Opus 5.5.
- Claude Fable 5 (high)Platz 5 · 1,80 $ je Aufgabe8,81Das ältere Fable-Modell.
- GPT-5.6 Sol (xhigh)Platz 7 · 0,95 $ je Aufgabe7,1OpenAIs Vorgänger aus dem Juli.
- Kimi K3 (max)Platz 8 · 0,73 $ je Aufgabe6,22Mit Abstand die meisten Sitzungen im Feld.
- Claude Sonnet 5 (high)Platz 9 · 0,76 $ je Aufgabe5,97Anthropics Mittelklasse.
Quelle: arena.ai, Agent Arena Overall, Stand 15. September 2026, 1.850.083 Sitzungen über 46 Modelle. Arena fasst hier Signale aus echten Agenten-Sitzungen zusammen, darunter Werkzeug-Zuverlässigkeit, bestätigter Erfolg und Steuerbarkeit. Höher ist besser. In der Detailzeile die mittleren Kosten je Aufgabe.
Die noch junge Agent-Arena misst echte Agenten-Sitzungen statt einzelner Antworten. Hier führt Fable 5.1 vor Astra und Opus 5. Genau das ist der Bereich, für den Anthropic Opus 5.5 gebaut hat. Wenn es dort in den nächsten Wochen vor Fable 5.1 landet, bei rund der Hälfte der Kosten, wäre das die stärkste Bestätigung der Ankündigung.
Was kostet Claude Opus 5.5?
Über die API kostet Opus 5.5 4 Dollar je 1 Million Eingabe-Tokens und 20 Dollar je 1 Million Ausgabe-Tokens, 20 Prozent weniger als Opus 5. Die größere Ersparnis steckt im Cache:
| Preis je 1 Mio. Tokens | Claude Opus 5.5 | Claude Opus 5 | Ersparnis |
|---|---|---|---|
| Eingabe | 4,00 $ | 5,00 $ | 20 % |
| Ausgabe | 20,00 $ | 25,00 $ | 20 % |
| Cache lesen | 0,20 $ | 0,50 $ | 60 % |
| Cache schreiben (5 Minuten) | 5,00 $ | 6,25 $ | 20 % |
| Cache schreiben (1 Stunde) | 8,00 $ | - | - |
| Batch-API (Eingabe / Ausgabe) | 2,00 $ / 10,00 $ | 2,50 $ / 12,50 $ | 20 % |
| Fast mode (Eingabe / Ausgabe) | 8,00 $ / 40,00 $ | - | - |
- Warum der Cache so wichtig ist: Bei Agenten und beim Programmieren wird derselbe Kontext immer wieder gelesen. Anthropic nennt das Cache-Lesen den größten Kostenblock solcher Arbeit. Zusammen mit weniger verbrauchten Tokens je Aufgabe ergibt das die 40 Prozent Ersparnis gegenüber Opus 5 bei typischer Last.
- Neue Standardstufe medium: Wer keine Denk-Stufe angibt, bekommt bei Opus 5.5 medium statt high. Das senkt die Kosten automatisch, kann aber bei schweren Aufgaben die Qualität drücken. Anthropic rät, die Stufe bewusst zu setzen und neu zu testen.
- Fast mode: Bis zu 2,5-fache Geschwindigkeit zum doppelten Preis, als Forschungsvorschau nur über die Claude API, nicht bei AWS, Google Cloud oder Microsoft Foundry.
- Kein Aufschlag für lange Kontexte: Das volle Kontextfenster von 1 Million Tokens kostet den Standardpreis. Bei GPT-6 Sol und Astra werden Anfragen ab 272.000 Eingabe-Tokens doppelt so teuer bei der Eingabe und 1,5-mal so teuer bei der Ausgabe. Wer mit großen Codebasen oder langen Dokumenten arbeitet, sollte das einrechnen.
- Mindestlänge für den Cache: Prompts ab 512 Tokens lassen sich cachen. Über die Batch-API sind mit einem Beta-Header bis zu 300.000 Ausgabe-Tokens möglich.
Ist Opus 5.5 im Claude-Abo enthalten?
Ja, ab dem Pro-Abo ohne Aufpreis. Das ist ein Unterschied zu Fable 5.1, das Pro-Nutzer nur über zusätzliche Nutzungsguthaben bekommen. Anthropic hebt gleichzeitig die Fünf-Stunden-Limits an und schenkt allen Abonnenten ein Zurücksetzen des Nutzungslimits, das man aufheben und später einlösen kann.
| Plan | Preis im Monat | Claude Opus 5.5 | Claude Fable 5.1 |
|---|---|---|---|
| Free | 0 $ | nein | nein |
| Pro | 20 $ (17 $ bei Jahreszahlung) | ja, im Abo enthalten | nur über Nutzungsguthaben |
| Max 5x / Max 20x | ab 100 $ | ja | bis 50 % des Wochenlimits |
| Team | ab 20 $ je Platz (Jahreszahlung) | ja | bis 50 % des Wochenlimits, nur Premium-Plätze |
| Enterprise | nach Vereinbarung | ja | ja |
Die Preise sind die offiziellen US-Dollar-Preise von Anthropic, in Deutschland kommt die Umsatzsteuer dazu. Mit dem kostenlosen Konto bekommst du Sonnet und Haiku, aber kein Opus. Wer Opus 5.5 nur ausprobieren will, kommt am günstigsten über das Pro-Abo oder über die API mit eigenem Schlüssel.
Was ändert sich für Entwickler?
Vier Änderungen brechen bestehenden Code, der heute mit Opus 5 läuft. Die ersten drei gelten auch für Fable 5.1:
- Denken lässt sich nicht mehr abschalten. Anfragen mit thinking disabled oder einem festen Token-Budget liefern einen Fehler 400. Stattdessen steuert die Denk-Stufe (effort) Tiefe, Tempo und Kosten.
- Erzwungene Werkzeugnutzung entfällt. tool_choice mit any oder einem bestimmten Werkzeug liefert einen Fehler. Für verlässliches JSON empfiehlt Anthropic strict tool use oder Structured Outputs.
- Gedanken-Blöcke sind an Modell und Gespräch gebunden. Wechselt ein Gespräch von Opus 5.5 zu einem anderen Modell, gehen die bisherigen Gedankengänge verloren, außer beim Wechsel zu Fable 5.1 oder Mythos 5.1. Wer den System-Prompt mitten im Gespräch ändert, riskiert bei neuen Konten einen Fehler. Die Lösung sind Gespräche, an die nur angehängt wird.
- Das alte Computer-use-Werkzeug fällt weg. Über die Claude API und Google Cloud funktioniert nur noch das neue Toolset computer_toolset_20260801. Bei Amazon Bedrock läuft das alte Werkzeug weiter.
Eine stille Änderung kommt dazu: Die kurzen Zwischenmeldungen, die das Modell zwischen Werkzeugaufrufen schreibt, kommen jetzt als Gedanken-Blöcke statt als Text. Anwendungen, die diese Meldungen live anzeigen, werden dadurch still, ohne dass ein Fehler auftritt. Abhilfe schafft die passende display-Einstellung. Die Modell-ID lautet claude-opus-5-5, bei Amazon Bedrock anthropic.claude-opus-5-5. Anthropic sichert den Betrieb bis mindestens 22. September 2027 zu.
Wie sicher ist Claude Opus 5.5?
Anthropic nennt Opus 5.5 das bestbewertete Modell im eigenen automatisierten Verhaltens-Audit, das Claude in fast 2.000 Szenarien prüft. Es ist die erste Veröffentlichung nach dem Aufruf von CEO Dario Amodei, das Tempo an der KI-Spitze zu drosseln, und externe Prüfer wie METR haben das Modell vorab getestet.
- Weniger Grenzüberschreitungen: In einem neuen Test versuchte Opus 5.5 rund 85 Prozent seltener als Opus 5 oder Mythos 5.1, die ihm gesetzten Grenzen zu umgehen. Jeder Versuch war laut Anthropic geringfügig und wurde vom Modell selbst gemeldet.
- Prompt Injection: In einem Test der Sicherheitsfirma Gray Swan liegt Opus 5.5 gleichauf mit Fable 5.1 bei der niedrigsten Erfolgsquote für Angriffe. In allen getesteten Bereichen ist es mindestens so widerstandsfähig wie Opus 5.
- Schutzfilter wie bei Fable 5.1: Weil Opus 5.5 bei Biologie und Cybersicherheit auf dem Niveau von Claude Mythos 5.1 liegt, laufen die meisten Sicherheitsaufgaben automatisch über Opus 4.8. Fehler im eigenen Code finden und beheben bleibt erlaubt. Geprüfte Organisationen bekommen über zwei Verifizierungsprogramme mehr Spielraum, eines für Biowissenschaften, eines für Cybersicherheit mit drei Stufen bis hin zum Zugang zu Claude Mythos.
Die offene Flanke: Anthropic schreibt selbst, dass Opus 5.5 häufig vermutet, gerade getestet zu werden. Das macht es schwerer vorherzusagen, wie es sich im echten Einsatz verhält. Dieser Satz steht in der Ankündigung, und ich finde ihn wichtiger als jede Benchmark-Zeile.
Was bedeutet Opus 5.5 für Unternehmen in Deutschland?
- KI-Kennzeichnung: Opus 5.5 bringt wie Fable 5.1 ein Textwasserzeichen mit, das die Pflichten aus dem EU AI Act abdecken soll. Was du bei der Kennzeichnung selbst beachten musst, habe ich im Beitrag zu GPT Image 2.5 und den offiziellen EU-Symbolen zusammengefasst.
- Keine Datenspeicherung: Wie frühere Opus-Modelle ist Opus 5.5 mit Zero Data Retention verfügbar, also ohne Speicherung der Anfragen bei Anthropic.
- Keine EU-Verarbeitung über die Claude API: Die Claude API kennt als Verarbeitungsort nur global oder USA. Wer Daten in der EU verarbeiten lassen muss, geht über Amazon Bedrock oder Google Cloud und prüft dort, in welchen Regionen Opus 5.5 angeboten wird. Bei OpenAI gibt es EU-Datenresidenz für GPT-6 Sol und Luna, allerdings nur in der Standardverarbeitung.
Für die Datenschutz-Folgenabschätzung heißt das: Modellwahl und Verarbeitungsort gehören zusammen entschieden. Ein Modell, das auf dem Papier besser ist, hilft wenig, wenn die Daten es nicht verlassen dürfen.
Was heißt das für dich in der Praxis?
- Du nutzt Claude Pro: Wechsle im Modellmenü auf Opus 5.5. Es ist im Abo enthalten, die Limits sind gestiegen, und für die meisten Aufgaben bekommst du Fable-Niveau ohne Guthaben.
- Du programmierst mit Claude Code: Opus 5.5 ist beim agentischen Coding in Anthropics Tabelle das stärkste Modell und deutlich sparsamer als Opus 5. Setz die Denk-Stufe bewusst, high ist für die meisten Aufgaben der beste Kompromiss. Wie ich Claude Code einrichte, steht in meinem Ratgeber zu Claude Code.
- Du nutzt ChatGPT: Kein Grund zum Wechsel, wenn du zufrieden bist. GPT-6 Sol ist je Token halb so teuer wie Opus 5.5 und im Billigsegment vorn. Bei schwerer Wissensarbeit und Coding liegt Opus 5.5 in den unabhängigen Daten aber klar davor.
- Du baust KI in dein Unternehmen ein: Rechne mit Kosten je Aufgabe statt mit dem Token-Preis und teste mehrere Denk-Stufen. Opus 5.5 auf Stufe high liefert laut Artificial Analysis mehr als GPT-6 Astra auf max für gut die Hälfte des Geldes.
Wenn du wissen willst, welches Modell und welches Setup für deinen Fall passt, schau in meine KI-Beratung. Die Vorgänger-Modelle habe ich in eigenen Beiträgen eingeordnet: Claude Fable 5.1, Claude Opus 5, GPT-6 Astra und GPT-5.6 mit Luna, Terra und Sol.
Quellen und Stand
Stand: 23. September 2026, einen Tag nach der Veröffentlichung. Alle Zahlen stammen aus diesen Quellen:
- Anthropic: Introducing Claude Opus 5.5 (Ankündigung mit Benchmark-Tabelle)
- Anthropic: System Card zu Claude Opus 5.5
- Claude Docs: Modellseite Claude Opus 5.5
- Claude Docs: What's new in Claude Opus 5.5
- Claude Docs: Migrationsleitfaden zu Opus 5.5
- Claude Docs: Modellübersicht und Empfehlung
- Claude Docs: Preise
- Claude Docs: Datenresidenz
- Claude: Pläne und Preise
- OpenAI: Introducing GPT-6 Sol and Luna
- OpenAI API: Modellseite GPT-6 Sol
- OpenAI API: Modellseite GPT-6 Luna
- Artificial Analysis: LLM Leaderboard (Intelligence Index v4.3.2, Kosten je Aufgabe)
- LM Arena: Text-Leaderboard
- LM Arena: WebDev-Leaderboard
- LM Arena: Agent-Leaderboard
Häufige Fragen
- Was ist Claude Opus 5.5?
- Claude Opus 5.5 ist ein KI-Modell von Anthropic, veröffentlicht am 22. September 2026 als erstes Modell der Claude-5.5-Familie. Es löst Claude Opus 5 ab, arbeitet laut Anthropic bei den meisten Aufgaben auf dem Niveau von Claude Fable 5.1 und kostet im Betrieb rund 40 Prozent weniger als Opus 5. Es ist für lange Programmier-Aufgaben und Wissensarbeit gebaut und führt am Tag nach dem Start den unabhängigen Intelligence Index von Artificial Analysis an.
- Was kostet Claude Opus 5.5?
- Über die API kostet Claude Opus 5.5 4 Dollar je 1 Million Eingabe-Tokens und 20 Dollar je 1 Million Ausgabe-Tokens. Das Lesen aus dem Cache kostet 0,20 Dollar, das Schreiben in den Cache 5 Dollar (5 Minuten) oder 8 Dollar (1 Stunde). Über die Batch-API gilt der halbe Preis, der Fast mode kostet 8 und 40 Dollar. In der Claude-App ist Opus 5.5 ab dem Pro-Abo für 20 Dollar im Monat ohne Aufpreis enthalten.
- Ist Claude Opus 5.5 kostenlos?
- Nein. Mit einem kostenlosen Claude-Konto bekommst du Sonnet und Haiku, aber kein Opus-Modell. Opus 5.5 ist ab dem Pro-Abo enthalten. Über die API zahlst du nach Verbrauch, dort gibt es keine kostenlose Stufe für Opus 5.5.
- Ist Claude Opus 5.5 besser als Fable 5.1?
- In Anthropics Benchmark-Tabelle liegt Opus 5.5 in allen Zeilen vor Fable 5.1, etwa mit 66,4 zu 55,8 Prozent im Terminal-Bench 4.0 und 1.846 zu 1.735 Elo im GDPval-AA. Im Intelligence Index von Artificial Analysis führt Opus 5.5 mit 58 zu 53 Punkten. Anthropic schreibt aber selbst, dass der Unterschied im Alltag kleiner ist, als die Zahlen vermuten lassen, und empfiehlt Fable 5.1 weiter für die anspruchsvollsten Denk- und Langzeitaufgaben. Fable 5.1 kostet je Token das Zweieinhalbfache.
- Ist Claude Opus 5.5 besser als ChatGPT?
- Das hängt vom Modell und der Aufgabe ab. Gegen GPT-6 Astra liegt Opus 5.5 im unabhängigen Index von Artificial Analysis mit 58 zu 53 Punkten vorn und schlägt Astra auf Stufe high schon für gut die Hälfte der Kosten. Gegen GPT-6 Sol ist Opus 5.5 leistungsstärker, Sol kostet aber je Token nur die Hälfte und ist bei sehr günstigen Aufgaben im Vorteil. Beim Bauen von Websites führt in der LM Arena derzeit GPT-6 Astra, Opus 5.5 ist dort noch nicht gelistet.
- Was ist der Unterschied zwischen Claude Opus 5.5 und Sonnet 5?
- Opus 5.5 ist das stärkere Modell für lange und schwierige Aufgaben, Sonnet 5 das schnellere und günstigere für den Alltag. Opus 5.5 kostet 4 und 20 Dollar je 1 Million Tokens, Sonnet 5 kostet 2 und 10 Dollar. Opus 5.5 hat einen Wissensstand bis Juni 2026, Sonnet 5 bis Januar 2026. Mit Sonnet 5.5 hat Anthropic einen Nachfolger für die kommenden Wochen angekündigt.
- Was ist der Unterschied zwischen Claude Opus 5.5 und Claude Mythos?
- Claude Mythos 5.1 ist die Variante von Fable 5.1 mit gelockerten Schutzfiltern, die nur geprüfte Organisationen aus IT-Sicherheit und Biowissenschaften bekommen. Opus 5.5 liegt bei Biologie und Cybersicherheit auf einem vergleichbaren Niveau, läuft aber mit strengen Schutzfiltern: Die meisten Sicherheitsaufgaben leitet es automatisch an Opus 4.8 weiter. Über Anthropics Programm für Cybersicherheit sollen verifizierte Fachleute in drei Stufen mehr Zugang bekommen, bis hin zu Mythos.
- Wo steht Claude Opus 5.5 in der LM Arena?
- Am 23. September 2026 noch nirgends, weil neue Modelle erst einige tausend Stimmen sammeln müssen. In der WebDev-Arena führt GPT-6 Astra mit 1.793 Punkten vor Claude Fable 5.1 (1.755) und Claude Opus 5 (1.691). In der Text-Arena führt Claude Fable 5 mit 1.506 Punkten, in der Agent-Arena Claude Fable 5.1 vor GPT-6 Astra.
- Welches KI-Modell ist im September 2026 das beste?
- Im unabhängigen Artificial Analysis Intelligence Index v4.3.2 führt Claude Opus 5.5 mit 58 Punkten vor Claude Fable 5.1 und GPT-6 Astra (je 53), GPT-6 Sol (48), Grok 4.7 (46), Kimi K3 (44) und Gemini 3.8 Flash (41). In der LM Arena führt beim Web-Entwickeln GPT-6 Astra, bei Agenten Claude Fable 5.1. Für die meisten Aufgaben ist Opus 5.5 derzeit die beste Kombination aus Leistung und Preis, für sehr günstige Massenaufgaben GPT-6 Sol oder Luna.
- Wie groß ist das Kontextfenster von Claude Opus 5.5?
- 1 Million Tokens, die maximale Ausgabe liegt bei 128.000 Tokens, über die Batch-API mit Beta-Header bei 300.000. Der Wissensstand reicht bis Juni 2026. Anthropic berechnet das volle Kontextfenster zum Standardpreis, eine Anfrage mit 900.000 Tokens kostet je Token so viel wie eine mit 9.000. Bei GPT-6 Sol und Astra werden Anfragen ab 272.000 Eingabe-Tokens dagegen teurer abgerechnet.
- Kann ich bei Claude Opus 5.5 das Denken abschalten?
- Nein. Das adaptive Denken ist bei Opus 5.5 immer an, Anfragen mit abgeschaltetem Denken liefern einen Fehler. Die Tiefe steuerst du über die Denk-Stufe von low bis max. Standard ist medium, beim Vorgänger war es high. Für schnelle, günstige Antworten setzt du die Stufe herunter.
Weiterlesen
KI sinnvoll im Unternehmen nutzen?
Ich zeige dir, welche KI-Tools sich für dich lohnen und richte sie mit dir ein - praktisch, verständlich und ohne Hype.