Technologie
Claude Opus 5.5 ist da: Fable-Leistung und stärkere Agents zum kleineren Preis

Claude Opus 5.5 ist da: Fable-Leistung und stärkere Agents zum kleineren Preis

Larissa Ceccio | 23.09.26

Mehr Leistung, weniger Kosten und strengere Schutzvorkehrungen: Claude Opus 5.5 ist das erste neue Modell seit Anthropics Aufruf zum „Pacing the Frontier“. Das Modell soll schneller arbeiten, lange Agent-Aufgaben besser meistern und Antworten näher an den Vorgaben der Nutzer:innen formulieren.

Anthropic-Chef Dario Amodei hatte zuletzt vor den Risiken immer leistungsfähigerer AI-Modelle gewarnt und für ein kontrollierteres Entwicklungstempo plädiert. Entsprechend kommt Claudes jüngstes Spitzenmodell Opus 5.5 nicht nur mit Leistung auf Fable 5.1-Niveau, sondern auch mit zusätzlichen Schutzvorkehrungen auf den Markt. Zugleich schneidet Opus 5.5 in nahezu allen veröffentlichten Benchmarks besser ab als Opus 5, soll typische Aufgaben 40 Prozent günstiger erledigen und Output mehr als 30 Prozent schneller ausgeben. Auch die Kommunikation hat Anthropic überarbeitet: Opus 5.5 soll wichtige Informationen früher nennen und Schreibvorgaben zuverlässiger befolgen.

Opus 5.5 ist das erste neue Modell, seit Anthropic zum „Pacing the Frontier“ aufgerufen hat, schreibt das Unternehmen auf LinkedIn. Weil mit der Leistung auch die Risiken zunehmen können, ließ Anthropic das Modell vor dem Launch zusätzlich von METR und Frontier Design prüfen und weitete die eigenen Sicherheitstests aus. Im bislang umfassendsten Alignment-Test erzielt Opus 5.5 nach Unternehmensangaben die besten Werte aller bisher von Anthropic getesteten Modelle.

Opus 5.5 macht den Auftakt der neuen Modellfamilie und ist ab sofort in Claude sowie für Entwickler:innen über die Claude Platform, AWS, Google Cloud und Microsoft Azure verfügbar. Anthropic will Claude Sonnet 5.5 und Claude Haiku 5.5 in den kommenden Wochen veröffentlichen und erhöht zugleich die Nutzungslimits für Pro-, Max-, Team- und bestimmte Enterprise-Abos.



„Weltbeste Coding-Modelle“:
Claude Fable 5.1 und Mythos 5.1 sind da

Claude Mythos 5.1 und Claude Fable 5.1, weiße Schrift vor Wolken und Mondsilhouette in blauem Himmel
© Anthropic via Canva


Opus 5.5 soll lange Coding- und Agent-Aufgaben schneller abschließen

Vor allem bei langen Aufgaben zeigt Anthropic große Unterschiede zwischen Opus 5.5 und den bisherigen Modellen. Das neue Modell kann große Codebases prüfen, Informationen recherchieren, Tools einsetzen und mehrstufige Aufgaben über Stunden bearbeiten. Ein:e Early-Access-Tester:in migrierte damit eine Codebasis mit rund 680.000 Zeilen in weniger als einem Tag.

In einem zweiten Test prüfte und reparierte Opus 5.5 rund 200.000 Code-Zeilen innerhalb von drei Stunden. Opus 5 brauchte dafür mehr als 20 Stunden und verbrauchte 2,5-mal so viele Tokens.

Auch bei der Übersetzung der Load Balancing Software HAProxy von C nach Rust war Opus 5.5 schneller als Fable 5.1. Beide Übersetzungen bestanden nahezu alle Regressionstests, mit denen geprüft wird, ob bestehende Funktionen nach einer Änderung weiterhin korrekt funktionieren. Opus 5.5 schloss die Aufgabe nach 9,5 Stunden ab, Fable 5.1 nach zwölf Stunden. Dabei kostete der Einsatz von Opus 5.5 51 Prozent weniger.

Benchmarks zeigen den größten Sprung beim agentischen Coding

Die veröffentlichten Benchmarks zeigen deutliche Fortschritte beim agentischen Coding. Damit sind Aufgaben gemeint, bei denen das Modell nicht nur Code erzeugt, sondern mehrere Schritte selbst plant und ausführt. Im Terminal-Bench 4.0 erreicht Opus 5.5 66,4 Prozent, Opus 5 kommt auf 52,3 Prozent. Beim FrontierCode steigt der Wert von 48 auf 54,4 Prozent, beim CursorBench von 46,6 auf 57,8 Prozent. Auch bei Wissensarbeit schneidet Opus 5.5 besser ab. Im GDPval-AA v2.1, der reale Aufgaben aus 44 Berufen abbildet, erreicht das Modell einen Elo-Wert von 1.846. Fable 5.1 kommt auf 1.735, Opus 5 auf 1.708.

Andere Modelle liegen allerdings in einzelnen Tests vorne. Beim AutomationBench erreicht GPT-6 Astra 41,4 Prozent gegenüber 40 Prozent bei Opus 5.5. Beim wissenschaftlichen Terminal Bench Science fällt der Unterschied mit 64,6 zu 58,7 Prozent deutlicher aus.

Anthropic warnt selbst davor, kleine Benchmark-Unterschiede zu überschätzen. Solche Tests zeigen zwar, wie Modelle unter festgelegten Bedingungen abschneiden, bilden den Arbeitsalltag aber nur begrenzt ab. Für Unternehmen zählt deshalb zunehmend, ob ein Modell längere Aufgaben zuverlässig zu Ende bringt, wie viele Tokens es dafür benötigt und welche Kosten am Ende tatsächlich entstehen.

Opus 5.5 soll die Kosten pro Aufgabe um 40 Prozent senken

Anthropic senkt mit Opus 5.5 auch die API-Preise:

  • Input: vier statt fünf US-Dollar pro eine Million Tokens
  • Output: 20 statt 25 US-Dollar
  • Cache Reads: 0,20 statt 0,50 US-Dollar
  • Cache Writes: fünf statt 6,25 US-Dollar

Vor allem Cache Reads werden deutlich günstiger. Dabei greift Claude auf Kontext zurück, den das Modell bei früheren Schritten bereits verarbeitet hat. Das spielt bei Agents eine große Rolle, weil sie während einer Aufgabe immer wieder auf vorhandene Informationen zugreifen. Opus 5.5 soll außerdem weniger Tokens pro Aufgabe benötigen. Beides zusammen soll typische Aufgaben 40 Prozent günstiger machen als mit Opus 5.

Auch beim Tempo legt Opus 5.5 zu. Das Modell soll Output mehr als 30 Prozent schneller erzeugen. Für zeitkritische Aufgaben gibt es zusätzlich einen Fast Mode mit bis zu 2,5-facher Geschwindigkeit. Im Fast Mode kostet eine Million Input Tokens acht US-Dollar, beim Output sind es 40 US-Dollar.

Opus 5.5 soll wichtige Informationen früher nennen

Anthropic hat auch überarbeitet, wie Opus 5.5 Antworten formuliert. Wichtige Informationen sollen früher erscheinen, unnötiger Jargon seltener vorkommen und Vorgaben zum Schreibstil zuverlässiger befolgt werden. Damit reagiert das Unternehmen auf Rückmeldungen zu Opus: Nutzer:innen beschrieben die Antworten teilweise als zu lang und schwer überfliegbar.

Fehleranalysen beginnen mit Problem und Folgen

Wie Opus 5.5 Kernaussagen vor technische Details stellt, zeigt Anthropic anhand einer Fehleranalyse. Opus 5 erklärt zunächst ausführlich, was sich im Code geändert hat. Opus 5.5 nennt zuerst den Bug und dessen Folgen. Erst danach folgt die technische Ursache.

Bei längeren Aufgaben macht diese Reihenfolge einen größeren Unterschied. Wer Claude über mehrere Schritte recherchieren, analysieren oder programmieren lässt, muss die Ergebnisse zwischendurch schnell prüfen können. Lange Erklärungen können diese Kontrolle erschweren.

Claude führt längere Aufgaben im selben Chat weiter

Das wird umso wichtiger, seit Anthropic Claude Chat und Cowork in einer Oberfläche zusammengeführt hat. Größere Aufgaben müssen nicht mehr eigens in Cowork gestartet werden, sondern können direkt aus dem normalen Chat heraus bearbeitet werden. Claude kann etwa Daten analysieren, daraus einen Bericht erstellen und anschließend eine Präsentation vorbereiten. Docs, Slides und Design greifen auf denselben Kontext zurück. Nutzer:innen müssen Claude dadurch nicht für jeden Arbeitsschritt neu briefen.



Claude macht den Cowork-Wechsel überflüssig und bündelt alle Business Tasks im Chat

Illustration einer Staffelei mit abstrakter Zeichnung vor orangefarbenem Hintergrund zum neuen Claude mit Chat, Cowork, Docs und Slides.
© Anthropic


Mehr Autonomie bringt strengere Sicherheitsgrenzen

Je mehr Claude selbstständig erledigen kann, desto größere Folgen können Fehler haben. Anthropic prüft Opus 5.5 deshalb umfangreicher und begrenzt den Zugriff auf Funktionen, die in falschen Händen Schaden anrichten könnten.

Im neuen Behavioral Audit testete Anthropic das Modell in knapp 2.000 simulierten Situationen. Opus 5.5 erzielt dabei nach Unternehmensangaben die bislang besten Alignment-Werte aller von Anthropic getesteten Modelle. Vereinfacht gesagt prüft Anthropic damit, wie zuverlässig Claude Anweisungen befolgt und gesetzte Grenzen einhält.

Opus 5.5 soll seltener Aktionen ausführen, die sich nur schwer rückgängig machen lassen. Auch gegen Prompt Injection ist das Modell laut Anthropic widerstandsfähiger als Opus 5. Bei einer Prompt Injection enthalten Websites, Dokumente oder andere Inhalte Anweisungen, die ein Modell zu unerwünschten Aktionen bewegen können.

Opus 5.5 umgeht technische Grenzen im Test 85 Prozent seltener

In einem weiteren Test prüfte Anthropic, wie häufig Opus 5.5 versucht, vorgegebene technische Grenzen zu umgehen. Im Vergleich zu Opus 5 und Claude Mythos 5.1 geschah dies rund 85 Prozent seltener. Die verbliebenen Versuche bewertet Anthropic als wenig schwerwiegend. Zudem meldete das Modell diese selbst.

Ganz lösen lässt sich die Sicherheitsfrage damit nicht. Anthropic sieht Hinweise darauf, dass Opus 5.5 teilweise erkennt, wenn es gerade getestet wird. Das erschwert die Bewertung, weil unklar bleibt, ob sich das Modell in kontrollierten Tests genauso verhält wie später im realen Einsatz.

Gerade bei AI Agents wiegt diese Unsicherheit schwerer. Sie arbeiten über längere Zeit selbstständig mit Tools, Dateien oder anderen Anwendungen und können zahlreiche Schritte ausführen, bevor ein Mensch wieder eingreift. Verhält sich ein Modell anders als erwartet, können Fehler dadurch mehrere Arbeitsschritte betreffen, bevor sie auffallen.

Cyber- und Bio-Funktionen bleiben teilweise verifiziertem Zugriff vorbehalten

Bei Cybersecurity und Biologie begrenzt Anthropic deshalb, welche Aufgaben Opus 5.5 ohne weitere Prüfung übernimmt. Die meisten Cybersecurity-Aufgaben werden nicht von Opus 5.5 bearbeitet, sondern an Opus 4.8 weitergereicht. Verifizierte Fachleute sollen über das Cyber Verification Program künftig erweiterten Zugriff auf Opus 5.5 für ihre Arbeit erhalten.

Für biologische Forschung gilt ein ähnliches Prinzip. Akademische Forschungslabore, Startups und Pharmaunternehmen können sich über das Life Sciences Verification Program für einen erweiterten Zugang bewerben. Nach der Prüfung können sie Opus 5.5 auch für Forschungs- und Entwicklungsaufgaben nutzen, die für andere Nutzer:innen stärker eingeschränkt sind.

Auch das Abschöpfen von Modellfähigkeiten will Anthropic erschweren. Dafür setzt Opus 5.5 auf Preserved Thinking. Die Funktion verhindert bei betroffenen API Accounts, dass Nutzer:innen den vorherigen Claude-Kontext verändern, um das interne Reasoning systematisch zu extrahieren. Damit soll Preserved Thinking sogenannte Distillation-Angriffe erschweren, bei denen Angreifer große Mengen an Anfragen nutzen, um Fähigkeiten eines Modells für das Training anderer Modelle abzuschöpfen.



Stelle OnlineMarketing.de als bevorzugte Quelle auf Google ein

Wenn du OnlineMarketing.de auf Google als bevorzugte Quelle einstellen möchtest, um auch in den Schlagzeilen auf Google immer aktuelle News und Tipps aus der Welt des Marketing und der Tech-Entwicklungen zu finden, kannst du einfach die Google-Quelleneinstellungen aufrufen und die Seite anwählen. Über das Stern-Icon neben den Top Stories kannst du ebenfalls bevorzugte Quellen für die spätere Suche speichern.

Kommentare aus der Community

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

*
*