Technologie
Nach Astra: OpenAI senkt mit Sol und Luna die Kosten für Agents und Coding

Nach Astra: OpenAI senkt mit Sol und Luna die Kosten für Agents und Coding

Larissa Ceccio | 23.09.26

GPT-6 Sol und Luna machen viele Astra-Fähigkeiten günstiger verfügbar. OpenAI halbiert die API-Preise, verbessert Coding, Computer Use und Faktentreue und senkt mit besserem Caching die Kosten langer Agent Workflows weiter. Die Kehrseite: Je häufiger und länger Agents eingesetzt werden, desto mehr Gelegenheiten entstehen für Fehler oder unerlaubte Aktionen.

Der Wettlauf um leistungsfähigere und zugleich günstigere AI-Modelle zieht weiter an. Während Anthropic gerade Claude Opus 5.5 vorgestellt hat, erweitert OpenAI die GPT-6-Familie. GPT-6 Sol und GPT-6 Luna bringen viele Entwicklungen der Astra-Generation in günstigere Modelle. Sol deckt dabei anspruchsvollere Business Workflows, Coding und Computer Use ab, Luna Anwendungen mit vielen Anfragen und einzelnen Agent-Schritten. Astra bleibt das leistungsfähigste Modell der Reihe.

Erst Anfang September präsentierte OpenAI GPT-6 Astra. Als erstes Modell des Unternehmens erreichte Astra die Cybersecurity-Stufe „Critical“. OpenAI verzögerte daraufhin den Release, verschärfte die Sicherheitsprüfungen und begrenzte besonders leistungsfähige Cybersecurity-Funktionen. Sol und Luna basieren auf derselben Modellgeneration, sollen viele Aufgaben aber schneller und deutlich günstiger erledigen.

Plus, Pro, Business, Enterprise und Edu User erhalten GPT-6 Sol und Luna zunächst in ChatGPT Work und Codex. Free und Go User können Luna zusätzlich in der Desktop App verwenden. Über die API stehen beide Modelle als gpt-6-sol und gpt-6-luna bereit. Im normalen Chat fehlen sie zum Start noch.



„Intelligentestes Modell der Welt“ GPT-6 Astra ist da

Mann steht vor Leinwand mit digitalem Interface, Laptop mit GPT-6 Astra dahinter
© OpenAI via Canva


GPT-6 Sol übernimmt komplexere Arbeitsabläufe

GPT-6 Sol ist die leistungsstärkere der beiden neuen Varianten unterhalb von Astra. OpenAI hat das Modell für anspruchsvolle Business Workflows, Coding und Computer Use entwickelt, bei denen mehrere Arbeitsschritte, Tools und Modellaufrufe zusammenkommen.

Sol verbindet höhere Leistung mit niedrigeren Kosten

Im AutomationBench bearbeiten AI Agents komplette Abläufe mit 47 Tools aus Sales, Marketing, Operations, Support, Finance und HR. GPT-6 Sol erreicht bei höchstem Effort 33,2 Prozent und liegt damit vor Claude Fable 5.1 mit Opus 5-Fallback mit 31,4 Prozent und Claude Opus 5 mit 26,9 Prozent. Eine Aufgabe kostet mit Sol laut OpenAI durchschnittlich 0,27 US-Dollar. Für Opus 5 fallen mehr als elfmal so hohe Kosten an.

Auch bei länger laufenden beruflichen Aufgaben bleibt Sol im Vergleich zu Opus 5 stärker und günstiger. Im Agents’ Last Exam werden komplexe Workflows aus 55 Teilbranchen geprüft. GPT-6 Sol erreicht 56,4 Prozent und liegt damit über dem besten Opus-5-Ergebnis der Auswertung – bei 60 Prozent niedrigeren Kosten pro Aufgabe.

Die veröffentlichten Claude-Vergleiche berücksichtigen allerdings noch nicht Anthropics jüngstes Modell. Claude Opus 5.5 kam erst am 22. September auf den Markt und ist in OpenAIs Benchmarks noch nicht enthalten.

Sol erreicht beim Coding fast das Niveau von Fable 5

Auf FrontierCode, das neben funktionierendem Code auch Testqualität, Code-Stil und die saubere Integration in bestehende Codebases bewertet, erreicht GPT-6 Sol laut OpenAI ungefähr das Niveau von Claude Fable 5.1 und kostet deutlich weniger.

Im DeepSWE-Benchmark erreicht Sol 68,8 Prozent und damit nur 1,1 Prozentpunkte weniger als Claude Fable 5 mit 69,9 Prozent. Laut OpenAI kostet eine Aufgabe mit Sol dabei etwa 80 Prozent weniger.

Beim Computer Use fällt der Leistungsunterschied noch kleiner aus. Im OSWorld Benchmark erreicht GPT-6 Sol 60,5 Prozent, Claude Opus 5 kommt auf 60,3 Prozent. Der Vergleich bleibt allerdings eingeschränkt aussagekräftig, weil OpenAI Sol mit sehr hohem Effort und Opus 5 mit mittlerem Effort misst. Nach OpenAIs Berechnung kostet eine Aufgabe mit Sol nur etwa ein Fünftel so viel wie mit Opus 5.

Gerade in Codex, wo Agents inzwischen Apps bedienen, parallel arbeiten und längere Aufgaben selbstständig bearbeiten können, fallen solche Preisunterschiede stärker ins Gewicht. Je mehr Arbeitsschritte und Modellaufrufe ein Workflow umfasst, desto stärker wirken sich niedrigere Kosten pro Aufgabe aus.

Bei Sol sinkt auch die Fehlerquote

Auch bei der Faktentreue legt Sol zu. In OpenAIs interner Evaluation fällt der Anteil der Antworten mit mindestens einem Faktenfehler bei GPT-6 Sol etwa halb so hoch aus wie bei GPT-5.6 Sol.

Für den Faktentreue-Test nutzt OpenAI anonymisierte ChatGPT-Unterhaltungen, in denen Nutzer:innen zuvor einen Faktenfehler gemeldet hatten. Dadurch konzentriert sich die Evaluation auf besonders fehleranfällige Fälle und nicht auf die durchschnittliche Nutzung. OpenAI weist selbst darauf hin, dass Faktenfehler im normalen Einsatz seltener auftreten.

GPT-6 Luna setzt stärker auf niedrige Kosten

GPT-6 Luna ist die günstigere der beiden neuen Varianten unterhalb von Astra. OpenAI hat das Modell für häufige, skalierbare Anwendungen entwickelt, bei denen viele Anfragen oder einzelne Agent-Schritte zusammenkommen und nicht jede Aufgabe die Leistung von Sol oder Astra benötigt.

Im AutomationBench verbessert GPT-6 Luna bei hohem Effort das Ergebnis von GPT-5.6 Luna um 5,4 Prozentpunkte. Die Kosten pro Aufgabe sinken laut OpenAI um 58 Prozent. Luna eignet sich damit vor allem für wiederkehrende Aufgaben und Workflows mit vielen einzelnen Modellaufrufen.

Luna erreicht beim Coding das Niveau größerer Modelle

Im DeepSWE Benchmark bearbeiten AI Agents komplexe Software-Engineering-Aufgaben in realen Codebases. GPT-6 Luna erreicht bei maximalem Effort 66,6 Prozent und kommt damit ungefähr auf das Niveau von Claude Opus 5 und Claude Fable 5 bei mittlerem Effort. Laut OpenAI kostet eine Aufgabe mit Luna 93 Prozent weniger als mit Opus 5 und 96 Prozent weniger als mit Fable 5.

Auch beim Computer Use bleibt der Preisvorteil groß. Im OSWorld-Benchmark übertrifft GPT-6 Luna bei maximalem Effort GPT-5.6 Sol bei mittlerem Effort. Eine Aufgabe kostet laut OpenAI nur etwa ein Zehntel so viel.

Luna erreicht bei höherem Effort die Faktentreue von GPT-5.6 Sol

Auch bei der Faktentreue steigt die Leistung. Mit höherem Reasoning Effort erreicht GPT-6 Luna laut OpenAI ungefähr das Niveau von GPT-5.6 Sol. Die Kosten pro Aufgabe liegen dabei bei etwa einem Hundertstel.

Für diesen Test verwendet OpenAI dieselben anonymisierten ChatGPT-Unterhaltungen, in denen Nutzer:innen zuvor einen Faktenfehler gemeldet hatten. Die Ergebnisse beziehen sich deshalb auf überdurchschnittlich schwierige Fälle und nicht auf die typische Nutzung.

Was sich bei Sol und Luna zusätzlich ändert

Neben der höheren Leistung senkt OpenAI die API-Preise, verbessert das Prompt Caching und übernimmt den kompakteren Kommunikationsstil von Astra für beide Modelle.

OpenAI halbiert die API-Preise für Sol und Luna

Schon mit GPT-5.6 Sol, Terra und Luna führte OpenAI unterschiedliche Leistungsklassen für verschiedene Aufgaben und Budgets ein. Für GPT-6 folgen zunächst Sol und Luna. Eine neue Terra-Version hat OpenAI bislang nicht angekündigt.

Über die API wird nach Tokens abgerechnet, also grob danach, wie viel Text ein Modell verarbeitet und selbst erzeugt. Gerade bei langen Dokumenten, vielen Anfragen oder Agent Workflows mit zahlreichen Modellaufrufen summieren sich diese Kosten schnell.

  • GPT-6 Sol kostet zwei statt vier US-Dollar pro eine Million Input Tokens und zehn statt 20 US-Dollar beim Output.
  • GPT-6 Luna kostet 0,10 statt 0,20 US-Dollar beim Input und 0,50 statt 1,20 US-Dollar beim Output.

Damit halbieren sich bei Sol die Preise für Input und Output. Luna verbilligt den Output sogar um mehr als die Hälfte. OpenAI spricht insgesamt von 50 Prozent niedrigeren API-Preisen gegenüber den Aktionspreisen von GPT-5.6.



GPT-5.6 ist da
– doch OpenAI, Anthropic und Google stehen vor großen Herausforderungen

KI Apps auf einem Smartphone
© Solen Feyissa – Unsplash


Prompt Caching spart bei langen Workflows zusätzlich Geld

Sol und Luna können bereits gelesene Teile eines Chats oder Prompts wiederverwenden, statt dieselben Informationen immer wieder neu zu verarbeiten. Für solche wiederverwendeten Input Tokens berechnet OpenAI 90 Prozent weniger. Das lohnt sich vor allem bei langen Agent Workflows, die immer wieder auf dieselben Anweisungen, Dateien oder Ergebnisse zurückgreifen.

Entwickler:innen können außerdem einstellen, wie intensiv das Modell nachdenkt oder welche Tools es nutzen darf, ohne den bereits gespeicherten Chat-Kontext zu verlieren. Mit sogenannten Breakpoints lässt sich festlegen, bis wohin ein Prompt wiederverwendet werden soll. Ein Dashboard und ein Diagnose-Tool zeigen zudem, wie viel Kontext tatsächlich aus dem Cache kommt und warum Teile trotzdem neu verarbeitet werden.

GitHub berichtet, dass Copilot dank der Änderungen über mehrere Monate hinweg bei mehr als der Hälfte der Prompt Tokens auf bereits verarbeiteten Kontext zurückgreifen konnte, statt ihn jedes Mal neu zu berechnen.

Sol und Luna sollen kürzer und verständlicher antworten

OpenAI bringt auch Astras kompakteren Kommunikationsstil zu Sol und Luna. Beide Modelle sollen weniger Jargon verwenden, unnötige Details streichen und insgesamt schneller zum Punkt kommen.

Wie das aussehen soll, zeigt OpenAI an einem Website-Auftrag. GPT-5.6 Sol erklärt nach der Umsetzung noch technische Entscheidungen, wiederholt Teile der Aufgabe und nennt sogar den Prompt des verwendeten Bild-Tools. GPT-6 Sol konzentriert sich stärker darauf, was geändert und anschließend geprüft wurde.

Gerade bei längeren Agent Workflows hilft das im Alltag. Nutzer:innen erkennen schneller, was erledigt ist und wo noch eine Entscheidung fehlt.

Günstigere Agents stellen OpenAIs Sicherheitsgrenzen öfter auf die Probe

OpenAI veröffentlichte kürzlich sechs Fälle, in denen AI-Modelle Regeln umgingen, Daten erfanden, Dateien ohne Erlaubnis ins Internet stellten oder heimlich Informationen austauschten. Die Vorfälle reichten von verschleierten Fehlern bis zu unerlaubten Handlungen und legten zugleich eine Lücke im bisherigen Umgang mit solchen Fällen offen. OpenAI räumte ein, entsprechende Vorfälle zuvor unregelmäßig und seltener als nötig veröffentlicht zu haben. Mit einem neuen Framework führt das Unternehmen deshalb einen festen Melde- und Untersuchungsprozess ein.

Wie intensiv OpenAI einen Vorfall untersucht, hängt von Schwere und Aufwand ab. Das Framework unterscheidet zwischen „Ready for Disclosure“, „Minor Investigation“ und „Larger Investigation“. Der frühere Hugging-Face-Vorfall, bei dem ein internes Modell Schutzmechanismen umging und auf externe Infrastruktur zugriff, wäre laut OpenAI in die höchste Kategorie gefallen. Schon bei GPT-6 Astra hatten solche Risiken direkte Folgen für den Release.

Bei Sol und Luna setzt OpenAI diese Sicherheitsprüfungen fort. Das Unternehmen untersucht unter anderem, ob Agents falsche Angaben über ihre eigene Arbeit machen, Warnungen umgehen, Kontrollmechanismen austricksen oder ohne Erlaubnis mit anderen Anwendungen interagieren. Sol und Luna erzielen in diesen Alignment-Evaluationen laut OpenAI insgesamt bessere Werte als GPT-5.6 Sol und Luna. Bei Coding-Aufgaben machen beide Modelle beispielsweise seltener irreführende Angaben darüber, welche Arbeit sie tatsächlich ausgeführt haben.

Die Ergebnisse lassen sich allerdings nicht als normale Fehlerquote lesen. OpenAI konstruiert die Evaluationen so, dass problematisches Verhalten wahrscheinlicher auftritt. Sie zeigen, wie sich die Modelle unter besonders schwierigen Bedingungen verhalten, nicht wie häufig entsprechende Vorfälle im Alltag auftreten. Bessere Werte belegen zudem noch nicht, dass die Sicherheitsgrenzen auch über lange, offene Agent Workflows mit vielen Tools und Arbeitsschritten stabil halten.

Die niedrigeren Preise von Sol und Luna könnten diese Sicherheitsfrage zusätzlich verschärfen. Häufigere und längere Agent-Einsätze werden wirtschaftlicher, wenn einzelne Aufgaben weniger kosten. Das macht nicht jede Aufgabe automatisch riskanter, erhöht aber die Zahl der Situationen, in denen Regelverstöße, unerlaubte Aktionen oder über mehrere Schritte fortgesetzte Fehler praktische Folgen haben können.



„Du bist weder Unternehmen noch Regierungen Rechenschaft schuldig“:
OpenAI legt 6 Fälle problematischen KI-Verhaltens offen

Weißes OpenAI-Logo auf orangefarbenem Verlaufshintergrund zum als „Critical“ eingestuften AI-Modell Astra.
© OpenAI via Canva


Stelle OnlineMarketing.de als bevorzugte Quelle auf Google ein

Wenn du OnlineMarketing.de auf Google als bevorzugte Quelle einstellen möchtest, um auch in den Schlagzeilen auf Google immer aktuelle News und Tipps aus der Welt des Marketing und der Tech-Entwicklungen zu finden, kannst du einfach die Google-Quelleneinstellungen aufrufen und die Seite anwählen. Über das Stern-Icon neben den Top Stories kannst du ebenfalls bevorzugte Quellen für die spätere Suche speichern.

Kommentare aus der Community

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

*
*