OpenAI und Anthropic haben am 22. September neue Modelle veröffentlicht, doch ihre Modellreihen entwickeln sich unterschiedlich schnell. Zu Astra sind GPT-6 Sol und Luna hinzugekommen, während Terra noch auf GPT-5.6 basiert. Claude Opus wird auf Version 5.5 aktualisiert; hinzu kommen Fable 5.1, Sonnet 5 und das fast ein Jahr alte Haiku 4.5.
Entscheidend sind die Vergleiche Astra gegen Fable, Sol gegen Opus, Terra gegen Sonnet und Luna gegen Haiku. Der Blick auf alle vier Paare zeigt einen interessanteren Wettbewerb als jede einzelne Markteinführung: Opus fordert die Spitzenklasse heraus, Luna setzt Anthropics günstigem Angebot zu, und die Mitte beider Modellreihen ist noch im Wandel.
Die große Veränderung
- Was sich geändert hat: Käufer können innerhalb des Sortiments desselben Anbieters nun neuere Modelle zu stark unterschiedlichen Preisen nutzen. OpenAI hat seine günstige Dienststufe aktualisiert, während Anthropic sich bei dieser Veröffentlichung auf Opus konzentriert hat. Haiku liegt im Veröffentlichungszeitplan dadurch fast ein Jahr zurück.
- Warum das wichtig ist: Produktteams haben mehr Möglichkeiten, die Kosten alltäglicher KI-Nutzung zu senken und zugleich dort für bessere Ergebnisse zu zahlen, wo Fehler teuer sind. Schwierig bleibt die Auswahl anhand nachgewiesener Leistung: Der Platz eines Modells im Produktangebot lässt keine verlässliche Rangfolge seiner Benchmark-Ergebnisse erkennen.
- Was zu beobachten ist: Anthropic kündigt Sonnet 5.5 und Haiku 5.5 für die kommenden Wochen an. Ihre Preise und Ergebnisse werden zeigen, wie viel von OpenAIs aktuellem Vorsprung bestehen bleibt – besonders bei Produkten mit vielen günstigen Anfragen.
Preise nach Dienststufe
Alle folgenden Beträge sind Standardpreise für direkte API-Nutzung in US-Dollar je Million Tokens, Stand 22. September. „Cached input“ bezeichnet Eingaben, bei denen ein Cache-Treffer erzielt wird. Die angegebenen OpenAI-Preise gelten bis zu 272.000 Eingabetokens; darüber verdoppeln sich die Eingabepreise für die gesamte Anfrage und die Ausgabepreise steigen um 50 Prozent. Für Cache-Schreibvorgänge, Batch-Verarbeitung und Tools gelten gesonderte Abrechnungsbedingungen. Quellen: OpenAI und Anthropic.
Modell | Eingabe | Cache-Eingabe | Ausgabe |
|---|---|---|---|
GPT-6 Astra | 10 $ | 1 $ | 50 $ |
Claude Fable 5.1 | 10 $ | 0,25 $ | 50 $ |
GPT-6 Sol | 2 $ | 0,20 $ | 10 $ |
Claude Opus 5.5 | 4 $ | 0,20 $ | 20 $ |
GPT-5.6 Terra | 2 $ | 0,20 $ | 12 $ |
Claude Sonnet 5 | 2 $ | 0,20 $ | 10 $ |
GPT-6 Luna | 0,10 $ | 0,01 $ | 0,50 $ |
Claude Haiku 4.5 | 1 $ | 0,10 $ | 5 $ |
Intelligenz und gemessene Testkosten
Artificial Analysis Intelligence Index v4.3.2, Stand 22. September. Die Kosten geben die gewichteten durchschnittlichen Ausgaben des Testbetreibers je Index-Aufgabe an.
Modell | Getestete Einstellung | Intelligenzindex | Kosten je Index-Aufgabe |
|---|---|---|---|
GPT-6 Astra | Max | 52,7 | 3,26 $ |
Claude Fable 5.1 | Max mit Fallback | 53,4 | 7,63 $ |
GPT-6 Sol | Max | 47,5 | Nicht aufgeführt |
Claude Opus 5.5 | Max mit Fallback | 57,6 | 5,98 $ |
GPT-5.6 Terra | Max | 42,1 | 1,40 $ |
Claude Sonnet 5 | Max | 38,2 | 5,09 $ |
GPT-6 Luna | Max | 37,3 | Nicht aufgeführt |
Claude Haiku 4.5 | Reasoning aktiviert | 16,9 | 0,21 $ |
Quelle: Artificial Analysis; die Ergebnisse der einzelnen Modelle sind in den folgenden Vergleichen verlinkt.
Astra gegen Fable: das Spitzenpaar
Ihre Standardpreise für Ein- und Ausgaben stimmen überein. Die Cache-Trefferquote von Fable beträgt ein Viertel derjenigen von Astra – ein Unterschied, der bei Anwendungen ins Gewicht fällt, die geeignete Prompt-Inhalte wiederholt verwenden.
Im aktuellen Intelligence Index von Artificial Analysis erreicht Astra mit maximalem Aufwand 52,7 Punkte; Fable 5.1 kommt mit maximalem Aufwand und Fallback auf 53,4 Punkte. Das Ergebnis liegt eng beieinander. Laut Artificial Analysis betragen die gewichteten Ausgaben 3,26 US-Dollar je Index-Aufgabe für Astra gegenüber 7,63 US-Dollar für Fable. Astra erzielt einen ähnlich hohen Wert bei rund 57 Prozent niedrigeren gemessenen Ausgaben, obwohl die Preise für Ein- und Ausgaben gleich sind. Astra-Ergebnisse, Fable-Ergebnisse.
Sol gegen Opus: niedrigere Preise treffen auf höhere Werte
Die regulären Ein- und Ausgabepreise von Sol betragen die Hälfte der Opus-Preise; die Cache-Trefferquoten sind gleich. Außerdem halbierte OpenAI Sols Ein- und Ausgabepreise gegenüber den Einführungspreisen von GPT-5.6 Sol. Anthropic senkte die entsprechenden Opus-Preise gegenüber Opus 5 um 20 Prozent. OpenAI-Einführung, Opus-Einführung.
Artificial Analysis bewertet Sol mit maximalem Aufwand mit 47,5 Punkten; Opus 5.5 erreicht mit maximalem Aufwand und Fallback 57,6 Punkte. Opus liegt 10,1 Punkte vor Sol und kostet für reguläre Ein- und Ausgaben doppelt so viel. Bei 60 Prozent niedrigeren Preisen für Ein- und Ausgaben liegt Opus außerdem vor Astra und Fable. Die tatsächlichen Testausgaben zeichnen ein anderes Bild: Opus kostet durchschnittlich 5,98 US-Dollar je Index-Aufgabe und damit rund 84 Prozent mehr als Astra. Als die Daten abgerufen wurden, enthielt die veröffentlichte Kostentabelle von Artificial Analysis noch keinen Wert für Sol. Sol-Ergebnisse, Opus-Ergebnisse.
Terra gegen Sonnet: das fehlende GPT-6-Modell
In OpenAIs aktueller Einführungsankündigung und im Modellkatalog gibt es kein GPT-6 Terra. Der verfügbare Vergleich betrifft GPT-5.6 Terra, dessen aktuelle API-Dokumentation die oben aufgeführten Preise bestätigt. Auch OpenAIs Leitfaden zu Work und Codex zufolge bleiben die älteren 5.6-Modelle während der Einführung verfügbar.
Mit maximalem Aufwand erreicht Terra im Index von Artificial Analysis 42,1 Punkte, Sonnet 5 kommt auf 38,2 Punkte. Auch bei den durchschnittlichen Kosten je Index-Aufgabe liegt Terra mit 1,40 US-Dollar unter 5,09 US-Dollar für Sonnet: ein höherer Wert bei rund 73 Prozent geringeren gemessenen Ausgaben. Der Preis je Ausgabetoken ist bei Terra um 20 Prozent höher. Das zeigt, wie Tokenverbrauch und Caching den Listenpreis überwiegen können. Terra-Ergebnisse, Sonnet-Ergebnisse.
Sonnet 5 erschien am 30. Juni. Anthropic hat inzwischen Sonnet 5.5 für die kommenden Wochen angekündigt. Bis der Nachfolger verfügbar und getestet ist und seine Preise feststehen, bleibt der heutige Vergleich mit Sonnet 5 maßgeblich.
Luna gegen Haiku: der größte Altersunterschied bei den Veröffentlichungen
In jeder aufgeführten Token-Kategorie kostet Luna ein Zehntel des Haiku-Preises. Haiku 4.5 wurde am 15. Oktober 2025 eingeführt – 342 Tage vor Luna. Es ist weiterhin das aktuelle veröffentlichte Haiku-Modell von Anthropic; Version 5.5 wurde für die kommenden Wochen angekündigt.
Auch unabhängige Tests zeigen einen Leistungsabstand. Artificial Analysis bewertet Luna mit maximalem Aufwand mit 37,3 Punkten, Haiku 4.5 mit aktiviertem Reasoning mit 16,9 Punkte. Es handelt sich um Werte aus demselben aktuellen Testsatz; zugleich kostet Luna je Token 90 Prozent weniger. Haikus Reasoning-Konfiguration kostet durchschnittlich 0,21 US-Dollar je Index-Aufgabe. In der veröffentlichten Kostentabelle des Testbetreibers war ein entsprechender Wert für Luna noch nicht aufgeführt. Luna-Ergebnisse, Ergebnisse für Haiku mit Reasoning.
Damit liegt ein Bereich von Anthropics Modellangebot offen: Das derzeit günstigste Modell des Unternehmens trifft auf einen neu veröffentlichten Wettbewerber mit niedrigeren Token-Preisen und deutlich besserem Ergebnis in dieser Bewertung. Das angekündigte Haiku-Update wird daher zu den nächsten wichtigen Veröffentlichungen für Entwickler gehören, die Modelle in großem Umfang einsetzen.
Die oben aufgeführten Werte von Artificial Analysis stammen aus dem zehn Tests umfassenden Intelligence Index v4.3.2, Stand 22. September. Die Einstellungen stehen jeweils neben den Ergebnissen; bei Fable und Opus umfasst die Konfiguration einen Fallback. Index und Methodik.
Was passiert, wenn Agenten Aufgaben abschließen müssen?
Zapier testet mit AutomationBench v1.0.6 durchgängige Arbeitsabläufe in simulierten Geschäftsanwendungen. Als bestanden gilt eine Aufgabe nur, wenn alle bewerteten Ergebnisse korrekt sind. Die Bestenliste vom 22. September weist Folgendes aus:
Modell | Getestete Einstellung | Erfolgsquote | Kosten je Aufgabe |
|---|---|---|---|
GPT-6 Astra | Max | 41,4 % | 1,73 $ |
Claude Fable 5.1 | Max, eigenständig | 22,37 % | 2,45 $ |
GPT-6 Sol | Xhigh | 33,2 % | 0,27 $ |
GPT-6 Sol | Max | 32,0 % | 0,34 $ |
Claude Opus 5.5 | Max | 40,0 % | 1,28 $ |
GPT-5.6 Terra | Max | 23,59 % | 0,51 $ |
Claude Sonnet 5 | Max | 10,65 % | 0,88 $ |
GPT-6 Luna | Max | 20,7 % | 0,04 $ |
Claude Haiku 4.5 | Nicht angegeben | 0,46 % | 0,07 $ |
Die getrennte Konfiguration aus Fable plus Opus 5 erreicht 31,4 Prozent. Opus bearbeitet rund 40 Prozent der Aufgaben; die angegebenen 2,45 US-Dollar enthalten die Tokens des Fallbacks nicht.
Sol mit der Einstellung Xhigh kostet je Versuch rund 79 Prozent weniger als Opus mit Max, erzielt aber eine um 6,8 Prozentpunkte niedrigere Erfolgsquote. Luna übertrifft Haiku bei 43 Prozent niedrigeren Aufgabenkosten. Astra liegt in dieser Gruppe vorn; alle Erfolgsquoten bleiben unter 50 Prozent. Zapiers Ergebnisse und Bewertungsmethode.
Ein voller und ungleichmäßiger Veröffentlichungsplan
Die API-Veröffentlichungsprotokolle der Unternehmen liefern zwei ausgewählte Reihen. Die OpenAI-Liste folgt den nummerierten GPT-Versionen bis GPT-6 Astra. Spezialreihen wie Instant und Codex sowie spätere Erweiterungen der Dienststufen – GPT-5.4 mini und nano am 17. März sowie GPT-6 Sol und Luna am 22. September – sind nicht enthalten. Die Anthropic-Liste folgt den öffentlichen Opus-API-Versionen. Die „Lücke“ bezeichnet die Zahl der Kalendertage seit dem vorherigen Eintrag der ausgewählten Reihe des jeweiligen Unternehmens.
- GPT-5-Familie – 7. Aug. 2025: Start der Modellfamilie; für den ersten Eintrag ist kein Abstand anwendbar.
- GPT-5.1 – 13. Nov. 2025: Versionsupdate; Abstand von 98 Tagen.
- GPT-5.2 – 11. Dez. 2025: Versionsupdate; Abstand von 28 Tagen.
- GPT-5.4 – 5. März 2026: Versionsupdate; Abstand von 84 Tagen.
- GPT-5.5 – 24. Apr. 2026: Versionsupdate; Abstand von 50 Tagen.
- GPT-5.6 – 9. Juli 2026: Modellfamilien-Update mit mehreren Dienststufen; Abstand von 76 Tagen.
- GPT-6 Astra – 3. Sept. 2026: Start einer neuen Modellfamilie; Abstand von 56 Tagen.
Quelle: Änderungsprotokoll der OpenAI API. GPT-6 Sol und Luna erschienen separat am 22. September, 19 Tage nach Astra. Dieser Zeitraum beschreibt eine Erweiterung der Dienststufen innerhalb derselben Modellfamilie und ist nicht Teil der oben aufgeführten Versionsreihe.
- Opus 4 – 22. Mai 2025: Hauptversion; für den ersten Eintrag ist kein Abstand anwendbar.
- Opus 4.1 – 5. Aug. 2025: Punktupdate; Abstand von 75 Tagen.
- Opus 4.5 – 24. Nov. 2025: Versionsupdate; Abstand von 111 Tagen.
- Opus 4.6 – 5. Feb. 2026: Versionsupdate; Abstand von 73 Tagen.
- Opus 4.7 – 16. Apr. 2026: Versionsupdate; Abstand von 70 Tagen.
- Opus 4.8 – 28. Mai 2026: Versionsupdate; Abstand von 42 Tagen.
- Opus 5 – 24. Juli 2026: Hauptversion; Abstand von 57 Tagen.
- Opus 5.5 – 22. Sept. 2026: Versionsupdate und Preissenkung; Abstand von 60 Tagen.
Quelle: Versionshinweise zur Anthropic API. Fable und die eingeschränkten Mythos-Veröffentlichungen sind separate Modellreihen und daher nicht in der Opus-Sequenz enthalten.
Die Abstände zwischen OpenAIs benannten Versionen schwanken zwischen 28 und 98 Tagen; bei Opus von Anthropic liegen sie zwischen 42 und 111 Tagen. Versteht man unter einer „Hauptveröffentlichung“ einen Wechsel der Familiennummer, dauerte es von GPT-5 bis GPT-6 392 Tage und von Opus 4 bis Opus 5 428 Tage. Kürzere Abstände entfallen auf Punktupdates und Erweiterungen der Dienststufen. Beide Reihen schwanken: Auf kürzere Abstände folgen längere.
Der praktische Druck besteht darin, gezielt zu aktualisieren
Der Veröffentlichungsplan liefert ständig neue Gründe, die Modellauswahl zu überdenken. Die vier aktuellen Vergleiche zeigen, warum ein pauschales Urteil über einen Anbieter wichtige Unterschiede übersieht: Anthropic hat ein starkes neues Opus-Modell, OpenAI eine neu konkurrenzfähige günstige Dienststufe, und beide Unternehmen führen weiterhin ältere Modelle in Teilen ihres Sortiments.
Auch ein Versionswechsel kostet Entwicklungsaufwand. Anthropics Migrationsleitfaden zu Opus 5.5 hält fest, dass Thinking immer aktiviert ist, eine erzwungene Tool-Auswahl einen Fehler zurückgibt und der frühere Tooltyp für Computersteuerung in der Claude API und bei Google Cloud abgelehnt wird. Bestehende Integrationen, die diese Optionen verwenden, müssen angepasst werden.
Als nächste Entwicklung hat Anthropic die Aktualisierung von Sonnet und Haiku angekündigt. Das ist für Käufer ein konkreter Anlass, die günstigeren Dienststufen bald erneut zu prüfen. Schon jetzt zeigen Preislisten und unabhängige Ergebnisse, wohin sich der Wettbewerb verschoben hat – und wo ein älteres Modell weiterhin in Betracht kommt.



