OpenAI veröffentlichte am 2. Oktober 2026 einen Leitfaden zur GPT-6-Modellfamilie. Er führt Modellauswahl, Anweisungen, länger laufende Aufgaben und Prüfungen vor dem Einsatz zusammen. Ein Softwareteam muss dennoch die Kombination finden, die seine eigenen Aufgabentests innerhalb der Kosten- und Antwortzeitgrenzen besteht.

Die derzeit im Leitfaden aufgeführten Modelle sind GPT-6 Astra, GPT-6.1 Sol und GPT-6 Luna. Wir haben OpenAIs API-Dokumentation und Preise am 3. Oktober geprüft. Die Auswahlmethode und das Arbeitsblatt unten sind Vorschläge; wir haben die Modelle nicht ausgeführt und keine Produktionslast gemessen.

Die große Änderung

  • Was sich geändert hat: OpenAI stellt die GPT-6-Familie nun als Auswahl für unterschiedliche Arbeitslasten dar, mit einstellbarem Denkaufwand und Werkzeugen für mehrstufige Aufgaben. Teams können jeden Teil eines Arbeitsablaufs passend konfigurieren, statt eine einzelne Modelleinstellung für alle Aufgaben zu verwenden.
  • Warum das wichtig ist: Ein Team kann messen, ob Luna für einen klar umrissenen Extraktionsschritt genügt, ob ein Programmier- oder Rechercheabschnitt Sol rechtfertigt und bei welchen Aufgaben die zusätzlichen Fähigkeiten von Astra ihren Preis wert sind. Entscheidend sind erledigte Aufgaben, Latenz und Gesamtkosten des Arbeitsablaufs – einschließlich Werkzeugnutzung und fehlgeschlagener Versuche.
  • Worauf zu achten ist: Längere Abläufe erfordern ausdrücklich definierte Übergaben und Prüfungen. Während eines Laufs können Anweisungen angepasst werden; asynchrone Werkzeugergebnisse und delegierte Arbeit müssen jedoch zusammengeführt werden, bevor die endgültige Antwort akzeptiert wird.

Nach Aufgabe auswählen, dann den gesamten Ablauf messen

Beginnen Sie mit einer repräsentativen Auswahl realer Aufgaben und legen Sie für jede ein Abnahmekriterium fest. OpenAI empfiehlt die Responses API für aktuelles Modellverhalten, Werkzeugaufrufe und zustandsbehaftete Aufgaben. Voraussetzungen sind ein API-Projekt, Zugangsdaten, Zugriff auf die Abrechnung und ein für das Projekt verfügbares Modell. Die Modellseiten führen keine Unterstützung im kostenlosen Tarif auf; Ratenlimits hängen von der Nutzungsstufe ab. Prüfen Sie den tatsächlichen Zugang und die Limits des Kontos, bevor Sie den Rollout dimensionieren.

Der Auftrag für das Modell

Erste Modellauswahl

Anfangs eingestellter Denkaufwand

Ein leistungsstärkeres Modell wählen, wenn

Wiederholte Extraktion, Klassifizierung oder strukturierte Zusammenfassung mit klarer Antwort

gpt-6-luna

Low bei Routineaufgaben; mit dem Standardwert Medium vergleichen

Fehlerquote oder Prüfaufwand überschreitet den Grenzwert des Teams

Programmierung, Recherche, Werkzeugnutzung oder ein Schritt mit fachlichem Urteil

gpt-6.1-sol

Standardwert Medium; bei schwierigen Fällen High testen

Repräsentative Aufgaben trotz geeigneter Eingaben und Anweisungen scheitern

Der anspruchsvollste Schlussfolgerungs- oder Prüfschritt, bei dem Qualität entscheidend ist

gpt-6-astra

Medium und High anhand derselben Fälle vergleichen

Nur beibehalten, wenn der gemessene Gewinn die zusätzlichen Kosten und die längere Laufzeit rechtfertigt

Die Tabelle macht aus OpenAIs Modellhinweisen und Modellseiten erste Ansatzpunkte für eine Bewertung. Prüfen Sie die API-Modell-IDs und unterstützten Denkaufwandsstufen: Astra und GPT-6.1 Sol unterstützen die Stufen Low bis Max; Luna unterstützt zusätzlich None. GPT-6.1 Sol unterstützt weder None noch Minimal. OpenAI empfiehlt, Extra High oder Max auszuprobieren, wenn High nicht ausreicht und diese Stufen verfügbar sind. Vergleichen Sie die Denkaufwandsstufen anhand derselben Aufgaben, denn Qualität, Dauer und Tokenverbrauch können sich gemeinsam verändern.

Für Standardverarbeitung und Prompts mit bis zu 272.000 Eingabetokens gelten derzeit folgende Textpreise pro Million Tokens:

Modell

Eingabe

Zwischengespeicherte Eingabe

Cache-Schreibvorgang

Ausgabe

GPT-6 Luna

0,10 US-Dollar

0,01 US-Dollar

0,125 US-Dollar

0,50 US-Dollar

GPT-6.1 Sol

2,00 US-Dollar

0,10 US-Dollar

2,50 US-Dollar

10,00 US-Dollar

GPT-6 Astra

10,00 US-Dollar

1,00 US-Dollar

12,50 US-Dollar

50,00 US-Dollar

Quellen: die Modellseiten für Luna, GPT-6.1 Sol und Astra. Bei einer Anfrage mit mehr als 272.000 Eingabetokens gelten die höheren Preise für die gesamte Anfrage. Andere Verarbeitungsmodi, regionale Verarbeitung – sofern verfügbar – und einige Werkzeuge verändern die Rechnung. Alle drei Seiten nennen ein Kontextfenster von 1.050.000 Tokens und eine maximale Ausgabe von 128.000 Tokens; ein großes Kontextfenster ist eine Kapazitätsgrenze und kein Grund, jedes verfügbare Dokument einzusenden.

Schätzen Sie die Kosten für den vollständigen Aufgabenablauf: Eingabe, zwischengespeicherte Eingabe, Cache-Schreibvorgänge, Ausgabe, Werkzeuggebühren, Wiederholungen und mögliche Aufschläge für lange Kontexte. Teilen Sie die Gesamtkosten durch die unter derselben Prüfvorgabe akzeptierten Aufgaben. Vergleichen Sie anschließend die Latenz sowohl für den nutzerseitigen Schritt als auch für den gesamten Ablauf. Aus Stückpreisen allein lässt sich nicht ablesen, welcher Weg je erfolgreichem Ergebnis am günstigsten ist.

Auftrag und Ausgabe festlegen, bevor Werkzeuge hinzukommen

Legen Sie für jeden Schritt klar Eingabe, vorgesehenen Leser oder nachgelagerten Empfänger, zulässige Quellen und Werkzeuge, Einschränkungen sowie eine Abschlussbedingung fest. OpenAIs Leitfaden empfiehlt Teams außerdem zu bestimmen, welche Entscheidungen das Modell selbst treffen darf und welche die Zustimmung einer Person erfordern. Projektanweisungen, Skills und Prompts sollten diese Grenzen einheitlich beschreiben.

Legen Sie bei maschinenlesbaren Ausgaben zuerst die Felder und gültigen Werte fest und verwenden Sie dann den Leitfaden zu strukturierten Ausgaben, wenn sich die Aufgabe für ein Schema eignet. Eine gültige Struktur ist nur eine Prüfung: Ein Feld kann dem Schema entsprechen und trotzdem sachlich falsch sein. Bei einer Übergabe an einen Menschen sollten Ergebnis, verwendete Belege, durchgeführte Prüfungen und offene Punkte verlangt werden. Prüfen Sie das Ergebnis anhand der ursprünglichen Eingaben und der Abnahmeregel des Teams.

Wenn Sie Prompt-Caching bewerten, stellen Sie stabile Anweisungen und gemeinsames Referenzmaterial vor wechselnde Aufgabendetails. Die Wiederverwendung kann wiederkehrende Eingabekosten senken; Cache-Schreibvorgänge und späterer Kontext müssen jedoch in die Schätzung einfließen. Der frühere Prompt-Cache-Leitfaden von BIG CHANGE erläutert die Cache-Diagnose ausführlich.

Länger laufende Aufgaben nachvollziehbar halten

Der Leitfaden vom 2. Oktober beschreibt Änderungen von Anweisungen während eines Laufs, asynchrone Werkzeugaufrufe und parallel eingesetzte Subagenten für voneinander unabhängige Arbeit. Eine über die Responses-WebSocket-API gesendete Korrektur wird in die Warteschlange gestellt; sie macht abgeschlossene Aktionen nicht rückgängig und stoppt kein bereits laufendes Werkzeug. Mit einem asynchronen Werkzeug kann unabhängige Arbeit fortgesetzt werden, doch abhängige Arbeit muss auf das Ergebnis warten. Die Unterstützung mehrerer Agenten für GPT-6.1 Sol in der Responses API ist derzeit eine Beta.

Speichern Sie bei einem mehrstufigen Lauf Aufgaben-ID, gewähltes Modell und Denkaufwand, aktuelle Phase, IDs der Werkzeugaufrufe und -ergebnisse, Freigaben sowie die Belege hinter der endgültigen Antwort. Legen Sie vorab fest, was nach einer Zeitüberschreitung, einem fehlgeschlagenen Werkzeugaufruf, geänderten Anweisungen oder einem doppelten Ergebnis geschehen soll. Wenn der Kontext wächst, kann Komprimierung den weitergegebenen Umfang reduzieren; prüfen Sie, welche Informationen der fortgesetzte Lauf tatsächlich beibehält. OpenAIs Hintergrundmodus ist eine weitere dokumentierte Möglichkeit für Aufgaben, die länger als eine einzelne Anfrage dauern. Wählen Sie die Steuerungen passend zur Dauer der Aufgabe und zu den Anforderungen an Wiederaufnahme und Fehlerbehandlung.

OpenAIs Leitfaden empfiehlt eine direkte API oder ein verbundenes Werkzeug, wenn sich der Schritt damit ausführen lässt, und Bildschirmbedienung, wenn sie erforderlich ist. BIG CHANGEs Leitfaden zu Browseraufgaben mit der Agents API beschreibt die Computer-Use-Schnittstelle und ihre Überwachungsmöglichkeiten.

Ein Arbeitsblatt für eine nachvollziehbare Entscheidung

Verwenden Sie für jede Modelloption dieselben Fälle und Prüfkriterien. Dieses Arbeitsblatt schlägt eine Bewertungsmethode vor; BIG CHANGE hat keine Ergebnisse eingetragen und keine Tests durchgeführt.

Für jeden Fall und jedes Modell erfassen

Festzuhaltender Eintrag

Aufgabe und erwartetes Ergebnis

Echte Eingabe-ID, Ausgabeanforderungen, zulässige Werkzeuge, Abnahmeregel

Konfiguration

API-Modell-ID, Denkaufwand, Verarbeitungsmodus, Promptversion, Schema oder Ausgabevertrag

Ergebnis

Angenommen, abgelehnt oder prüfbedürftig; Fehlerursache; prüfende Person

Zeit

Gesamtdauer und Dauer des nutzerseitigen Schritts

Verbrauch und Kosten

Eingabe-, Cache-Eingabe-, Cache-Schreib- und Ausgabetokens; Werkzeuggebühren; Wiederholungen; Aufschläge für lange Kontexte oder regionale Verarbeitung

Entscheidung

Angenommene Aufgaben geteilt durch versuchte Aufgaben; Gesamtkosten geteilt durch angenommene Aufgaben; ungelöste Fehlerarten

Berücksichtigen Sie einfache und schwierige Fälle sowie fehlerhafte Eingaben und unterbrochene Werkzeugschritte, die im realen Ablauf vorkommen. Halten Sie die Fälle beim Modellvergleich konstant und wiederholen Sie die Prüfung nach Änderungen an Prompts oder Werkzeugberechtigungen. Ordnen Sie Fehlerarten zu: fehlende Belege, falsches Feld, Werkzeugfehler, übersehene Anweisung oder eine Antwort, die ein Mensch korrigieren muss. Verschieben Sie einen Schritt erst dann auf ein anderes Modell, wenn sich anhand derselben Abnahmeregel ein nützlicher Gewinn zeigt. Ein günstigeres Modell kann bei mehr Nacharbeit je angenommener Aufgabe teurer werden; ein langsameres Modell kann sich für einen Hintergrundschritt eignen, aber für eine interaktive Aufgabe ungeeignet sein.

Prüfen Sie vor der Veröffentlichung die tatsächlichen Raten- und Ausgabenlimits des Projekts, Datenkontrollen, Zeitüberschreitungen, Wiederholungsverhalten, Überwachung und Freigabegrenzen durch Menschen anhand von OpenAIs Checkliste für den produktiven Einsatz. Richten Sie auch nach der Veröffentlichung stichprobenartige Prüfungen ein und führen Sie das Arbeitsblatt erneut aus, wenn sich Modellalias, Prompt, Werkzeug oder Arbeitslast ändern. Verwenden Sie die Aufgabendaten anschließend für die Auswahl des Modells.

Quellen und weiterführende Informationen

  • OpenAIs GPT-6-Familienleitfaden vom 2. Oktober enthält Empfehlungen des Anbieters zu Modellen, Denkaufwand, Anweisungen und länger laufenden Arbeitsabläufen. Er berichtet weder über Testergebnisse von BIG CHANGE noch darüber, welches Modell für die Arbeitslast eines bestimmten Teams am besten geeignet ist.
  • GPT-6 Luna, GPT-6.1 Sol und GPT-6 Astra dokumentieren die hier verwendeten API-IDs, unterstützten Denkaufwandsstufen, Kontextgrößen, Preise und gestaffelten Limits. Der aktuelle Kontozugang und die Abrechnung müssen weiterhin geprüft werden.
  • OpenAIs Checkliste für den API-Einsatz stützt die Empfehlung, repräsentative Aufgaben zu bewerten, die Responses API zu konfigurieren und Produktionskontrollen einzuplanen. Das obige Arbeitsblatt ist eine von BIG CHANGE vorgeschlagene Methode, kein Benchmark des Anbieters.
  • Strukturierte Ausgaben, Komprimierung und Hintergrundmodus erläutern die im Arbeitsablauf genannten Schnittstellen.