OpenAIs Rückblick auf den DevDay kündigte am 29. September Computer Use in der Agents API an. Unser Leitfaden zur DevDay-Veröffentlichung behandelt die weiteren Neuerungen. Für Entwickler ist die unmittelbare Aufgabe kleiner als ein allgemeiner Browser-Agent: eine öffentliche Seite öffnen, eine bestimmte Information abrufen und nachvollziehen, worauf der Browser zugegriffen hat. OpenAIs Anleitung zu Computer Use, geprüft am 30. September, beschreibt diesen Ablauf in einer gehosteten Browsersitzung. BIG CHANGE hat die Dokumentation geprüft, die API aber nicht ausgeführt.
Die Anwendung erstellt die Sitzung, sendet eine Eingabe, verfolgt Ereignisse, legt Anfragen an Website-Origins dem Nutzer vor, prüft die Antwort und räumt anschließend auf. Der Agent kann den Browser in der gehosteten Umgebung bedienen. Ein abgeschlossener Durchlauf beweist nicht, dass die angefragte Information richtig ist.
Die große Änderung
OpenAIs neuer Weg zu Computer Use in der Agents API bietet Entwicklern eine gehostete Browsersitzung mit Ereignisstrom, Nutzerentscheidungen zu Website-Origins, Browser-Aktivitätsprotokollen und Aufräumfunktionen über die API. Für eine klar begrenzte Aufgabe auf einer öffentlichen Seite besteht die praktische Integration darin, diese Schritte ausdrücklich zu behandeln und den zurückgegebenen Titel sowie die URL zu prüfen. Der Zugriff auf einen Origin, der Abschluss eines Durchlaufs und die Richtigkeit der Antwort sind drei unterschiedliche Beobachtungen.
Mit API-Schlüssel und Browsersitzung beginnen
OpenAIs Schnellstart für die Agents API setzt einen API-Schlüssel für eine Anwendung in einem OpenAI-Platform-Projekt voraus. Dort werden api.agents.read und api.agents.write für Sitzungsoperationen sowie api.responses.write für die Modellausführung angegeben. Exportieren Sie den Schlüssel in der Anwendungsumgebung als OPENAI_API_KEY und halten Sie ihn außerhalb der Agenten-Sandbox. Verwenden Sie ein aktuelles OpenAI-SDK mit der Beta-Version der Agents API; das JavaScript-Beispiel in der Anleitung zu Computer Use verwendet openai und prompt-sync. Die cURL-Alternative setzt Bash sowie jq und den ausdrücklichen Header OpenAI-Beta: agents=v1 voraus.
In der dokumentierten Sitzungskonfiguration wird { "type": "computer_use" } auf agent.tools festgelegt, environment.type erhält den Wert openai_hosted und environment.desktop.enabled wird aktiviert. Das Beispiel für eine öffentliche Seite aktiviert außerdem den Netzwerkzugriff und setzt include_screenshots: true für das Werkzeug. Beim Erstellen der Sitzung wird eine ID für spätere Ereignis- und Elementanfragen zurückgegeben; damit beginnt die Browseraufgabe noch nicht. Speichern Sie die ID, bevor Sie fortfahren. Im Beispiel soll der Agent den Schnellstart für die Agents API finden und Seitentitel sowie URL zurückgeben, ohne sich anzumelden oder Website-Daten zu ändern.
Aufgabe verfolgen und erreichbare Websites begrenzen
Öffnen Sie den Ereignisstrom der Sitzung, bevor Sie die Aufgabeneingabe senden. So kann die Anwendung frühe Ereignisse empfangen. Als Eingabe ist ein agent.session.input.message dokumentiert. Meldet der Ereignisstrom agent.session.requires_action, rufen Sie den aktuellen required_actions der Sitzung ab und ermitteln Sie offene Datensätze vom Typ computer_use_approval_request. Bei einer Anfrage browser_origin_access zeigen Sie dem Nutzer den angefragten Origin und einen gegebenenfalls angegebenen Grund. Übermitteln Sie seine Entscheidung approve, deny oder cancel als agent.session.input.computer_use_approval_request_result mit dem passenden request_id.
Bei dieser Entscheidung geht es um den Zugriff auf einen Website-Origin, auch auf einen öffentlichen. network.access auf enabled zu setzen, ersetzt die Genehmigung nicht. Eine Genehmigung für einen Origin bestätigt auch nicht jede spätere Browseraktion. OpenAI zufolge sollten Anwendungen, die vor Käufen oder destruktiven Änderungen eine verbindliche Bestätigung benötigen, den gehosteten Browser auf Ressourcen beschränken, die solche Aktionen nicht ausführen können, oder eine Browserumgebung unter eigener Kontrolle verwenden. Website-Inhalte sind nicht vertrauenswürdige Eingaben und können weder Zugriff genehmigen noch Anweisungen des Nutzers außer Kraft setzen.
Das Beispiel für öffentliche Seiten bricht eine separate Anfrage vom Typ browser_authentication ab. Für eine Aufgabe, die ein Konto erfordert, gibt es einen eigenen Anmeldeablauf; diese schreibgeschützte Einrichtung behandelt ihn nicht. OpenAI weist außerdem darauf hin, dass das Abbrechen einer Genehmigungsanfrage nicht die Aufgabe beendet. Eine angenommene Genehmigungsantwort bedeutet, dass die Entscheidung empfangen wurde, nicht dass die Navigation abgeschlossen ist.
Ergebnis prüfen, Aktivität durchsehen, dann Sitzung löschen
Der Ereignisstrom kann Antworttext in agent.session.turn.output_text.done liefern. Warten Sie beim Hauptdurchlauf auf agent.session.turn.completed und behandeln Sie Fehler- und Abbruchereignisse gesondert. Prüfen Sie bei der dokumentierten Aufgabe, ob die Antwort tatsächlich Titel und URL des Schnellstarts enthält. Ein geschlossener Ereignisstrom belegt allein nicht, dass der Durchlauf beendet wurde. OpenAI empfiehlt Entwicklern, bei einem Verbindungsfehler oder unklarem Ergebnis dieselbe Sitzung wiederherzustellen.
Sitzungselemente bieten eine zweite Ansicht der Browseraktivitäten. computer_use_call-Elemente enthalten einen Aktivitätstitel, die Turn-ID und den Status. Wenn Screenshots aktiviert sind, kann ein Element eine Bild-URL vom Typ computer_screenshot enthalten; manche Vorgänge liefern weiterhin kein Bild zurück. Die Elemente zeigen Browseraktionen, aber kein endgültiges Urteil über die Aufgabe. Prüfen Sie die gespeicherten Elemente sowie jedes Ergebnis und jeden Screenshot, den Ihre Anwendung benötigt, bevor Sie die Sitzung löschen und damit die Bereinigung der Umgebung anfordern. Screenshots können vertrauliche Seiten- oder Kontoinformationen enthalten. Laut Dokumentation sollten sie nur autorisierten Personen zugänglich und nicht in Anwendungsprotokollen gespeichert werden.
Zugriff und Kosten sind getrennte Entscheidungen
OpenAI erklärt in seinem Rückblick auf den DevDay, Computer Use sei über die API sowie in Codex und ChatGPT Work mit Pro 500 und Enterprise verfügbar. Dieser Leitfaden behandelt den API-Weg, für den Platform-Zugangsdaten und Berechtigungen erforderlich sind. Die Aussage zu Produktplänen gewährt keinen API-Zugriff und schließt API-Nutzungskosten nicht ein.
Die Übersicht zur Agents API besagt, dass die Modellnutzung zum API-Preis des ausgewählten Modells abgerechnet wird, während von OpenAI gehostete Sandboxes zu den üblichen Containerpreisen berechnet werden. Auf den geprüften Seiten ist keine separate Gebühr für das Computer-Use-Werkzeug aufgeführt; dadurch wird eine gehostete Browsersitzung nicht kostenlos. Prüfen Sie vor einer Budgetplanung die aktuellen Preise für Modelle und Container. Die Beispiele verwenden Beta-API-Methoden, die sich ändern können. Für diesen Artikel wurden weder eine API-Sitzung noch eine Browseraufgabe oder SDK-Ausführung durchgeführt.
Quellen und weiterführende Informationen
- OpenAI: „Computer Use“, abgerufen am 30. September 2026. Die wichtigste Quelle zu Browserkonfiguration, Ereignisnamen, Anfragen für Origins und Anmeldung, Ergebnisprüfung, Aktivität und Löschen. Die Seite nannte kein Veröffentlichungsdatum.
- OpenAI: „Schnellstart für die Agents API“, abgerufen am 30. September 2026. Nennt Berechtigungen für Platform-Schlüssel, den Beta-Header und SDK-Voraussetzungen; das allgemeine Programmierbeispiel ist vom Browserbeispiel getrennt.
- OpenAI: „Agents API“ und „Von OpenAI gehostete Sandboxes“, abgerufen am 30. September 2026. Erläutern das Sitzungsmodell sowie getrennte Gebühren für Modellnutzung und gehostete Container. Keine der beiden Seiten nannte ein Veröffentlichungsdatum.
- Preise der OpenAI API, abgerufen am 30. September 2026. Die aktuellen Preise für das ausgewählte Modell und den gehosteten Container sollten geprüft werden; hier wird kein konkreter Preis pro Durchlauf geschätzt.
- OpenAI: „Rückblick auf den DevDay 2026“, veröffentlicht am 29. September 2026. Quelle für die Einführung und OpenAIs getrennte Angaben zur Verfügbarkeit über die API beziehungsweise in den Produktplänen für Codex und ChatGPT Work Pro 500 und Enterprise.



