AI-translated from English; not yet reviewed by a fluent editor.

# Eine Browseraufgabe mit Computer Use über die OpenAI Agents API einrichten

> Ein dokumentationsbasierter Leitfaden zum Erstellen einer Browsersitzung mit der OpenAI Agents API, zum Umgang mit Anfragen für Website-Origins, zur Ergebnisprüfung und zum Löschen der Sitzung.

By BIG CHANGE Editorial

Published: 2026-09-30T01:36:49.389Z
Updated: 2026-09-30T01:36:49.389Z
Canonical: https://bigchange.ai/blog/openai-agents-api-computer-use-browser-guide

![Conceptual illustration of a developer viewing a generic public webpage on one desktop display and three browser activity images on another.](https://bigchange.ai/api/media/file/agents-computer-use-browser-review-hero-v1.png)
AI-generated by OpenAI; BIG CHANGE conceptual editorial illustration.

OpenAIs [Rückblick auf den DevDay](https://openai.com/index/devday-2026-recap/) kündigte am 29. September Computer Use in der Agents API an. Unser [Leitfaden zur DevDay-Veröffentlichung](https://bigchange.ai/blog/openai-devday-2026-launches-availability-guide) behandelt die weiteren Neuerungen. Für Entwickler ist die unmittelbare Aufgabe kleiner als ein allgemeiner Browser-Agent: eine öffentliche Seite öffnen, eine bestimmte Information abrufen und nachvollziehen, worauf der Browser zugegriffen hat. OpenAIs [Anleitung zu Computer Use](https://developers.openai.com/api/docs/guides/agents-api/tools/computer-use), geprüft am 30. September, beschreibt diesen Ablauf in einer gehosteten Browsersitzung. BIG CHANGE hat die Dokumentation geprüft, die API aber nicht ausgeführt.

Die Anwendung erstellt die Sitzung, sendet eine Eingabe, verfolgt Ereignisse, legt Anfragen an Website-Origins dem Nutzer vor, prüft die Antwort und räumt anschließend auf. Der Agent kann den Browser in der gehosteten Umgebung bedienen. Ein abgeschlossener Durchlauf beweist nicht, dass die angefragte Information richtig ist.

## Die große Änderung

OpenAIs neuer Weg zu Computer Use in der Agents API bietet Entwicklern eine gehostete Browsersitzung mit Ereignisstrom, Nutzerentscheidungen zu Website-Origins, Browser-Aktivitätsprotokollen und Aufräumfunktionen über die API. Für eine klar begrenzte Aufgabe auf einer öffentlichen Seite besteht die praktische Integration darin, diese Schritte ausdrücklich zu behandeln und den zurückgegebenen Titel sowie die URL zu prüfen. Der Zugriff auf einen Origin, der Abschluss eines Durchlaufs und die Richtigkeit der Antwort sind drei unterschiedliche Beobachtungen.

## Mit API-Schlüssel und Browsersitzung beginnen

OpenAIs [Schnellstart für die Agents API](https://developers.openai.com/api/docs/guides/agents-api/quickstart#prerequisites) setzt einen API-Schlüssel für eine Anwendung in einem OpenAI-Platform-Projekt voraus. Dort werden `api.agents.read` und `api.agents.write` für Sitzungsoperationen sowie `api.responses.write` für die Modellausführung angegeben. Exportieren Sie den Schlüssel in der Anwendungsumgebung als `OPENAI_API_KEY` und halten Sie ihn außerhalb der Agenten-Sandbox. Verwenden Sie ein aktuelles OpenAI-SDK mit der Beta-Version der Agents API; das JavaScript-Beispiel in der Anleitung zu Computer Use verwendet `openai` und `prompt-sync`. Die cURL-Alternative setzt Bash sowie `jq` und den ausdrücklichen Header `OpenAI-Beta: agents=v1` voraus.

In der dokumentierten Sitzungskonfiguration wird `{ "type": "computer_use" }` auf `agent.tools` festgelegt, `environment.type` erhält den Wert `openai_hosted` und `environment.desktop.enabled` wird aktiviert. Das Beispiel für eine öffentliche Seite aktiviert außerdem den Netzwerkzugriff und setzt `include_screenshots: true` für das Werkzeug. Beim Erstellen der Sitzung wird eine ID für spätere Ereignis- und Elementanfragen zurückgegeben; damit beginnt die Browseraufgabe noch nicht. Speichern Sie die ID, bevor Sie fortfahren. Im Beispiel soll der Agent den Schnellstart für die Agents API finden und Seitentitel sowie URL zurückgeben, ohne sich anzumelden oder Website-Daten zu ändern.

## Aufgabe verfolgen und erreichbare Websites begrenzen

Öffnen Sie den Ereignisstrom der Sitzung, bevor Sie die Aufgabeneingabe senden. So kann die Anwendung frühe Ereignisse empfangen. Als Eingabe ist ein `agent.session.input.message` dokumentiert. Meldet der Ereignisstrom `agent.session.requires_action`, rufen Sie den aktuellen `required_actions` der Sitzung ab und ermitteln Sie offene Datensätze vom Typ `computer_use_approval_request`. Bei einer Anfrage `browser_origin_access` zeigen Sie dem Nutzer den angefragten Origin und einen gegebenenfalls angegebenen Grund. Übermitteln Sie seine Entscheidung `approve`, `deny` oder `cancel` als `agent.session.input.computer_use_approval_request_result` mit dem passenden `request_id`.

Bei dieser Entscheidung geht es um den Zugriff auf einen Website-Origin, auch auf einen öffentlichen. `network.access` auf `enabled` zu setzen, ersetzt die Genehmigung nicht. Eine Genehmigung für einen Origin bestätigt auch nicht jede spätere Browseraktion. OpenAI zufolge sollten Anwendungen, die vor Käufen oder destruktiven Änderungen eine verbindliche Bestätigung benötigen, den gehosteten Browser auf Ressourcen beschränken, die solche Aktionen nicht ausführen können, oder eine Browserumgebung unter eigener Kontrolle verwenden. Website-Inhalte sind nicht vertrauenswürdige Eingaben und können weder Zugriff genehmigen noch Anweisungen des Nutzers außer Kraft setzen.

Das Beispiel für öffentliche Seiten bricht eine separate Anfrage vom Typ `browser_authentication` ab. Für eine Aufgabe, die ein Konto erfordert, gibt es einen eigenen [Anmeldeablauf](https://developers.openai.com/api/docs/guides/agents-api/tools/computer-use#handle-sign-in); diese schreibgeschützte Einrichtung behandelt ihn nicht. OpenAI weist außerdem darauf hin, dass das Abbrechen einer Genehmigungsanfrage nicht die Aufgabe beendet. Eine angenommene Genehmigungsantwort bedeutet, dass die Entscheidung empfangen wurde, nicht dass die Navigation abgeschlossen ist.

## Ergebnis prüfen, Aktivität durchsehen, dann Sitzung löschen

Der Ereignisstrom kann Antworttext in `agent.session.turn.output_text.done` liefern. Warten Sie beim Hauptdurchlauf auf `agent.session.turn.completed` und behandeln Sie Fehler- und Abbruchereignisse gesondert. Prüfen Sie bei der dokumentierten Aufgabe, ob die Antwort tatsächlich Titel und URL des Schnellstarts enthält. Ein geschlossener Ereignisstrom belegt allein nicht, dass der Durchlauf beendet wurde. OpenAI empfiehlt Entwicklern, bei einem Verbindungsfehler oder unklarem Ergebnis dieselbe Sitzung wiederherzustellen.

Sitzungselemente bieten eine zweite Ansicht der Browseraktivitäten. `computer_use_call`-Elemente enthalten einen Aktivitätstitel, die Turn-ID und den Status. Wenn Screenshots aktiviert sind, kann ein Element eine Bild-URL vom Typ `computer_screenshot` enthalten; manche Vorgänge liefern weiterhin kein Bild zurück. Die Elemente zeigen Browseraktionen, aber kein endgültiges Urteil über die Aufgabe. Prüfen Sie die gespeicherten Elemente sowie jedes Ergebnis und jeden Screenshot, den Ihre Anwendung benötigt, bevor Sie die Sitzung löschen und damit die Bereinigung der Umgebung anfordern. Screenshots können vertrauliche Seiten- oder Kontoinformationen enthalten. Laut Dokumentation sollten sie nur autorisierten Personen zugänglich und nicht in Anwendungsprotokollen gespeichert werden.

## Zugriff und Kosten sind getrennte Entscheidungen

OpenAI erklärt in seinem [Rückblick auf den DevDay](https://openai.com/index/devday-2026-recap/), Computer Use sei über die API sowie in Codex und ChatGPT Work mit Pro 500 und Enterprise verfügbar. Dieser Leitfaden behandelt den API-Weg, für den Platform-Zugangsdaten und Berechtigungen erforderlich sind. Die Aussage zu Produktplänen gewährt keinen API-Zugriff und schließt API-Nutzungskosten nicht ein.

Die [Übersicht zur Agents API](https://developers.openai.com/api/docs/guides/agents-api/overview) besagt, dass die Modellnutzung zum [API-Preis des ausgewählten Modells](https://developers.openai.com/api/docs/pricing) abgerechnet wird, während von OpenAI gehostete Sandboxes zu den üblichen [Containerpreisen](https://developers.openai.com/api/docs/pricing#built-in-tools) berechnet werden. Auf den geprüften Seiten ist keine separate Gebühr für das Computer-Use-Werkzeug aufgeführt; dadurch wird eine gehostete Browsersitzung nicht kostenlos. Prüfen Sie vor einer Budgetplanung die aktuellen Preise für Modelle und Container. Die Beispiele verwenden Beta-API-Methoden, die sich ändern können. Für diesen Artikel wurden weder eine API-Sitzung noch eine Browseraufgabe oder SDK-Ausführung durchgeführt.

## Quellen und weiterführende Informationen

- [OpenAI: „Computer Use“](https://developers.openai.com/api/docs/guides/agents-api/tools/computer-use), abgerufen am 30. September 2026. Die wichtigste Quelle zu Browserkonfiguration, Ereignisnamen, Anfragen für Origins und Anmeldung, Ergebnisprüfung, Aktivität und Löschen. Die Seite nannte kein Veröffentlichungsdatum.
- [OpenAI: „Schnellstart für die Agents API“](https://developers.openai.com/api/docs/guides/agents-api/quickstart), abgerufen am 30. September 2026. Nennt Berechtigungen für Platform-Schlüssel, den Beta-Header und SDK-Voraussetzungen; das allgemeine Programmierbeispiel ist vom Browserbeispiel getrennt.
- [OpenAI: „Agents API“](https://developers.openai.com/api/docs/guides/agents-api/overview) und [„Von OpenAI gehostete Sandboxes“](https://developers.openai.com/api/docs/guides/agents-api/environments/openai-hosted), abgerufen am 30. September 2026. Erläutern das Sitzungsmodell sowie getrennte Gebühren für Modellnutzung und gehostete Container. Keine der beiden Seiten nannte ein Veröffentlichungsdatum.
- [Preise der OpenAI API](https://developers.openai.com/api/docs/pricing), abgerufen am 30. September 2026. Die aktuellen Preise für das ausgewählte Modell und den gehosteten Container sollten geprüft werden; hier wird kein konkreter Preis pro Durchlauf geschätzt.
- [OpenAI: „Rückblick auf den DevDay 2026“](https://openai.com/index/devday-2026-recap/), veröffentlicht am 29. September 2026. Quelle für die Einführung und OpenAIs getrennte Angaben zur Verfügbarkeit über die API beziehungsweise in den Produktplänen für Codex und ChatGPT Work Pro 500 und Enterprise.

## Sources

- [Computer Use | OpenAI API](https://developers.openai.com/api/docs/guides/agents-api/tools/computer-use) — Primäre Dokumentation zu Browseraufgaben: gehostete Umgebung, Ereignis- und Genehmigungsnamen, Ergebnisprüfung, Aktivität, Screenshots und Löschen. Dokumentation, kein Test von BIG CHANGE.
- [Schnellstart für die Agents API | OpenAI API](https://developers.openai.com/api/docs/guides/agents-api/quickstart) — Berechtigungen für Platform-Anwendungsschlüssel, SDK-Einrichtung, Beta-Header und Sitzungsablauf. Das allgemeine Programmierbeispiel unterscheidet sich vom Beispiel zu Computer Use.
- [Agents API | OpenAI API](https://developers.openai.com/api/docs/guides/agents-api/overview) — Dokumentiert das verwaltete Sitzungsmodell und die getrennte Abrechnung der Modellnutzung, der OpenAI-Werkzeuge und gehosteter Sandboxes.
- [Von OpenAI gehostete Sandboxes | OpenAI API](https://developers.openai.com/api/docs/guides/agents-api/environments/openai-hosted) — Bestätigt Standard-Containerpreise für von OpenAI gehostete Sandboxes, getrennte Modellabrechnung und das Löschen als Aufforderung zur Bereinigung der Umgebung.
- [Preise | OpenAI API](https://developers.openai.com/api/docs/pricing) — Aktuelle Modell- und Containerpreise. Die geprüften Seiten nennen keine separate Gebühr für das Computer-Use-Werkzeug; eine Kostenschätzung pro Durchlauf wird nicht vorgenommen.
- [Rückblick auf den DevDay 2026 | OpenAI](https://openai.com/index/devday-2026-recap/) — Ankündigung des Anbieters zu Computer Use in der Agents API und zur getrennten Verfügbarkeit über die API sowie in Codex und ChatGPT Work mit Pro 500 und Enterprise.
