Le 29 septembre, dans son récapitulatif du DevDay, OpenAI a annoncé l’arrivée de l’utilisation de l’ordinateur dans l’API Agents. Notre guide de lancement du DevDay présente le lancement dans son ensemble. Pour un développeur, la tâche immédiate est plus limitée que celle d’un agent de navigateur généraliste : ouvrir une page publique, recueillir une réponse précise et savoir ce que le navigateur a consulté. Le guide sur l’utilisation de l’ordinateur d’OpenAI, consulté le 30 septembre, décrit ce parcours au moyen d’une session de navigateur hébergée. BIG CHANGE a examiné la documentation, sans exécuter l’API.
L’application crée la session, envoie l’entrée, suit les événements, présente à l’utilisateur les demandes d’accès à des sites Web, vérifie la réponse et nettoie l’environnement. L’agent peut utiliser le navigateur dans l’environnement hébergé. La fin d’un tour ne prouve pas que les informations demandées sont exactes.
Le grand changement
La nouvelle fonction d’utilisation de l’ordinateur de l’API Agents d’OpenAI fournit aux développeurs une session de navigateur hébergée, un flux d’événements, des décisions de l’utilisateur concernant les origines Web, des journaux d’activité du navigateur et un nettoyage par l’API. Pour une tâche limitée à une page publique, l’intégration pratique consiste à traiter explicitement chaque étape et à vérifier le titre et l’URL renvoyés. L’accès à une origine, la fin d’un tour et l’exactitude de la réponse sont trois constats distincts.
Commencer par une clé API et une session de navigateur
Le guide de démarrage de l’API Agents d’OpenAI demande une clé API d’application dans un projet OpenAI Platform. Il indique api.agents.read et api.agents.write pour les opérations de session, et api.responses.write pour l’inférence du modèle. Exportez la clé sous le nom OPENAI_API_KEY dans l’environnement de l’application et gardez-la hors du bac à sable de l’agent. Utilisez une version actuelle du SDK OpenAI compatible avec l’API Agents bêta ; le tutoriel JavaScript du guide sur l’utilisation de l’ordinateur utilise openai et prompt-sync. L’alternative cURL nécessite Bash, jq et l’en-tête explicite OpenAI-Beta: agents=v1.
La configuration de session documentée place { "type": "computer_use" } dans agent.tools, définit environment.type sur openai_hosted et active environment.desktop.enabled. L’exemple de page publique active aussi l’accès réseau et définit include_screenshots: true pour l’outil. La création de session renvoie un identifiant destiné aux demandes ultérieures d’événements et d’éléments ; elle ne lance pas la tâche du navigateur. Enregistrez cet identifiant avant de poursuivre. L’exemple du guide demande à l’agent de trouver la page de démarrage de l’API Agents et d’en renvoyer le titre et l’URL, sans se connecter ni modifier les données du site.
Suivre la tâche et décider des sites auxquels elle peut accéder
Ouvrez le flux d’événements de la session avant d’envoyer l’entrée de la tâche afin que l’application reçoive les premiers événements. L’entrée documentée est un agent.session.input.message. Lorsque le flux signale agent.session.requires_action, récupérez le required_actions actuel de la session et repérez les enregistrements computer_use_approval_request en attente. Pour une demande browser_origin_access, indiquez à l’utilisateur l’origine demandée et tout motif fourni. Envoyez sa décision approve, deny ou cancel sous la forme d’un agent.session.input.computer_use_approval_request_result avec le request_id correspondant.
Cette décision concerne l’accès à l’origine d’un site Web, même si celui-ci est public. Définir network.access sur enabled ne vaut pas autorisation. L’autorisation d’une origine ne confirme pas non plus chacune des actions ultérieures du navigateur. OpenAI indique que les applications qui exigent une confirmation garantie avant un achat ou une modification destructive doivent limiter le navigateur hébergé à des ressources incapables d’effectuer ces actions, ou utiliser un moteur de navigateur qu’elles contrôlent. Le texte des sites Web est une entrée non fiable : il ne peut ni autoriser un accès ni remplacer les instructions de l’utilisateur.
Le parcours sur une page publique annule une demande distincte de browser_authentication. Une tâche nécessitant un compte suit son propre parcours de connexion ; cette configuration en lecture seule ne le couvre pas. OpenAI précise aussi que l’annulation d’une demande d’autorisation n’annule pas la tâche. Une réponse d’autorisation acceptée signifie que la décision a été reçue, pas que la navigation est terminée.
Vérifier le résultat, examiner l’activité, puis supprimer la session
Le flux d’événements peut fournir le texte de la réponse dans agent.session.turn.output_text.done. Attendez agent.session.turn.completed pour le tour principal et traitez séparément les événements d’échec et d’annulation. Pour la tâche documentée, vérifiez que la réponse contient réellement le titre et l’URL de la page de démarrage. La fermeture du flux ne prouve pas à elle seule que le tour est terminé ; après une perte de connexion ou un résultat incertain, OpenAI recommande de reprendre la même session.
Les éléments de session donnent un autre aperçu du travail du navigateur. Les éléments computer_use_call comprennent un titre d’activité, l’identifiant du tour et son état. Lorsque les captures d’écran sont activées, un élément peut inclure une URL d’image computer_screenshot ; certaines opérations ne renvoient toujours aucune image. Ces éléments montrent des opérations du navigateur, pas un verdict final sur la tâche. Avant de supprimer la session pour demander le nettoyage de l’environnement, examinez les éléments enregistrés ainsi que tout résultat ou toute capture nécessaire à l’application. Les captures peuvent contenir des données sensibles sur une page ou un compte ; la documentation recommande donc d’en réserver l’accès aux personnes autorisées et de ne pas les inclure dans les journaux de l’application.
L’accès et le coût sont deux décisions distinctes
Dans son récapitulatif du DevDay, OpenAI indique que l’utilisation de l’ordinateur est disponible par l’API ainsi que dans Codex et ChatGPT Work avec les offres Pro 500 et Enterprise. Ce guide porte sur la voie de l’API, qui nécessite des identifiants et des autorisations Platform. La présentation des offres du produit ne donne pas accès à l’API et n’inclut pas les frais d’utilisation de l’API.
La présentation de l’API Agents indique que l’utilisation du modèle est facturée selon les tarifs API du modèle sélectionné, tandis que les bacs à sable hébergés par OpenAI sont soumis aux tarifs standard des conteneurs. Les pages consultées ne mentionnent aucuns frais distincts pour l’outil d’utilisation de l’ordinateur ; cela ne signifie pas qu’une session de navigateur hébergée est gratuite. Vérifiez les prix actuels des modèles et des conteneurs avant d’établir le budget d’une exécution. Les exemples utilisent des méthodes d’API bêta susceptibles d’évoluer. Aucune session API, tâche de navigateur ou exécution de SDK n’a été effectuée pour cet article.
Sources et lectures complémentaires
- OpenAI, « Computer use », consulté le 30 septembre 2026. Référence principale pour la configuration du navigateur, les noms d’événements, les demandes relatives aux origines et à l’authentification, la vérification des résultats, l’activité et la suppression. La page n’affichait pas de date de publication.
- OpenAI, « Agents API quickstart », consulté le 30 septembre 2026. Précise les autorisations des clés Platform, l’en-tête bêta et les prérequis du SDK ; son exemple général de programmation diffère du parcours d’utilisation de l’ordinateur.
- OpenAI, « Agents API » et « OpenAI-hosted sandboxes », consultés le 30 septembre 2026. Expliquent le modèle de session et la facturation distincte du modèle et du conteneur hébergé. Aucune des deux pages n’indiquait de date de publication.
- Tarifs de l’API OpenAI, consultés le 30 septembre 2026. Il convient de vérifier les tarifs actuels du modèle sélectionné et du conteneur hébergé ; aucun coût précis par exécution n’est estimé ici.
- OpenAI, « DevDay 2026 Recap », publié le 29 septembre 2026. Source de l’annonce et des déclarations distinctes d’OpenAI sur la disponibilité de l’API et celle des offres Pro 500 et Enterprise de Codex/ChatGPT Work.



