OpenAI 在 9 月 29 日的DevDay 回顾中宣布 Agents API 支持电脑操作。我们的DevDay 发布指南介绍了更全面的发布内容。对于开发者,眼前的任务比通用浏览器代理更简单:打开一个公开页面,获取特定答案,并记录浏览器访问过什么。OpenAI 的 电脑操作指南 于 9 月 30 日查阅,介绍了通过托管浏览器会话完成这一流程。BIG CHANGE 审阅了文档,但没有运行 API。

应用程序创建会话、发送输入、跟踪事件、向用户展示网站来源请求、检查答案并进行清理。代理可以在托管环境中操作浏览器。一个轮次完成,并不能证明所需信息准确。

重大变化

OpenAI 新推出的 Agents API 电脑操作路径,为开发者提供带有事件流的托管浏览器会话、由用户决定是否访问网站来源、浏览器活动记录,以及通过 API 清理环境的能力。对于范围明确的公开页面任务,实用的集成方式是明确处理这些阶段,并核对返回的标题和 URL。能否访问某个来源、一个轮次是否完成、答案是否正确,是三个不同的观察结果。

从 API 密钥和浏览器会话开始

OpenAI 的 Agents API 快速入门 要求在 OpenAI Platform 项目中使用应用程序 API 密钥。文档指定 api.agents.read 和 api.agents.write 用于会话操作,并使用 api.responses.write 进行模型推理。请在应用程序环境中将密钥导出为 OPENAI_API_KEY,并将其保存在代理沙箱之外。请使用支持 Agents API 测试版的当前 OpenAI SDK;电脑操作指南中的 JavaScript 示例使用 openai 和 prompt-sync。其 cURL 替代方法需要 Bash、jq,以及明确的 OpenAI-Beta: agents=v1 请求头。

文档中的会话配置将 { "type": "computer_use" } 放在 agent.tools 中,把 environment.type 设置为 openai_hosted,并启用 environment.desktop.enabled。公开页面示例还会启用网络访问,并在工具上设置 include_screenshots: true。创建会话会返回 ID,供之后请求事件和条目时使用;这并不会启动浏览器任务。继续之前先保存该 ID。指南示例要求代理找到 Agents API 快速入门页面,并返回页面标题和 URL,不登录网站,也不更改网站数据。

跟踪任务,并决定它可以访问哪些网站

发送任务输入之前,先打开会话事件流,以便应用程序接收早期事件。文档中的输入是 agent.session.input.message。当事件流报告 agent.session.requires_action 时,获取会话当前的 required_actions,并找出待处理的 computer_use_approval_request 记录。对于 browser_origin_access 请求,向用户显示所请求的来源及说明的理由。将用户的 approve、deny 或 cancel 决定作为 agent.session.input.computer_use_approval_request_result 发送,并附上对应的 request_id。

这一决定涉及是否访问某个网站来源,即使该网站是公开的也是如此。将 network.access 设置为 enabled 并不等于获得了审批。来源审批也不能确认之后的每项浏览器操作。OpenAI 表示,如果应用程序要求在购买或破坏性更改之前得到确切确认,就应把托管浏览器限制在无法执行这些操作的资源上,或者使用由应用程序控制的浏览器运行时。网站文本是不可信输入,不能授权访问,也不能覆盖用户的指示。

公开页面示例会取消一个单独的 browser_authentication 请求。需要账户的任务有自己的 登录流程;这个只读设置不涵盖该流程。OpenAI 还指出,取消审批请求并不会取消任务。审批响应被接受,表示已收到决定,并不表示导航已经完成。

检查结果、查看活动,然后删除会话

事件流可以在 agent.session.turn.output_text.done 中提供答案文本。主要轮次应等待 agent.session.turn.completed,并分别处理失败和取消事件。对于文档中的任务,要检查答案是否确实包含快速入门页面的标题和 URL。仅仅关闭事件流并不能证明轮次已经结束;如果连接中断或结果不确定,OpenAI 建议开发者恢复同一个会话。

会话条目从另一个角度展示浏览器工作。computer_use_call 条目包含活动标题、轮次 ID 和状态。启用屏幕截图后,条目可能带有 computer_screenshot 图片 URL;有些操作仍不会返回图片。这些条目展示的是浏览器操作,并不是对任务的最终判断。删除会话以请求清理环境之前,请检查已保存的条目以及应用程序需要的任何结果或屏幕截图。屏幕截图可能包含敏感页面或账户信息,因此文档建议仅向获授权者开放,并避免写入应用程序日志。

访问权限和费用是两个不同的问题

OpenAI 在其 DevDay 回顾 中表示,电脑操作可通过 API 使用,也可在 Pro 500 和 Enterprise 方案的 Codex 与 ChatGPT Work 中使用。本指南介绍的是 API 路径,需要 Platform 凭据和权限。产品方案的说明不会授予 API 访问权限,也不包含 API 使用费用。

根据 Agents API 概览,模型使用量按所选模型的 API 费率计费,而 OpenAI 托管沙箱采用标准 容器费率。已查阅的页面没有列出单独的电脑操作工具费用;但这不表示托管浏览器会话免费。规划运行预算前,请查看当前的模型和容器价格。示例使用的测试版 API 方法可能会变化。本文没有创建 API 会话、执行浏览器任务或运行 SDK。

来源与延伸阅读

  • OpenAI,《Computer use》,查阅于 2026 年 9 月 30 日。关于浏览器配置、事件名称、来源和身份验证请求、结果检查、活动及删除的主要参考资料。页面未显示发布日期。
  • OpenAI,《Agents API quickstart》,查阅于 2026 年 9 月 30 日。说明 Platform 密钥权限、测试版请求头和 SDK 前置条件;其中的一般编程示例不同于电脑操作教程。
  • OpenAI,《Agents API》 和 《OpenAI-hosted sandboxes》,查阅于 2026 年 9 月 30 日。介绍会话模型以及模型与托管容器费用的分别计费。这两个页面都没有提供发布日期。
  • OpenAI API 定价,查阅于 2026 年 9 月 30 日。应核对所选模型和托管容器的当前费率;本文未估算单次运行的具体费用。
  • OpenAI,《DevDay 2026 Recap》,发布于 2026 年 9 月 29 日。关于功能发布,以及 OpenAI 分别说明 API 可用性和 Codex/ChatGPT Work Pro 500 与 Enterprise 方案可用性的来源。