2026年第二季度,近五分之二的美国在职成年人表示,过去一周曾将生成式AI用于工作。不过,根据圣路易斯联储、范德堡大学和哈佛大学研究人员开展的全国人口调查追踪,AI辅助完成的工时占所有在职成年人总工时的6.3%。前一个数字统计人数,后一个数字统计时间。两者都没有说明工作质量如何、公司收入是否增加,或是否有人失去工作。

在讨论其他工作是否会像软件开发一样高强度地使用AI时,这些区别很重要。平台记录显示,法律、销售和市场营销等领域的尝试有所增加。实验也显示,AI在一些非编程任务中确实能带来提升,但仅仅获得使用权限有时几乎没有影响,润色得很好的回答也可能是错的。

重大变化

  • 变化所在: AI供应商现在报告称,更多业务职能中出现了反复使用和智能体活动;独立调查也显示,美国员工每周使用AI的比例有所上升。
  • 为何重要: 当工具适配现有工作流程时,使用范围会扩大;但收益取决于任务背景和核查方式。采购者和员工需要同时关注成效指标与采用数据。
  • 后续观察: 编程以外的反复任务使用、经过核实的输出质量,以及扣除成本后的净收益。现有证据无法确定其他职业何时会达到编程领域的使用水平,也无法说明就业将如何变化。

这些数字衡量的并非同一件事

这项实时人口调查(Real-Time Population Survey)对18至64岁的美国成年人进行具有全国代表性的线上调查,了解他们在工作中使用AI的情况。过去一周使用过AI的比例从2024年第三季度的28.2%升至2026年第二季度的39.2%。AI辅助工时占总工时的估计比例从4.1%升至6.3%。受访者还估计,最近一个季度AI节省了总工时的2.2%。最后一个数字来自受访者回忆,并非实际观测到的生产力或收入增长。

OpenAI观察到的是另一种情况:其企业客户内部的活动。该公司的8月《企业信号》报告称,2026年2月至6月,法律领域的Codex周活跃用户增长了108倍,销售和招聘增长了41倍,市场营销增长了26倍,工程领域则增长了5倍。由于没有公布这些增长率的起始人数,不能据此比较有多少律师和工程师在使用AI,也不能比较AI承担了各职业多少工作。6月,Codex占企业客户中Codex和ChatGPT合计输出令牌的64%。智能体运行时间越长,生成的令牌就越多;令牌占比既不代表员工占比,也不是价值指标。OpenAI销售这些产品,因此有动力展示其使用范围正在扩大。

OpenAI另有一项关于超过80万条美国ChatGPT消息的研究,于7月发布。研究将16.8%的工作相关消息归类为与用户本职职业不同的任务。在具体程度足以判断职业的消息中,这一比例为43.5%。一项9月的后续研究发现,一些员工在下个月再次提出这类任务。这些比例统计的是样本用户的消息;用户职业根据商业账号入职信息推断。数据说明人们会请求什么、会再次请求什么,并不代表他们完成了任务或改变了工作。

Anthropic的6月经济指数也研究了供应商自有服务上的活动。它通过更精细的抽样捕捉工作日模式,并区分聊天、Cowork和Anthropic自有API的使用。配套调查将使用情况与约9,700名Claude受访者联系起来;这些人都至少进行过五次会话。Anthropic提醒,这些受访者不能代表全体劳动力:计算机和数学类从业者约占受访者的30%,但只占美国就业人数的约4%。体力劳动职业在样本中代表不足。其较早的3月指数发现,2月Claude.ai的对话中有35%涉及计算机和数学类任务。这是单一产品的对话占比,不是使用AI的开发者占比;当时编程活动也在转向API。供应商流量可以揭示单个平台内的任务和使用频率,但不能单独给出全经济范围内按职业划分的AI采用率。

生产力取决于任务和核查方式

一项分阶段部署研究覆盖5,172名客户支持人员;他们获得AI对话助手后,平均每小时解决的问题增加了15%。经验较少、技能较低的员工在速度和质量方面都有提升;经验最丰富、技能最高的员工只略微提速,质量则小幅下降。客户变得更有礼貌,也较少要求转接经理。研究测量的是一家公司的客服运营,其中问题解决和升级处理都可以追踪。研究没有计算其他服务台采用后的收益。

另一项在66家公司、7,137名知识工作者中开展的实验以随机方式向部分员工提供集成在邮件、会议和写作软件中的AI工具。在为期六个月研究的后半段,获得工具的员工中有80%实际使用了该工具;他们每周处理邮件的时间减少了两小时,正常工作时间以外的工作时间也减少了。研究人员没有发现,单独提供使用权限会带来更广泛的任务数量或构成变化。三名作者就职于Microsoft Research;工具开发商微软共同组织了实验并提供产品遥测数据。结果仅适用于参与研究的公司,不能代表所有办公室工作。

一项对758名波士顿咨询集团顾问开展的实地实验于2023年进行,并于2026年3月发表。研究发现,在刻意选择、适合GPT-4优势的任务中,参与者完成工作更快,评分也更高。另一项需要解读访谈证据的案例中,使用AI的人更可能给出错误答案。波士顿咨询集团参与了这项研究;测试内容是指定练习,并非实际交付给客户的成果。

在METR的随机研究针对16名有经验的开源开发者展开;他们在自己熟悉的代码库中处理246项任务。使用2025年初的AI工具后,完成任务所需时间增加了19%。尽管如此,开发者仍认为工具让自己更快了。METR之后的一次尝试使用更新的工具,结果似乎显示效率提升;但研究人员认为估算不可靠,因为不愿在没有AI的情况下工作的开发者退出了研究,且同时运行的智能体增加了计时复杂性。因此,这些研究无法证明不同工具和年份中的编程生产力存在单一效应。

代码有较容易获得的反馈:代码库会保留背景信息和修改记录,而构建、测试和审查可以暴露问题。即便如此,测试通过也不代表产品没有其他问题。在客户支持领域,可以通过问题解决情况和客户反应获得反馈。邮件草稿也许能节省时间,却不一定改变公司的产出。法律、金融或医疗建议需要与其后果相匹配的核查;采购者还需要把审查工作与工具成本一并计算。这些是不同的测量问题,因此仅凭使用情况无法证明不同职业具有相当的使用强度或价值。

工作内容可能先于工资变化

在丹麦,研究人员将11个受AI影响职业的员工调查和7,000家工作场所调查,与行政记录相连接。他们在2026年3月修订版中发现,企业发起的聊天机器人项目和员工报告的任务变化有所增加;但在ChatGPT发布两年后,无论员工层面还是工作场所层面,收入和记录工时都没有出现可检测的影响。其估算排除了幅度超过2%的影响。结论只适用于丹麦、所研究的职业和时期,不能证明未来采用AI不会改变就业。

对员工而言,反复使用AI可能意味着任务范围扩大,或处理邮件的时间减少。对采购者而言,关键是完整工作流程能否以可接受的成本产出可靠工作。对收到客服答复或依赖专业建议的人来说,结果是否正确、是否有人负责才是重点。现有证据支持编程以外的AI使用范围正在扩大,也表明特定任务中出现了可测量的提升。但它尚不能确定其他职业会在何时达到软件开发领域的使用深度,也不能确定各职业共同的生产力或就业影响。

资料与延伸阅读