世界从未停止变化。RSS
BIG CHANGE.

Markdown 版本

AI-translated from English; not yet reviewed by a fluent editor.

# AI应用正扩展到编程以外的领域,但其使用强度更难证明

> 调查显示,工作场所中AI的使用范围正在扩大;实验则发现,AI在特定任务中既能带来提升,也会导致失误。使用数据尚无法证明其他职业会达到软件开发中的使用强度。

By BIG CHANGE Editorial

Published: 2026-10-02T04:10:34.217Z
Updated: 2026-10-02T04:10:34.217Z
Canonical: https://bigchange.ai/blog/ai-use-beyond-coding-workplace-evidence

![A seated person works at a laptop while holding a blank sheet of paper at a wooden table.](https://bigchange.ai/api/media/file/ai-work-beyond-coding-hero-v2-1.png)
AI-generated by OpenAI; BIG CHANGE conceptual editorial illustration.

2026年第二季度,近五分之二的美国在职成年人表示,过去一周曾将生成式AI用于工作。不过,根据圣路易斯联储、范德堡大学和哈佛大学研究人员开展的[全国人口调查追踪](https://fredblog.stlouisfed.org/2026/08/does-generative-ai-save-time-at-work/),AI辅助完成的工时占所有在职成年人总工时的6.3%。前一个数字统计人数,后一个数字统计时间。两者都没有说明工作质量如何、公司收入是否增加,或是否有人失去工作。

在讨论其他工作是否会像软件开发一样高强度地使用AI时,这些区别很重要。平台记录显示,法律、销售和市场营销等领域的尝试有所增加。实验也显示,AI在一些非编程任务中确实能带来提升,但仅仅获得使用权限有时几乎没有影响,润色得很好的回答也可能是错的。

## 重大变化

- **变化所在:** AI供应商现在报告称,更多业务职能中出现了反复使用和智能体活动;独立调查也显示,美国员工每周使用AI的比例有所上升。
- **为何重要:** 当工具适配现有工作流程时,使用范围会扩大;但收益取决于任务背景和核查方式。采购者和员工需要同时关注成效指标与采用数据。
- **后续观察:** 编程以外的反复任务使用、经过核实的输出质量,以及扣除成本后的净收益。现有证据无法确定其他职业何时会达到编程领域的使用水平,也无法说明就业将如何变化。

## 这些数字衡量的并非同一件事

这项[实时人口调查(Real-Time Population Survey)](https://fredblog.stlouisfed.org/2026/08/does-generative-ai-save-time-at-work/)对18至64岁的美国成年人进行具有全国代表性的线上调查,了解他们在工作中使用AI的情况。过去一周使用过AI的比例从2024年第三季度的28.2%升至2026年第二季度的39.2%。AI辅助工时占总工时的估计比例从4.1%升至6.3%。受访者还估计,最近一个季度AI节省了总工时的2.2%。最后一个数字来自受访者回忆,并非实际观测到的生产力或收入增长。

OpenAI观察到的是另一种情况:其企业客户内部的活动。该公司的[8月《企业信号》报告](https://openai.com/signals/enterprise-data/)称,2026年2月至6月,法律领域的Codex周活跃用户增长了108倍,销售和招聘增长了41倍,市场营销增长了26倍,工程领域则增长了5倍。由于没有公布这些增长率的起始人数,不能据此比较有多少律师和工程师在使用AI,也不能比较AI承担了各职业多少工作。6月,Codex占企业客户中Codex和ChatGPT合计输出令牌的64%。智能体运行时间越长,生成的令牌就越多;令牌占比既不代表员工占比,也不是价值指标。OpenAI销售这些产品,因此有动力展示其使用范围正在扩大。

OpenAI另有一项关于[超过80万条美国ChatGPT消息的研究](https://cdn.openai.com/pdf/work-at-the-frontier-report.pdf),于7月发布。研究将16.8%的工作相关消息归类为与用户本职职业不同的任务。在具体程度足以判断职业的消息中,这一比例为43.5%。一项[9月的后续研究](https://cdn.openai.com/pdf/work-at-the-frontier-report-202609.pdf)发现,一些员工在下个月再次提出这类任务。这些比例统计的是样本用户的消息;用户职业根据商业账号入职信息推断。数据说明人们会请求什么、会再次请求什么,并不代表他们完成了任务或改变了工作。

Anthropic的[6月经济指数](https://www.anthropic.com/research/economic-index-june-2026-report)也研究了供应商自有服务上的活动。它通过更精细的抽样捕捉工作日模式,并区分聊天、Cowork和Anthropic自有API的使用。配套调查将使用情况与约9,700名Claude受访者联系起来;这些人都至少进行过五次会话。Anthropic提醒,这些受访者不能代表全体劳动力:计算机和数学类从业者约占受访者的30%,但只占美国就业人数的约4%。体力劳动职业在样本中代表不足。其较早的[3月指数](https://www.anthropic.com/research/economic-index-march-2026-report)发现,2月Claude.ai的对话中有35%涉及计算机和数学类任务。这是单一产品的对话占比,不是使用AI的开发者占比;当时编程活动也在转向API。供应商流量可以揭示单个平台内的任务和使用频率,但不能单独给出全经济范围内按职业划分的AI采用率。

## 生产力取决于任务和核查方式

一项[分阶段部署研究](https://doi.org/10.1093/qje/qjae044)覆盖5,172名客户支持人员;他们获得AI对话助手后,平均每小时解决的问题增加了15%。经验较少、技能较低的员工在速度和质量方面都有提升;经验最丰富、技能最高的员工只略微提速,质量则小幅下降。客户变得更有礼貌,也较少要求转接经理。研究测量的是一家公司的客服运营,其中问题解决和升级处理都可以追踪。研究没有计算其他服务台采用后的收益。

另一项在[66家公司、7,137名知识工作者中开展的实验](https://www.nber.org/papers/w33795)以随机方式向部分员工提供集成在邮件、会议和写作软件中的AI工具。在为期六个月研究的后半段,获得工具的员工中有80%实际使用了该工具;他们每周处理邮件的时间减少了两小时,正常工作时间以外的工作时间也减少了。研究人员没有发现,单独提供使用权限会带来更广泛的任务数量或构成变化。三名作者就职于Microsoft Research;工具开发商微软共同组织了实验并提供产品遥测数据。结果仅适用于参与研究的公司,不能代表所有办公室工作。

一项对[758名波士顿咨询集团顾问开展的实地实验](https://www.hbs.edu/ris/Publication%20Files/dell-acqua-et-al-2026-navigating-the-jagged-technological-frontier_5c589c8c-fbb5-458f-b285-c944746cd717.pdf)于2023年进行,并于2026年3月发表。研究发现,在刻意选择、适合GPT-4优势的任务中,参与者完成工作更快,评分也更高。另一项需要解读访谈证据的案例中,使用AI的人更可能给出错误答案。波士顿咨询集团参与了这项研究;测试内容是指定练习,并非实际交付给客户的成果。

在[METR的随机研究](https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/)针对16名有经验的开源开发者展开;他们在自己熟悉的代码库中处理246项任务。使用2025年初的AI工具后,完成任务所需时间增加了19%。尽管如此,开发者仍认为工具让自己更快了。[METR之后的一次尝试](https://metr.org/blog/2026-02-24-uplift-update/)使用更新的工具,结果似乎显示效率提升;但研究人员认为估算不可靠,因为不愿在没有AI的情况下工作的开发者退出了研究,且同时运行的智能体增加了计时复杂性。因此,这些研究无法证明不同工具和年份中的编程生产力存在单一效应。

代码有较容易获得的反馈:代码库会保留背景信息和修改记录,而构建、测试和审查可以暴露问题。即便如此,测试通过也不代表产品没有其他问题。在客户支持领域,可以通过问题解决情况和客户反应获得反馈。邮件草稿也许能节省时间,却不一定改变公司的产出。法律、金融或医疗建议需要与其后果相匹配的核查;采购者还需要把审查工作与工具成本一并计算。这些是不同的测量问题,因此仅凭使用情况无法证明不同职业具有相当的使用强度或价值。

## 工作内容可能先于工资变化

在丹麦,研究人员将11个受AI影响职业的员工调查和7,000家工作场所调查,与行政记录相连接。他们在[2026年3月修订版](https://www.nber.org/papers/w33777)中发现,企业发起的聊天机器人项目和员工报告的任务变化有所增加;但在ChatGPT发布两年后,无论员工层面还是工作场所层面,收入和记录工时都没有出现可检测的影响。其估算排除了幅度超过2%的影响。结论只适用于丹麦、所研究的职业和时期,不能证明未来采用AI不会改变就业。

对员工而言,反复使用AI可能意味着任务范围扩大,或处理邮件的时间减少。对采购者而言,关键是完整工作流程能否以可接受的成本产出可靠工作。对收到客服答复或依赖专业建议的人来说,结果是否正确、是否有人负责才是重点。现有证据支持编程以外的AI使用范围正在扩大,也表明特定任务中出现了可测量的提升。但它尚不能确定其他职业会在何时达到软件开发领域的使用深度,也不能确定各职业共同的生产力或就业影响。

## 资料与延伸阅读

- [圣路易斯联储对实时人口调查AI使用追踪的说明](https://fredblog.stlouisfed.org/2026/08/does-generative-ai-save-time-at-work/),2026年8月27日:美国员工过去一周的AI使用率、AI辅助工时和自报的时间节省情况。该调查没有观测产出质量或收入。
- [OpenAI《企业信号》](https://openai.com/signals/enterprise-data/),更新于2026年8月12日:OpenAI企业客户内部的使用情况,以及令牌和周活跃用户指标。增长率未公布起始人数。
- [OpenAI,《工作前沿》](https://cdn.openai.com/pdf/work-at-the-frontier-report.pdf),2026年7月;以及其[9月后续研究](https://cdn.openai.com/pdf/work-at-the-frontier-report-202609.pdf):对抽样企业用户的ChatGPT消息进行分类,并追踪任务复现情况;并未衡量已完成的工作成果。
- [Anthropic经济指数,《使用节奏》](https://www.anthropic.com/research/economic-index-june-2026-report),2026年6月26日;以及[《学习曲线》](https://www.anthropic.com/research/economic-index-march-2026-report),2026年3月24日:Claude活动、输出类型和一项针对特定用户的调查。其统计分母是Anthropic平台流量及受访者。
- [Brynjolfsson、Li和Raymond,《生成式AI在工作中的应用》](https://doi.org/10.1093/qje/qjae044),2025年2月4日在线发表,后收入5月刊的*《经济学季刊》*:一家公司分阶段推出AI助手时,对客服人员生产力、员工技能差异和客户反应的测量。
- [Dillon等人,《生成式AI改变工作模式》](https://www.nber.org/papers/w33795),2025年11月修订:在参与公司随机开放AI工具后,对邮件处理时间和任务构成的研究。三名作者就职于Microsoft Research,微软共同组织了实验。
- [Dell'Acqua等人,《驾驭参差不齐的技术前沿》](https://www.hbs.edu/ris/Publication%20Files/dell-acqua-et-al-2026-navigating-the-jagged-technological-frontier_5c589c8c-fbb5-458f-b285-c944746cd717.pdf),实验于2023年开展,论文于2026年3月11日发表:测量了不同咨询任务的速度、评分质量和错误。
- [METR的开发者实验](https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/)和[2026年2月更新](https://metr.org/blog/2026-02-24-uplift-update/):关于编程的随机研究证据,以及后续研究中的样本选择问题。
- [Humlum和Vestergaard,《平静水面,迅疾暗流》](https://www.nber.org/papers/w33777),2026年3月修订:将丹麦员工和工作场所调查与行政工时和收入记录相连接。

## Sources

- [生成式AI能否节省工作时间?](https://fredblog.stlouisfed.org/2026/08/does-generative-ai-save-time-at-work/) — 具有代表性的美国线上调查:过去一周的使用、AI辅助工时和自报的时间节省;没有核实产出或收入。
- [企业信号](https://openai.com/signals/enterprise-data/) — OpenAI企业遥测数据:不同职能的Codex用户和令牌构成。未公布起始人数,令牌密集型智能体也限制了推断。
- [《工作前沿:AI如何拓展人们在工作中的活动范围》](https://cdn.openai.com/pdf/work-at-the-frontier-report.pdf) — OpenAI对超过80万条工作相关消息的分类;跨职业消息占比是消息比例,不是已完成的工作量。
- [《工作前沿:员工如何解锁新的工作方式》](https://cdn.openai.com/pdf/work-at-the-frontier-report-202609.pdf) — OpenAI针对特定用户开展的任务复现调查;再次提出请求不能证明工作岗位已重新设计。
- [Anthropic经济指数:《使用节奏》](https://www.anthropic.com/research/economic-index-june-2026-report) — Claude使用模式以及对约9,700名经筛选用户开展的非代表性调查。
- [Anthropic经济指数:《学习曲线》](https://www.anthropic.com/research/economic-index-march-2026-report) — 2026年2月Claude.ai和API样本。编程相关任务占35%,是Claude.ai的对话比例。
- [《生成式AI在工作中的应用》](https://doi.org/10.1093/qje/qjae044) — 已发表于《经济学季刊》(2025年5月刊)的研究,涵盖一家公司的5,172名客服人员:每小时解决的问题平均增加15%。提升集中在新手员工;技能最高的员工质量略有下降。客户态度更有礼貌,要求转接经理的情况也更少。研究没有证明普遍投资回报或就业影响。
- [《生成式AI改变工作模式》](https://www.nber.org/papers/w33795) — 发表于NBER 2025年5月刊,2025年11月修订(未注明具体日期)。对66家公司7,137名员工开展的随机研究。三名作者就职于Microsoft Research;微软开发了研究所用工具、共同组织了研究并提供遥测数据。
- [《驾驭参差不齐的技术前沿》](https://www.hbs.edu/ris/Publication%20Files/dell-acqua-et-al-2026-navigating-the-jagged-technological-frontier_5c589c8c-fbb5-458f-b285-c944746cd717.pdf) — 与波士顿咨询集团有关的受控顾问练习于2023年开展,论文于2026年3月11日发表于《组织科学》:研究发现任务不同,速度和质量提升及错误表现也不同;结果不是客户成果。
- [METR早期开发者生产力研究](https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/) — 一项范围有限的随机研究:16名开发者处理246项任务;使用特定旧版工具后,完成时间延长了19%。
- [METR开发者生产力实验更新](https://metr.org/blog/2026-02-24-uplift-update/) — 研究人员说明,样本选择和计时方式的问题为何使之后的提速估算不可靠。
- [《平静水面,迅疾暗流》](https://www.nber.org/papers/w33777) — 发表于NBER 2025年5月刊,2026年3月修订(未注明具体日期)。一项连接丹麦员工调查与行政记录的研究,发现早期、范围有限的工时和收入零效应。
BIG CHANGE 新闻通讯

纵览全局,按自己的节奏。

关于人工智能和机器人技术的近期报道、值得关注的变化以及可采用的实用想法。选择每日简报、每周摘要或每月视角。