AI-translated from English; not yet reviewed by a fluent editor.

# AI应用正扩展到编程以外的领域，但其使用强度更难证明

> 调查显示，工作场所中AI的使用范围正在扩大；实验则发现，AI在特定任务中既能带来提升，也会导致失误。使用数据尚无法证明其他职业会达到软件开发中的使用强度。

By BIG CHANGE Editorial

Published: 2026-10-02T04:10:34.217Z
Updated: 2026-10-02T04:10:34.217Z
Canonical: https://bigchange.ai/blog/ai-use-beyond-coding-workplace-evidence

![A seated person works at a laptop while holding a blank sheet of paper at a wooden table.](https://bigchange.ai/api/media/file/ai-work-beyond-coding-hero-v2-1.png)
AI-generated by OpenAI; BIG CHANGE conceptual editorial illustration.

2026年第二季度，近五分之二的美国在职成年人表示，过去一周曾将生成式AI用于工作。不过，根据圣路易斯联储、范德堡大学和哈佛大学研究人员开展的[全国人口调查追踪](https://fredblog.stlouisfed.org/2026/08/does-generative-ai-save-time-at-work/)，AI辅助完成的工时占所有在职成年人总工时的6.3%。前一个数字统计人数，后一个数字统计时间。两者都没有说明工作质量如何、公司收入是否增加，或是否有人失去工作。

在讨论其他工作是否会像软件开发一样高强度地使用AI时，这些区别很重要。平台记录显示，法律、销售和市场营销等领域的尝试有所增加。实验也显示，AI在一些非编程任务中确实能带来提升，但仅仅获得使用权限有时几乎没有影响，润色得很好的回答也可能是错的。

## 重大变化

- **变化所在：** AI供应商现在报告称，更多业务职能中出现了反复使用和智能体活动；独立调查也显示，美国员工每周使用AI的比例有所上升。
- **为何重要：** 当工具适配现有工作流程时，使用范围会扩大；但收益取决于任务背景和核查方式。采购者和员工需要同时关注成效指标与采用数据。
- **后续观察：** 编程以外的反复任务使用、经过核实的输出质量，以及扣除成本后的净收益。现有证据无法确定其他职业何时会达到编程领域的使用水平，也无法说明就业将如何变化。

## 这些数字衡量的并非同一件事

这项[实时人口调查（Real-Time Population Survey）](https://fredblog.stlouisfed.org/2026/08/does-generative-ai-save-time-at-work/)对18至64岁的美国成年人进行具有全国代表性的线上调查，了解他们在工作中使用AI的情况。过去一周使用过AI的比例从2024年第三季度的28.2%升至2026年第二季度的39.2%。AI辅助工时占总工时的估计比例从4.1%升至6.3%。受访者还估计，最近一个季度AI节省了总工时的2.2%。最后一个数字来自受访者回忆，并非实际观测到的生产力或收入增长。

OpenAI观察到的是另一种情况：其企业客户内部的活动。该公司的[8月《企业信号》报告](https://openai.com/signals/enterprise-data/)称，2026年2月至6月，法律领域的Codex周活跃用户增长了108倍，销售和招聘增长了41倍，市场营销增长了26倍，工程领域则增长了5倍。由于没有公布这些增长率的起始人数，不能据此比较有多少律师和工程师在使用AI，也不能比较AI承担了各职业多少工作。6月，Codex占企业客户中Codex和ChatGPT合计输出令牌的64%。智能体运行时间越长，生成的令牌就越多；令牌占比既不代表员工占比，也不是价值指标。OpenAI销售这些产品，因此有动力展示其使用范围正在扩大。

OpenAI另有一项关于[超过80万条美国ChatGPT消息的研究](https://cdn.openai.com/pdf/work-at-the-frontier-report.pdf)，于7月发布。研究将16.8%的工作相关消息归类为与用户本职职业不同的任务。在具体程度足以判断职业的消息中，这一比例为43.5%。一项[9月的后续研究](https://cdn.openai.com/pdf/work-at-the-frontier-report-202609.pdf)发现，一些员工在下个月再次提出这类任务。这些比例统计的是样本用户的消息；用户职业根据商业账号入职信息推断。数据说明人们会请求什么、会再次请求什么，并不代表他们完成了任务或改变了工作。

Anthropic的[6月经济指数](https://www.anthropic.com/research/economic-index-june-2026-report)也研究了供应商自有服务上的活动。它通过更精细的抽样捕捉工作日模式，并区分聊天、Cowork和Anthropic自有API的使用。配套调查将使用情况与约9,700名Claude受访者联系起来；这些人都至少进行过五次会话。Anthropic提醒，这些受访者不能代表全体劳动力：计算机和数学类从业者约占受访者的30%，但只占美国就业人数的约4%。体力劳动职业在样本中代表不足。其较早的[3月指数](https://www.anthropic.com/research/economic-index-march-2026-report)发现，2月Claude.ai的对话中有35%涉及计算机和数学类任务。这是单一产品的对话占比，不是使用AI的开发者占比；当时编程活动也在转向API。供应商流量可以揭示单个平台内的任务和使用频率，但不能单独给出全经济范围内按职业划分的AI采用率。

## 生产力取决于任务和核查方式

一项[分阶段部署研究](https://doi.org/10.1093/qje/qjae044)覆盖5,172名客户支持人员；他们获得AI对话助手后，平均每小时解决的问题增加了15%。经验较少、技能较低的员工在速度和质量方面都有提升；经验最丰富、技能最高的员工只略微提速，质量则小幅下降。客户变得更有礼貌，也较少要求转接经理。研究测量的是一家公司的客服运营，其中问题解决和升级处理都可以追踪。研究没有计算其他服务台采用后的收益。

另一项在[66家公司、7,137名知识工作者中开展的实验](https://www.nber.org/papers/w33795)以随机方式向部分员工提供集成在邮件、会议和写作软件中的AI工具。在为期六个月研究的后半段，获得工具的员工中有80%实际使用了该工具；他们每周处理邮件的时间减少了两小时，正常工作时间以外的工作时间也减少了。研究人员没有发现，单独提供使用权限会带来更广泛的任务数量或构成变化。三名作者就职于Microsoft Research；工具开发商微软共同组织了实验并提供产品遥测数据。结果仅适用于参与研究的公司，不能代表所有办公室工作。

一项对[758名波士顿咨询集团顾问开展的实地实验](https://www.hbs.edu/ris/Publication%20Files/dell-acqua-et-al-2026-navigating-the-jagged-technological-frontier_5c589c8c-fbb5-458f-b285-c944746cd717.pdf)于2023年进行，并于2026年3月发表。研究发现，在刻意选择、适合GPT-4优势的任务中，参与者完成工作更快，评分也更高。另一项需要解读访谈证据的案例中，使用AI的人更可能给出错误答案。波士顿咨询集团参与了这项研究；测试内容是指定练习，并非实际交付给客户的成果。

在[METR的随机研究](https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/)针对16名有经验的开源开发者展开；他们在自己熟悉的代码库中处理246项任务。使用2025年初的AI工具后，完成任务所需时间增加了19%。尽管如此，开发者仍认为工具让自己更快了。[METR之后的一次尝试](https://metr.org/blog/2026-02-24-uplift-update/)使用更新的工具，结果似乎显示效率提升；但研究人员认为估算不可靠，因为不愿在没有AI的情况下工作的开发者退出了研究，且同时运行的智能体增加了计时复杂性。因此，这些研究无法证明不同工具和年份中的编程生产力存在单一效应。

代码有较容易获得的反馈：代码库会保留背景信息和修改记录，而构建、测试和审查可以暴露问题。即便如此，测试通过也不代表产品没有其他问题。在客户支持领域，可以通过问题解决情况和客户反应获得反馈。邮件草稿也许能节省时间，却不一定改变公司的产出。法律、金融或医疗建议需要与其后果相匹配的核查；采购者还需要把审查工作与工具成本一并计算。这些是不同的测量问题，因此仅凭使用情况无法证明不同职业具有相当的使用强度或价值。

## 工作内容可能先于工资变化

在丹麦，研究人员将11个受AI影响职业的员工调查和7,000家工作场所调查，与行政记录相连接。他们在[2026年3月修订版](https://www.nber.org/papers/w33777)中发现，企业发起的聊天机器人项目和员工报告的任务变化有所增加；但在ChatGPT发布两年后，无论员工层面还是工作场所层面，收入和记录工时都没有出现可检测的影响。其估算排除了幅度超过2%的影响。结论只适用于丹麦、所研究的职业和时期，不能证明未来采用AI不会改变就业。

对员工而言，反复使用AI可能意味着任务范围扩大，或处理邮件的时间减少。对采购者而言，关键是完整工作流程能否以可接受的成本产出可靠工作。对收到客服答复或依赖专业建议的人来说，结果是否正确、是否有人负责才是重点。现有证据支持编程以外的AI使用范围正在扩大，也表明特定任务中出现了可测量的提升。但它尚不能确定其他职业会在何时达到软件开发领域的使用深度，也不能确定各职业共同的生产力或就业影响。

## 资料与延伸阅读

- [圣路易斯联储对实时人口调查AI使用追踪的说明](https://fredblog.stlouisfed.org/2026/08/does-generative-ai-save-time-at-work/)，2026年8月27日：美国员工过去一周的AI使用率、AI辅助工时和自报的时间节省情况。该调查没有观测产出质量或收入。
- [OpenAI《企业信号》](https://openai.com/signals/enterprise-data/)，更新于2026年8月12日：OpenAI企业客户内部的使用情况，以及令牌和周活跃用户指标。增长率未公布起始人数。
- [OpenAI，《工作前沿》](https://cdn.openai.com/pdf/work-at-the-frontier-report.pdf)，2026年7月；以及其[9月后续研究](https://cdn.openai.com/pdf/work-at-the-frontier-report-202609.pdf)：对抽样企业用户的ChatGPT消息进行分类，并追踪任务复现情况；并未衡量已完成的工作成果。
- [Anthropic经济指数，《使用节奏》](https://www.anthropic.com/research/economic-index-june-2026-report)，2026年6月26日；以及[《学习曲线》](https://www.anthropic.com/research/economic-index-march-2026-report)，2026年3月24日：Claude活动、输出类型和一项针对特定用户的调查。其统计分母是Anthropic平台流量及受访者。
- [Brynjolfsson、Li和Raymond，《生成式AI在工作中的应用》](https://doi.org/10.1093/qje/qjae044)，2025年2月4日在线发表，后收入5月刊的*《经济学季刊》*：一家公司分阶段推出AI助手时，对客服人员生产力、员工技能差异和客户反应的测量。
- [Dillon等人，《生成式AI改变工作模式》](https://www.nber.org/papers/w33795)，2025年11月修订：在参与公司随机开放AI工具后，对邮件处理时间和任务构成的研究。三名作者就职于Microsoft Research，微软共同组织了实验。
- [Dell'Acqua等人，《驾驭参差不齐的技术前沿》](https://www.hbs.edu/ris/Publication%20Files/dell-acqua-et-al-2026-navigating-the-jagged-technological-frontier_5c589c8c-fbb5-458f-b285-c944746cd717.pdf)，实验于2023年开展，论文于2026年3月11日发表：测量了不同咨询任务的速度、评分质量和错误。
- [METR的开发者实验](https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/)和[2026年2月更新](https://metr.org/blog/2026-02-24-uplift-update/)：关于编程的随机研究证据，以及后续研究中的样本选择问题。
- [Humlum和Vestergaard，《平静水面，迅疾暗流》](https://www.nber.org/papers/w33777)，2026年3月修订：将丹麦员工和工作场所调查与行政工时和收入记录相连接。

## Sources

- [生成式AI能否节省工作时间？](https://fredblog.stlouisfed.org/2026/08/does-generative-ai-save-time-at-work/) — 具有代表性的美国线上调查：过去一周的使用、AI辅助工时和自报的时间节省；没有核实产出或收入。
- [企业信号](https://openai.com/signals/enterprise-data/) — OpenAI企业遥测数据：不同职能的Codex用户和令牌构成。未公布起始人数，令牌密集型智能体也限制了推断。
- [《工作前沿：AI如何拓展人们在工作中的活动范围》](https://cdn.openai.com/pdf/work-at-the-frontier-report.pdf) — OpenAI对超过80万条工作相关消息的分类；跨职业消息占比是消息比例，不是已完成的工作量。
- [《工作前沿：员工如何解锁新的工作方式》](https://cdn.openai.com/pdf/work-at-the-frontier-report-202609.pdf) — OpenAI针对特定用户开展的任务复现调查；再次提出请求不能证明工作岗位已重新设计。
- [Anthropic经济指数：《使用节奏》](https://www.anthropic.com/research/economic-index-june-2026-report) — Claude使用模式以及对约9,700名经筛选用户开展的非代表性调查。
- [Anthropic经济指数：《学习曲线》](https://www.anthropic.com/research/economic-index-march-2026-report) — 2026年2月Claude.ai和API样本。编程相关任务占35%，是Claude.ai的对话比例。
- [《生成式AI在工作中的应用》](https://doi.org/10.1093/qje/qjae044) — 已发表于《经济学季刊》（2025年5月刊）的研究，涵盖一家公司的5,172名客服人员：每小时解决的问题平均增加15%。提升集中在新手员工；技能最高的员工质量略有下降。客户态度更有礼貌，要求转接经理的情况也更少。研究没有证明普遍投资回报或就业影响。
- [《生成式AI改变工作模式》](https://www.nber.org/papers/w33795) — 发表于NBER 2025年5月刊，2025年11月修订（未注明具体日期）。对66家公司7,137名员工开展的随机研究。三名作者就职于Microsoft Research；微软开发了研究所用工具、共同组织了研究并提供遥测数据。
- [《驾驭参差不齐的技术前沿》](https://www.hbs.edu/ris/Publication%20Files/dell-acqua-et-al-2026-navigating-the-jagged-technological-frontier_5c589c8c-fbb5-458f-b285-c944746cd717.pdf) — 与波士顿咨询集团有关的受控顾问练习于2023年开展，论文于2026年3月11日发表于《组织科学》：研究发现任务不同，速度和质量提升及错误表现也不同；结果不是客户成果。
- [METR早期开发者生产力研究](https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/) — 一项范围有限的随机研究：16名开发者处理246项任务；使用特定旧版工具后，完成时间延长了19%。
- [METR开发者生产力实验更新](https://metr.org/blog/2026-02-24-uplift-update/) — 研究人员说明，样本选择和计时方式的问题为何使之后的提速估算不可靠。
- [《平静水面，迅疾暗流》](https://www.nber.org/papers/w33777) — 发表于NBER 2025年5月刊，2026年3月修订（未注明具体日期）。一项连接丹麦员工调查与行政记录的研究，发现早期、范围有限的工时和收入零效应。
