AI-translated from English; not yet reviewed by a fluent editor.

# AI 正逐漸用於程式設計以外的工作，但使用強度更難衡量

> 調查顯示，職場中使用 AI 的範圍正在擴大；實驗則發現，AI 在特定任務中有時能提升表現，有時也會出錯。現有使用資料還無法顯示，其他職業能否達到程式設計領域的使用強度。

By BIG CHANGE Editorial

Published: 2026-10-02T04:10:34.217Z
Updated: 2026-10-02T04:10:34.217Z
Canonical: https://bigchange.ai/blog/ai-use-beyond-coding-workplace-evidence

![A seated person works at a laptop while holding a blank sheet of paper at a wooden table.](https://bigchange.ai/api/media/file/ai-work-beyond-coding-hero-v2-1.png)
AI-generated by OpenAI; BIG CHANGE conceptual editorial illustration.

2026 年第二季，近五分之二的美國在職成年人表示，前一週曾在工作中使用生成式 AI。不過，根據[一項全國性調查追蹤](https://fredblog.stlouisfed.org/2026/08/does-generative-ai-save-time-at-work/)資料（由聖路易聯邦準備銀行、范德堡大學和哈佛大學的研究人員製作），AI 輔助工時占所有在職成年人總工時的 6.3%。第一個數字計算人數，第二個計算時間。兩者都無法說明工作品質如何、公司營收是否增加，或是否有工作職缺消失。

討論其他工作是否會像軟體開發一樣大量使用 AI 時，這些區別很重要。平台紀錄顯示，法律、銷售和行銷等領域的 AI 試用有所增加。實驗顯示，AI 在一些非程式設計工作中確實能帶來效益；但實驗也發現，單有使用權限不一定帶來改變，而經過潤飾的回答仍可能出錯。

## 重大變化

- **變化所在：** AI 供應商現在回報，更多業務職能中出現持續使用和代理程式活動；獨立調查也顯示，美國員工每週使用 AI 的範圍擴大。
- **重要性：** 工具符合既有工作流程時，使用範圍會擴大，但實際效益取決於任務情境和查核方式。採購者和員工除了採用率，也需要衡量實際成果。
- **後續觀察：** 程式設計以外的重複性任務使用、經查核的輸出品質，以及扣除成本後的淨效益。現有證據無法確定其他職業何時會達到程式設計領域的使用程度，也無法說明就業會如何變化。

## 這些數字衡量的不是同一件事

這項[即時人口調查（Real-Time Population Survey）](https://fredblog.stlouisfed.org/2026/08/does-generative-ai-save-time-at-work/)以具全國代表性的線上樣本，調查 18 至 64 歲美國成年人在工作中使用 AI 的情況。過去一週使用率從 2024 年第三季的 28.2% 升至 2026 年第二季的 39.2%。AI 輔助工時占總工時的估計比例，則從 4.1% 升至 6.3%。受訪者還估計，最近一季 AI 節省的時間占總工時 2.2%。最後這項數字是受訪者回憶的節省時間，並非實際觀察到的生產力或營收成長。

OpenAI 觀察到的是另一種資料：其企業客戶內部的使用活動。該公司的[8 月《企業訊號》報告](https://openai.com/signals/enterprise-data/)指出，2026 年 2 月至 6 月，Codex 每週活躍使用者在法律職能增加 108 倍，在銷售與招募增加 41 倍，在行銷增加 26 倍；工程職能則增加 5 倍。由於未公開各項數據的起始人數，不能據此比較使用 AI 的律師和工程師人數，也無法比較 AI 在各職業中執行工作的比例。6 月，Codex 占企業客戶 Codex 與 ChatGPT 合計輸出權杖的 64%。代理程式執行時間越長，產生的權杖越多；權杖比例既不代表使用者比例，也不代表價值。OpenAI 銷售這些產品，因此有動機展示其使用範圍正在擴大。

OpenAI 另有一項針對[超過 80 萬則美國 ChatGPT 訊息的研究](https://cdn.openai.com/pdf/work-at-the-frontier-report.pdf)於 7 月發布。研究將 16.8% 的工作相關訊息歸類為使用者本職以外的職業任務。在資訊足以判斷職業的訊息中，這個比例為 43.5%。一項[9 月的後續研究](https://cdn.openai.com/pdf/work-at-the-frontier-report-202609.pdf)發現部分使用者隔月再次提出這類任務。這些比例是樣本使用者所發訊息的占比；使用者職業則依據商業帳戶的註冊資料推定。資料顯示人們會詢問或再次詢問哪些事，並不代表他們完成了任務或轉換工作。

Anthropic 的[6 月經濟指數](https://www.anthropic.com/research/economic-index-june-2026-report)也研究供應商自家服務上的活動。較細緻的抽樣呈現工作日模式，並區分 Claude 對話、Cowork 和 Anthropic 自有 API 的使用情況。配套調查將用量資料與約 9,700 名 Claude 使用者的回覆連結；受訪者至少有五次工作階段。Anthropic 提醒，這些受訪者並不代表整體勞動力：電腦與數學相關職業約占受訪者 30%，卻只占美國就業人口約 4%；體力工作職業則在樣本中代表不足。Anthropic 較早發布的[3 月指數](https://www.anthropic.com/research/economic-index-march-2026-report)發現，2 月 Claude.ai 對話中有 35% 涉及電腦與數學相關任務。這是單一產品對話的比例，不是使用 AI 的程式設計師比例；當時程式設計工作也逐漸轉移到 API。供應商流量能呈現單一平台上的任務類型和使用頻率，但不能單獨提供整體經濟按職業劃分的採用率。

## 生產力取決於任務和查核方式

在一項[分階段導入研究](https://doi.org/10.1093/qje/qjae044)中，5,172 名客服人員取得 AI 對話助理後，平均每小時解決的問題增加 15%。經驗和技能較少的客服人員在速度與品質上都有進步；經驗最豐富、技能最高者只略微加快速度，品質則小幅下降。客戶變得更有禮貌，也較少要求轉接主管。研究測量單一公司的客服作業流程，因此可以追蹤問題解決和升級處理情況；研究並未計算其他客服中心採用後的效益。

另一項在[66 家公司、7,137 名知識工作者中進行的實驗](https://www.nber.org/papers/w33795)隨機讓部分參與者取得整合於電子郵件、會議和寫作軟體的 AI 工具。在為期六個月的研究後半段，獲得工具的員工中有 80% 曾使用；他們每週處理電子郵件的時間減少兩小時，在一般工時以外工作的時間也減少。研究人員未發現，單獨提供工具會讓整體任務數量或類型產生更廣泛的變化。三位作者任職於 Microsoft Research；工具製造商微軟共同籌辦實驗並提供產品遙測資料。結果僅適用於參與研究的公司，不能代表所有辦公室工作。

一項針對[758 名波士頓顧問公司顧問進行的實地實驗](https://www.hbs.edu/ris/Publication%20Files/dell-acqua-et-al-2026-navigating-the-jagged-technological-frontier_5c589c8c-fbb5-458f-b285-c944746cd717.pdf)於 2023 年進行、2026 年 3 月發表。研究發現，在刻意挑選、符合 GPT-4 強項的任務中，工作完成得更快，評分也更高。但在另一項需要解讀訪談證據的案例中，使用 AI 的人更可能答錯。波士頓顧問公司參與這項研究；研究測試的是特定練習，並非交付給客戶的成果。

在[METR 的隨機研究](https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/)中，16 名資深開源軟體開發者在熟悉的程式碼儲存庫中處理 246 個問題。使用 2025 年初的 AI 工具後，完成時間增加 19%。儘管如此，開發者仍認為工具加快了自己的工作。[METR 後續的研究](https://metr.org/blog/2026-02-24-uplift-update/)以較新的工具進行測試，結果似乎顯示生產力有所提升；但研究人員認為估算不可靠，因為不願在沒有 AI 的情況下工作的開發者選擇退出，而且同時執行代理程式的工作也增加了計時難度。因此，這些研究無法確立跨工具和不同年份皆適用的單一程式設計生產力效果。

程式碼工作的回饋較容易取得：程式碼儲存庫會保留背景資訊與變更，而建置、測試和審查可揭露問題。即便如此，測試通過也不代表產品沒有其他問題。客服工作可以從問題解決狀況和客戶反應取得回饋。電子郵件草稿或許能省下時間，卻不一定增加公司的產出。法律、金融或醫療建議需要依其後果採取適當查核；採購者也必須將審查工時和工具成本一併納入考量。這些都是不同的衡量問題，因此單憑使用情況，無法證明各職業的使用強度或價值相當。

## 工作內容可能先變，薪資未必立刻改變

在丹麥，研究人員將 11 種受 AI 影響職業的員工調查、7,000 個工作場所調查與行政紀錄連結。他們在[2026 年 3 月修訂的研究](https://www.nber.org/papers/w33777)中發現，企業推動聊天機器人，以及員工回報任務內容改變的情況確實存在；但在 ChatGPT 推出兩年後，無論員工或工作場所層級，收入和記錄工時都沒有可偵測的變化。研究估算排除了超過 2% 的影響。此結果僅限於丹麥、受研究的職業和期間，不能證明未來採用 AI 不會改變就業。

對員工而言，反覆使用 AI 可能代表任務組合變廣，或處理電子郵件的時間減少。對採購者而言，關鍵是整套工作流程能否以可接受的成本產出可靠成果。對收到客服答覆或依賴專業建議的人來說，結果是否正確、是否有人負責才是重點。現有證據支持程式設計以外的 AI 使用正在擴大，也顯示特定任務的成效可衡量；但目前仍無法排定其他職業何時會達到軟體開發的使用深度，也無法確定各職業共同的生產力或就業效果。

## 資料與延伸閱讀

- [聖路易聯邦準備銀行對即時人口調查採用率追蹤的說明](https://fredblog.stlouisfed.org/2026/08/does-generative-ai-save-time-at-work/)，2026 年 8 月 27 日：美國員工過去一週的 AI 使用情況、AI 輔助工時和自陳節省時間。調查未觀察工作成果品質或營收。
- [OpenAI《企業訊號》](https://openai.com/signals/enterprise-data/)，2026 年 8 月 12 日更新：OpenAI 企業客戶內部的使用情況，以及權杖和每週活躍使用者指標。成長率未公布起始人數。
- [OpenAI，《工作前沿》](https://cdn.openai.com/pdf/work-at-the-frontier-report.pdf)，2026 年 7 月；及其[9 月後續研究](https://cdn.openai.com/pdf/work-at-the-frontier-report-202609.pdf)：將 ChatGPT 訊息分類，並追蹤受訪企業使用者是否重複提出任務；並未衡量工作是否完成。
- [Anthropic 經濟指數：《使用節奏》](https://www.anthropic.com/research/economic-index-june-2026-report)，2026 年 6 月 26 日；以及[《學習曲線》](https://www.anthropic.com/research/economic-index-march-2026-report)，2026 年 3 月 24 日：Claude 活動、輸出類型和特定使用者調查。統計分母是 Anthropic 平台流量和受訪者。
- [Brynjolfsson、Li 和 Raymond，《生成式 AI 在工作中的應用》](https://doi.org/10.1093/qje/qjae044)，2025 年 2 月 4 日線上發表，後刊於 5 月號*《經濟學季刊》*：一家公司的客服助理分階段推出期間，研究衡量客服人員生產力、員工技能差異和客戶反應。
- [Dillon 等人，《生成式 AI 改變工作模式》](https://www.nber.org/papers/w33795)，2025 年 11 月修訂：在參與公司隨機提供工作場所 AI 工具後，研究電子郵件處理時間和任務組合。三位作者任職於 Microsoft Research，微軟共同籌辦實驗。
- [Dell’Acqua 等人，《駕馭崎嶇的技術前沿》](https://www.hbs.edu/ris/Publication%20Files/dell-acqua-et-al-2026-navigating-the-jagged-technological-frontier_5c589c8c-fbb5-458f-b285-c944746cd717.pdf)，實驗於 2023 年進行，論文於 2026 年 3 月 11 日發表：測量不同顧問練習的速度、評分品質和錯誤。
- [METR 開發者實驗](https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/)和[2026 年 2 月更新](https://metr.org/blog/2026-02-24-uplift-update/)：隨機程式設計實驗的證據，以及後續研究在樣本選擇上的問題。
- [Humlum 和 Vestergaard，《平靜水面，迅疾暗流》](https://www.nber.org/papers/w33777)，2026 年 3 月修訂：將丹麥員工與工作場所調查連結至行政工時和收入紀錄。

## Sources

- [生成式 AI 能否縮短工作時間？](https://fredblog.stlouisfed.org/2026/08/does-generative-ai-save-time-at-work/) — 美國具代表性的線上調查：過去一週使用率、AI 輔助工時和自陳節省時間；未查證實際產出或營收。
- [企業訊號](https://openai.com/signals/enterprise-data/) — OpenAI 企業遙測資料：按職能區分的 Codex 使用者和權杖組成。未公開起始人數，權杖用量較高的代理程式也限制了推論。
- [《工作前沿：AI 如何拓展人們在工作中的作為》](https://cdn.openai.com/pdf/work-at-the-frontier-report.pdf) — OpenAI 對超過 80 萬則工作訊息的分類；跨職業任務比例是訊息比例，不是已完成工作。
- [《工作前沿：員工如何開啟新的工作方式》](https://cdn.openai.com/pdf/work-at-the-frontier-report-202609.pdf) — OpenAI 對特定使用者進行的重複任務研究；重複提出要求不能證明職務已重新設計。
- [Anthropic 經濟指數：使用節奏](https://www.anthropic.com/research/economic-index-june-2026-report) — Claude 使用模式，以及對約 9,700 名特定使用者所做的非代表性調查。
- [Anthropic 經濟指數：學習曲線](https://www.anthropic.com/research/economic-index-march-2026-report) — 2026 年 2 月 Claude.ai 和 API 樣本。程式設計相關任務占 35%，這是 Claude.ai 對話的比例。
- [生成式 AI 在工作中的應用](https://doi.org/10.1093/qje/qjae044) — 刊於《經濟學季刊》（2025 年 5 月號）的研究，涵蓋一家公司的 5,172 名客服人員：平均每小時解決問題數增加 15%。效益集中於新手；技能最高者的品質略有下降。客戶更有禮貌，也較少要求轉接主管。研究未證明一般投資報酬率或就業效果。
- [生成式 AI 改變工作模式](https://www.nber.org/papers/w33795) — 刊於 NBER 2025 年 5 月號，2025 年 11 月修訂（未註明日期）。對 66 家公司、7,137 名員工進行的隨機研究。三位作者任職於 Microsoft Research；微軟製作研究所用工具、共同籌辦研究並提供遙測資料。
- [駕馭崎嶇的技術前沿](https://www.hbs.edu/ris/Publication%20Files/dell-acqua-et-al-2026-navigating-the-jagged-technological-frontier_5c589c8c-fbb5-458f-b285-c944746cd717.pdf) — 與波士頓顧問公司相關的受控顧問練習於 2023 年進行，並於 2026 年 3 月 11 日刊於《組織科學》：研究顯示效益和錯誤因任務而異，並非客戶成果。
- [METR 2025 年初的開發者生產力研究](https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/) — 一項範圍有限的隨機研究：16 名開發者處理 246 個問題；使用當時的工具後，完成時間增加 19%。
- [METR 開發者生產力實驗更新](https://metr.org/blog/2026-02-24-uplift-update/) — 研究人員說明，樣本選擇和計時問題如何使後續提速估算不可靠。
- [平靜水面，迅疾暗流](https://www.nber.org/papers/w33777) — 刊於 NBER 2025 年 5 月號，2026 年 3 月修訂（未註明日期）。丹麥員工調查與行政資料連結研究，在研究範圍和期間內，未發現收入與記錄工時有明顯影響。
