2026 年第二季,近五分之二的美國在職成年人表示,前一週曾在工作中使用生成式 AI。不過,根據一項全國性調查追蹤資料(由聖路易聯邦準備銀行、范德堡大學和哈佛大學的研究人員製作),AI 輔助工時占所有在職成年人總工時的 6.3%。第一個數字計算人數,第二個計算時間。兩者都無法說明工作品質如何、公司營收是否增加,或是否有工作職缺消失。

討論其他工作是否會像軟體開發一樣大量使用 AI 時,這些區別很重要。平台紀錄顯示,法律、銷售和行銷等領域的 AI 試用有所增加。實驗顯示,AI 在一些非程式設計工作中確實能帶來效益;但實驗也發現,單有使用權限不一定帶來改變,而經過潤飾的回答仍可能出錯。

重大變化

  • 變化所在: AI 供應商現在回報,更多業務職能中出現持續使用和代理程式活動;獨立調查也顯示,美國員工每週使用 AI 的範圍擴大。
  • 重要性: 工具符合既有工作流程時,使用範圍會擴大,但實際效益取決於任務情境和查核方式。採購者和員工除了採用率,也需要衡量實際成果。
  • 後續觀察: 程式設計以外的重複性任務使用、經查核的輸出品質,以及扣除成本後的淨效益。現有證據無法確定其他職業何時會達到程式設計領域的使用程度,也無法說明就業會如何變化。

這些數字衡量的不是同一件事

這項即時人口調查(Real-Time Population Survey)以具全國代表性的線上樣本,調查 18 至 64 歲美國成年人在工作中使用 AI 的情況。過去一週使用率從 2024 年第三季的 28.2% 升至 2026 年第二季的 39.2%。AI 輔助工時占總工時的估計比例,則從 4.1% 升至 6.3%。受訪者還估計,最近一季 AI 節省的時間占總工時 2.2%。最後這項數字是受訪者回憶的節省時間,並非實際觀察到的生產力或營收成長。

OpenAI 觀察到的是另一種資料:其企業客戶內部的使用活動。該公司的8 月《企業訊號》報告指出,2026 年 2 月至 6 月,Codex 每週活躍使用者在法律職能增加 108 倍,在銷售與招募增加 41 倍,在行銷增加 26 倍;工程職能則增加 5 倍。由於未公開各項數據的起始人數,不能據此比較使用 AI 的律師和工程師人數,也無法比較 AI 在各職業中執行工作的比例。6 月,Codex 占企業客戶 Codex 與 ChatGPT 合計輸出權杖的 64%。代理程式執行時間越長,產生的權杖越多;權杖比例既不代表使用者比例,也不代表價值。OpenAI 銷售這些產品,因此有動機展示其使用範圍正在擴大。

OpenAI 另有一項針對超過 80 萬則美國 ChatGPT 訊息的研究於 7 月發布。研究將 16.8% 的工作相關訊息歸類為使用者本職以外的職業任務。在資訊足以判斷職業的訊息中,這個比例為 43.5%。一項9 月的後續研究發現部分使用者隔月再次提出這類任務。這些比例是樣本使用者所發訊息的占比;使用者職業則依據商業帳戶的註冊資料推定。資料顯示人們會詢問或再次詢問哪些事,並不代表他們完成了任務或轉換工作。

Anthropic 的6 月經濟指數也研究供應商自家服務上的活動。較細緻的抽樣呈現工作日模式,並區分 Claude 對話、Cowork 和 Anthropic 自有 API 的使用情況。配套調查將用量資料與約 9,700 名 Claude 使用者的回覆連結;受訪者至少有五次工作階段。Anthropic 提醒,這些受訪者並不代表整體勞動力:電腦與數學相關職業約占受訪者 30%,卻只占美國就業人口約 4%;體力工作職業則在樣本中代表不足。Anthropic 較早發布的3 月指數發現,2 月 Claude.ai 對話中有 35% 涉及電腦與數學相關任務。這是單一產品對話的比例,不是使用 AI 的程式設計師比例;當時程式設計工作也逐漸轉移到 API。供應商流量能呈現單一平台上的任務類型和使用頻率,但不能單獨提供整體經濟按職業劃分的採用率。

生產力取決於任務和查核方式

在一項分階段導入研究中,5,172 名客服人員取得 AI 對話助理後,平均每小時解決的問題增加 15%。經驗和技能較少的客服人員在速度與品質上都有進步;經驗最豐富、技能最高者只略微加快速度,品質則小幅下降。客戶變得更有禮貌,也較少要求轉接主管。研究測量單一公司的客服作業流程,因此可以追蹤問題解決和升級處理情況;研究並未計算其他客服中心採用後的效益。

另一項在66 家公司、7,137 名知識工作者中進行的實驗隨機讓部分參與者取得整合於電子郵件、會議和寫作軟體的 AI 工具。在為期六個月的研究後半段,獲得工具的員工中有 80% 曾使用;他們每週處理電子郵件的時間減少兩小時,在一般工時以外工作的時間也減少。研究人員未發現,單獨提供工具會讓整體任務數量或類型產生更廣泛的變化。三位作者任職於 Microsoft Research;工具製造商微軟共同籌辦實驗並提供產品遙測資料。結果僅適用於參與研究的公司,不能代表所有辦公室工作。

一項針對758 名波士頓顧問公司顧問進行的實地實驗於 2023 年進行、2026 年 3 月發表。研究發現,在刻意挑選、符合 GPT-4 強項的任務中,工作完成得更快,評分也更高。但在另一項需要解讀訪談證據的案例中,使用 AI 的人更可能答錯。波士頓顧問公司參與這項研究;研究測試的是特定練習,並非交付給客戶的成果。

在METR 的隨機研究中,16 名資深開源軟體開發者在熟悉的程式碼儲存庫中處理 246 個問題。使用 2025 年初的 AI 工具後,完成時間增加 19%。儘管如此,開發者仍認為工具加快了自己的工作。METR 後續的研究以較新的工具進行測試,結果似乎顯示生產力有所提升;但研究人員認為估算不可靠,因為不願在沒有 AI 的情況下工作的開發者選擇退出,而且同時執行代理程式的工作也增加了計時難度。因此,這些研究無法確立跨工具和不同年份皆適用的單一程式設計生產力效果。

程式碼工作的回饋較容易取得:程式碼儲存庫會保留背景資訊與變更,而建置、測試和審查可揭露問題。即便如此,測試通過也不代表產品沒有其他問題。客服工作可以從問題解決狀況和客戶反應取得回饋。電子郵件草稿或許能省下時間,卻不一定增加公司的產出。法律、金融或醫療建議需要依其後果採取適當查核;採購者也必須將審查工時和工具成本一併納入考量。這些都是不同的衡量問題,因此單憑使用情況,無法證明各職業的使用強度或價值相當。

工作內容可能先變,薪資未必立刻改變

在丹麥,研究人員將 11 種受 AI 影響職業的員工調查、7,000 個工作場所調查與行政紀錄連結。他們在2026 年 3 月修訂的研究中發現,企業推動聊天機器人,以及員工回報任務內容改變的情況確實存在;但在 ChatGPT 推出兩年後,無論員工或工作場所層級,收入和記錄工時都沒有可偵測的變化。研究估算排除了超過 2% 的影響。此結果僅限於丹麥、受研究的職業和期間,不能證明未來採用 AI 不會改變就業。

對員工而言,反覆使用 AI 可能代表任務組合變廣,或處理電子郵件的時間減少。對採購者而言,關鍵是整套工作流程能否以可接受的成本產出可靠成果。對收到客服答覆或依賴專業建議的人來說,結果是否正確、是否有人負責才是重點。現有證據支持程式設計以外的 AI 使用正在擴大,也顯示特定任務的成效可衡量;但目前仍無法排定其他職業何時會達到軟體開發的使用深度,也無法確定各職業共同的生產力或就業效果。

資料與延伸閱讀