AI-translated from English; not yet reviewed by a fluent editor.
# AI 활용이 코딩을 넘어 확산 중이다. 강도를 입증하기는 더 어렵다
> 설문은 직장에서 AI 사용이 넓어지고 있음을 보여주고, 실험은 특정 과제에서 성과와 실패를 모두 확인한다. 사용량 데이터만으로는 다른 직종의 AI 활용 강도가 코딩 분야에 이를지 알 수 없다.
By BIG CHANGE Editorial
Published: 2026-10-02T04:10:34.217Z
Updated: 2026-10-02T04:10:34.217Z
Canonical: https://bigchange.ai/blog/ai-use-beyond-coding-workplace-evidence

AI-generated by OpenAI; BIG CHANGE conceptual editorial illustration.
2026년 2분기까지 미국 취업 성인의 5분의 2 가까이가 지난주 업무에 생성형 AI를 사용했다고 답했다. 그러나 미국 세인트루이스 연방준비은행, 밴더빌트대, 하버드대 연구진의 [전국 대표 실시간 인구 설문 추적 자료](https://fredblog.stlouisfed.org/2026/08/does-generative-ai-save-time-at-work/)에 따르면 전체 취업 성인의 근로시간 중 AI가 보조한 비율은 6.3%였다. 첫 수치는 사람 수를, 둘째 수치는 시간을 센다. 어느 쪽도 업무의 품질, 기업 수익 증가, 일자리 소멸 여부를 말해주지는 않는다.
소프트웨어 개발자만큼 다른 직종에서도 AI를 많이 쓰게 될지 물을 때 이 차이가 중요하다. 플랫폼 기록에는 법률, 영업, 마케팅 등에서의 폭넓은 실험이 나타난다. 실험은 일부 비코딩 과제에서 실제 성과도 보여준다. 동시에 접근 권한만으로는 달라지는 것이 거의 없을 수 있고, 매끄러운 답변도 틀릴 수 있음을 보여준다.
## 큰 변화
- **달라진 점:** AI 공급업체들은 더 많은 업무 기능에서 반복 사용과 에이전트 활동을 보고하고 있으며, 독립 설문에서도 미국 노동자의 주간 사용이 넓어진 것으로 나타났다.
- **왜 중요한가:** 도구가 기존 업무 흐름에 맞으면 사용이 확산되지만 성과는 과제의 맥락과 검증 절차에 달려 있다. 구매자와 노동자는 도입 수치와 함께 결과 지표도 필요하다.
- **앞으로 볼 점:** 코딩 외 분야의 반복 과제 사용, 검증된 산출물 품질, 순수익을 살펴봐야 한다. 현재 근거로는 다른 직종의 사용 강도가 언제 코딩 수준에 도달할지, 고용에 어떤 일이 생길지 알 수 없다.
## 수치는 서로 다른 것을 측정한다
미국의 [Real-Time Population Survey](https://fredblog.stlouisfed.org/2026/08/does-generative-ai-save-time-at-work/)는 18\~64세 성인으로 구성된 전국 대표 온라인 표본에 업무 중 AI 사용을 묻는다. 지난주 사용 비율은 2024년 3분기 28.2%에서 2026년 2분기 39.2%로 올랐다. 전체 근로시간 중 AI가 보조한 것으로 추산된 비율도 4.1%에서 6.3%로 상승했다. 응답자들은 가장 최근 분기에 전체 근로시간의 2.2%를 AI로 절약했다고 추정했다. 마지막 수치는 기억을 바탕으로 회상한 절약 시간이지, 관측된 생산성이나 매출 증가가 아니다.
OpenAI가 관찰하는 것은 자사 기업 고객 안의 활동이라는 다른 현상이다. [8월 Enterprise Signals 보고서](https://openai.com/signals/enterprise-data/)에 따르면 2026년 2월부터 6월 사이 주간 Codex 활성 사용자는 법률 분야에서 108배, 영업·채용에서 41배, 마케팅에서 26배 늘었고 엔지니어링은 5배 증가했다. 출발 규모가 공개되지 않아 변호사와 엔지니어 중 실제 이용자가 몇 명인지, 각 직종의 업무 중 AI가 얼마나 수행하는지 순위를 매길 수 없다. 6월 기업 고객의 Codex 및 ChatGPT 합산 출력 토큰 중 64%를 Codex가 차지했다. 에이전트 작업은 길어질수록 토큰을 더 쓴다. 토큰 비중은 노동자 비율도 가치 측정치도 아니다. OpenAI는 제품을 판매하며 사용 확산을 보여줄 이해관계가 있다.
OpenAI의 별도 [미국 ChatGPT 메시지 80만 건 이상을 분석한 연구](https://cdn.openai.com/pdf/work-at-the-frontier-report.pdf)는 7월에 발표됐으며 업무 관련 메시지의 16.8%를 사용자의 직업이 아닌 다른 직업과 연관된 과제로 분류했다. 직업에 매핑할 만큼 구체적인 메시지만 보면 비율은 43.5%였다. [9월 후속 연구](https://cdn.openai.com/pdf/work-at-the-frontier-report-202609.pdf)에서는 일부 노동자가 다음 달에도 그런 과제로 돌아온 것으로 나타났다. 이는 표본 사용자의 메시지 비중이며 직업은 기업 가입 정보로 추정했다. 사람들이 무엇을 요청하고 다시 시도하는지는 보여주지만, 과제를 완료했거나 직무를 바꿨다는 뜻은 아니다.
Anthropic의 [6월 Economic Index도](https://www.anthropic.com/research/economic-index-june-2026-report) 자사 서비스의 활동을 살펴본다. 더 세분화된 표본으로 근무일 패턴을 파악하고 채팅, Cowork, 자사 API 사용을 구분한다. 함께 실시한 설문은 세션을 5회 이상 이용한 Claude 응답자 약 9,700명의 사용을 연결했다. Anthropic은 이 응답자들이 노동력을 대표하지 않는다고 경고한다. 컴퓨터·수학 직종 종사자는 응답자의 약 30%였지만 미국 고용에서 차지하는 비율은 약 4%였다. 육체노동 직종은 과소 대표됐다. 이전 [3월 지수](https://www.anthropic.com/research/economic-index-march-2026-report)는 2026년 2월 Claude.ai 대화의 35%가 컴퓨터·수학 과제와 관련됐다고 밝혔다. 이는 한 제품 대화 중 비율이지 AI를 쓰는 개발자의 비율이 아니다. 코딩 활동은 API로도 옮겨가고 있었다. 공급업체 트래픽은 한 플랫폼 안의 과제와 빈도를 보여줄 수 있지만 그 자체로 경제 전체의 직종별 도입률을 나타내지는 못한다.
## 생산성은 과제와 검증 방식에 달려 있다
고객 지원 상담원 5,172명이 참여한 [단계적 도입 연구](https://doi.org/10.1093/qje/qjae044)에서 AI 대화 보조 도구를 이용하게 된 뒤 시간당 해결 건수는 평균 15% 늘었다. 경력이 짧고 숙련도가 낮은 상담원은 속도와 품질이 모두 개선됐다. 경력과 숙련도가 가장 높은 상담원은 속도가 소폭 올랐지만 품질은 약간 하락했다. 고객은 더 정중해졌고 관리자 연결을 요청하는 비율은 낮아졌다. 이 연구는 해결과 상향 전달을 추적할 수 있는 한 기업의 고객 지원 업무를 측정했다. 다른 고객센터의 수익을 계산하지는 않았다.
66개 기업의 지식 노동자 7,137명을 대상으로 한 [실험](https://www.nber.org/papers/w33795)은 이메일, 회의, 글쓰기 소프트웨어 안에서 AI 도구를 무작위로 제공했다. 6개월 연구의 후반부에 처치군 중 도구를 사용한 80%는 주당 이메일에 쓰는 시간이 2시간 줄었고 정규 근무시간 밖의 업무도 감소했다. 연구자들은 개인별 접근 권한만으로 과제의 양이나 구성이 더 넓게 바뀌는 현상은 발견하지 못했다. 저자 세 명은 Microsoft Research 소속이었으며 도구를 만든 Microsoft가 실험을 공동 주최하고 제품 원격측정 자료를 제공했다. 이 결과는 참여 기업에 관한 것이지 모든 사무직에 적용되는 것은 아니다.
758명의 Boston Consulting Group 컨설턴트가 참여한 [현장 실험](https://www.hbs.edu/ris/Publication%20Files/dell-acqua-et-al-2026-navigating-the-jagged-technological-frontier_5c589c8c-fbb5-458f-b285-c944746cd717.pdf)은 2023년에 시행되고 2026년 3월 발표됐다. GPT-4의 강점에 맞도록 의도적으로 고른 과제에서는 작업이 빨라지고 평가 품질도 나아졌다. 인터뷰 자료 해석이 필요한 다른 사례에서는 AI 사용자가 오답을 낼 가능성이 더 높았다. BCG가 협력한 이 연구는 실제 고객에게 전달한 결과물이 아니라 정해진 연습 과제를 시험했다.
METR의 [무작위 개발자 연구](https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/)는 개발자 16명이 익숙한 저장소의 이슈 246건을 처리하도록 했다. 2025년 초의 AI 도구를 허용하자 완료 시간이 19% 늘었다. 그럼에도 개발자들은 도구가 자신들의 속도를 높였다고 믿었다. [METR의 후속 시도](https://metr.org/blog/2026-02-24-uplift-update/)는 최신 도구로 속도 향상을 시사했지만, 연구자들은 AI 없이 작업하기를 원치 않는 개발자가 빠졌고 동시 에이전트 작업 때문에 시간 측정이 복잡해져 추정치가 신뢰하기 어렵다고 판단했다. 따라서 이 연구들로 서로 다른 도구와 연도에 걸친 코딩의 단일 생산성 효과를 확정할 수 없다.
코딩에서는 저장소가 맥락과 변경 사항을 보존하고 빌드, 테스트, 검토를 통해 실패를 드러낼 수 있어 피드백을 얻기 쉽다. 그래도 테스트 통과가 제품 전체를 의미하지는 않는다. 고객 지원에서는 문제 해결과 고객 반응이 다른 피드백을 제공한다. 이메일 초안은 기업 산출량을 바꾸지 않고도 시간을 줄일 수 있다. 법률·금융·의료 권고에는 결과의 중대성에 맞는 검증이 필요하며, 구매자는 도구 비용뿐 아니라 검토 작업도 계산해야 한다. 측정 문제는 서로 다르므로 사용량만으로 동등한 활용 강도나 가치를 입증할 수 없다.
## 임금 기록보다 먼저 바뀌는 업무
덴마크에서 연구자들은 AI 영향을 받은 11개 직종과 7,000개 사업장의 노동자 설문을 행정 기록과 연결했다. 이들의 [2026년 3월 개정본](https://www.nber.org/papers/w33777)은 고용주가 도입한 챗봇과 보고된 과제 변화는 나타났지만 ChatGPT 출시 2년 뒤 노동자 또는 사업장 수준의 소득이나 기록된 근무시간에 감지 가능한 영향은 없었다. 추정 결과는 2%를 넘는 영향을 배제한다. 이 발견은 덴마크, 연구 대상 직종, 관찰 기간에 한정된다. 이후 도입이 고용을 바꾸지 않을 것이라는 결론을 입증하지는 않는다.
노동자에게 반복 사용은 더 다양한 과제나 이메일 작업 시간 감소를 뜻할 수 있다. 구매자에게는 전체 업무 흐름이 감당 가능한 비용으로 신뢰할 수 있는 산출물을 만드는지가 중요하다. 고객 지원 답변을 받거나 전문가 조언에 의존하는 사람에게는 답이 정확하고 책임 있는지가 결과다. 이용 가능한 근거는 코딩 밖으로 사용이 넓어지고 일부 과제에서 측정 가능한 성과가 있음을 뒷받침한다. 다른 직종의 사용 깊이가 소프트웨어 개발과 비슷해질 시점이나, 직종 전반에 적용되는 단일 생산성·고용 효과까지는 아직 뒷받침하지 않는다.
## 출처 및 추가 읽을거리
- [세인트루이스 연방준비은행이 설명한 Real-Time Population Survey 도입 추적 자료](https://fredblog.stlouisfed.org/2026/08/does-generative-ai-save-time-at-work/), 2026년 8월 27일: 미국의 지난주 사용, AI 보조 근로시간, 자기 보고 절약 시간. 산출물 품질이나 매출을 관찰하지 않는다.
- [OpenAI Enterprise Signals](https://openai.com/signals/enterprise-data/), 2026년 8월 12일 업데이트: OpenAI 기업 고객 내부의 사용량, 토큰 및 주간 활성 사용자 지표. 증가율의 출발 인원은 공개되지 않았다.
- [OpenAI, Work at the Frontier](https://cdn.openai.com/pdf/work-at-the-frontier-report.pdf), 2026년 7월 및 [9월 후속 연구](https://cdn.openai.com/pdf/work-at-the-frontier-report-202609.pdf): 표본 기업 사용자의 ChatGPT 메시지 분류와 재사용 패턴. 완료된 업무 결과를 측정하지 않는다.
- [Anthropic Economic Index, Cadences](https://www.anthropic.com/research/economic-index-june-2026-report), 2026년 6월 26일 및 [Learning curves](https://www.anthropic.com/research/economic-index-march-2026-report), 2026년 3월 24일: Claude 활동, 산출물 유형, 선정된 이용자 설문. 분모는 Anthropic 트래픽과 응답자다.
- [Brynjolfsson, Li, Raymond, Generative AI at Work](https://doi.org/10.1093/qje/qjae044), 2025년 2월 4일 온라인 발표, 5월호 *Quarterly Journal of Economics*: 한 기업의 단계적 도입에서 고객 지원 상담원 생산성, 노동자 숙련도 차이, 고객 반응을 측정했다.
- [Dillon 외, Shifting Work Patterns with Generative AI](https://www.nber.org/papers/w33795), 2025년 11월 개정: 참여 기업의 무작위 직장 도구 접근, 이메일 시간, 과제 구성. 저자 세 명은 Microsoft Research 소속이었고 Microsoft가 실험을 공동 주최했다.
- [Dell’Acqua 외, Navigating the Jagged Technological Frontier](https://www.hbs.edu/ris/Publication%20Files/dell-acqua-et-al-2026-navigating-the-jagged-technological-frontier_5c589c8c-fbb5-458f-b285-c944746cd717.pdf), 2023년 실험, 2026년 3월 11일 발표: 서로 다른 컨설팅 과제에서 속도, 평가된 품질, 오류를 측정했다.
- [METR 개발자 실험](https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/) 및 [2026년 2월 업데이트](https://metr.org/blog/2026-02-24-uplift-update/): 무작위 코딩 근거와 후속 연구의 표본 선택 문제.
- [Humlum과 Vestergaard, Still Waters, Rapid Currents](https://www.nber.org/papers/w33777), 2026년 3월 개정: 덴마크 노동자·사업장 설문을 근무시간 및 소득 행정 자료와 연결했다.
## Sources
- [Does generative AI save time at work?](https://fredblog.stlouisfed.org/2026/08/does-generative-ai-save-time-at-work/) — 미국 성인 대표 온라인 설문: 지난주 사용, AI 보조 근로시간, 자기 보고 절약 시간. 산출이나 매출은 검증되지 않았다.
- [Enterprise signals](https://openai.com/signals/enterprise-data/) — OpenAI 기업 원격측정: Codex의 직무별 이용자와 토큰 구성. 공개되지 않은 표본 규모와 토큰을 많이 쓰는 에이전트가 추론을 제한한다.
- [Work at the Frontier: How AI is expanding what people do at work](https://cdn.openai.com/pdf/work-at-the-frontier-report.pdf) — OpenAI가 업무 메시지 80만 건 이상을 분류했다. 직업 외 과제 비율은 완료한 일이 아니라 메시지 비중이다.
- [Work at the Frontier: How workers are unlocking new ways of working](https://cdn.openai.com/pdf/work-at-the-frontier-report-202609.pdf) — OpenAI의 선별 이용자 재사용 연구. 요청을 반복했다고 직무가 재설계됐다는 뜻은 아니다.
- [Anthropic Economic Index: Cadences](https://www.anthropic.com/research/economic-index-june-2026-report) — Claude 이용 패턴과 약 9,700명의 선별 이용자를 대상으로 한 대표성 없는 설문.
- [Anthropic Economic Index: Learning curves](https://www.anthropic.com/research/economic-index-march-2026-report) — 2026년 2월 Claude.ai 및 API 표본. 코딩 관련 35%는 Claude.ai 대화 비중이다.
- [Generative AI at Work](https://doi.org/10.1093/qje/qjae044) — 2025년 5월호 QJE 발표 연구. 한 기업 고객지원 부문 상담원 5,172명에서 평균 시간당 해결 건수가 15% 증가했다. 초보자에게 성과가 집중됐고 최고 숙련자는 품질이 소폭 하락했다. 고객은 더 정중해졌고 관리자 연결 요청이 감소했다. 일반적인 투자수익이나 고용 효과는 입증하지 않았다.
- [Shifting Work Patterns with Generative AI](https://www.nber.org/papers/w33795) — 2025년 5월호 NBER 논문, 2025년 11월 개정(일자는 미기재). 기업 66곳 노동자 7,137명을 무작위 연구했다. 저자 세 명은 Microsoft Research 소속이었다. Microsoft가 도구를 만들고 실험을 공동 주최했으며 원격측정 자료를 제공했다.
- [Navigating the Jagged Technological Frontier](https://www.hbs.edu/ris/Publication%20Files/dell-acqua-et-al-2026-navigating-the-jagged-technological-frontier_5c589c8c-fbb5-458f-b285-c944746cd717.pdf) — BCG와 연계된 컨설턴트 통제 실험. 2023년 시행, 2026년 3월 11일 Organization Science 발표. 과제별 성과와 오류를 다뤘으며 고객 결과는 측정하지 않았다.
- [METR 2025년 초 개발자 생산성 연구](https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/) — 개발자 16명, 이슈 246건의 무작위 연구. 좁은 표본에서 당시 도구 이용 시 시간이 19% 늘었다.
- [METR 개발자 생산성 실험 업데이트](https://metr.org/blog/2026-02-24-uplift-update/) — 연구자들은 표본 선택과 시간 측정 문제 때문에 이후의 속도 향상 추정치가 신뢰하기 어렵다고 설명한다.
- [Still Waters, Rapid Currents](https://www.nber.org/papers/w33777) — 2025년 5월호 NBER 논문, 2026년 3월 개정(일자는 미기재). 덴마크 설문·행정 연구에서 소득과 기록된 근무시간에 초기에 한정된 영향 없음이 관찰됐다.
BIG CHANGE 뉴스레터
큰 그림을 나만의 속도로.
AI와 로봇공학에 관한 최신 기사, 주목할 변화, 활용할 수 있는 실용적인 아이디어입니다. 일일 브리핑, 주간 다이제스트 또는 월간 전망을 선택하세요.
Next scheduled send (UTC): . Your first edition arrives at the next scheduled send after you confirm.
개인정보는 이용자가 선택합니다.
필수 저장소는 사이트 보안을 지원하고 선택 사항을 기억합니다. 선택 사항인 Google Analytics는 허용하기 전까지 꺼져 있습니다. 필수 저장 기능만 사용해 모든 기사를 읽을 수 있습니다. 개인정보 보호 세부 정보