2026년 2분기까지 미국 취업 성인의 5분의 2 가까이가 지난주 업무에 생성형 AI를 사용했다고 답했다. 그러나 미국 세인트루이스 연방준비은행, 밴더빌트대, 하버드대 연구진의 전국 대표 실시간 인구 설문 추적 자료에 따르면 전체 취업 성인의 근로시간 중 AI가 보조한 비율은 6.3%였다. 첫 수치는 사람 수를, 둘째 수치는 시간을 센다. 어느 쪽도 업무의 품질, 기업 수익 증가, 일자리 소멸 여부를 말해주지는 않는다.

소프트웨어 개발자만큼 다른 직종에서도 AI를 많이 쓰게 될지 물을 때 이 차이가 중요하다. 플랫폼 기록에는 법률, 영업, 마케팅 등에서의 폭넓은 실험이 나타난다. 실험은 일부 비코딩 과제에서 실제 성과도 보여준다. 동시에 접근 권한만으로는 달라지는 것이 거의 없을 수 있고, 매끄러운 답변도 틀릴 수 있음을 보여준다.

큰 변화

  • 달라진 점: AI 공급업체들은 더 많은 업무 기능에서 반복 사용과 에이전트 활동을 보고하고 있으며, 독립 설문에서도 미국 노동자의 주간 사용이 넓어진 것으로 나타났다.
  • 왜 중요한가: 도구가 기존 업무 흐름에 맞으면 사용이 확산되지만 성과는 과제의 맥락과 검증 절차에 달려 있다. 구매자와 노동자는 도입 수치와 함께 결과 지표도 필요하다.
  • 앞으로 볼 점: 코딩 외 분야의 반복 과제 사용, 검증된 산출물 품질, 순수익을 살펴봐야 한다. 현재 근거로는 다른 직종의 사용 강도가 언제 코딩 수준에 도달할지, 고용에 어떤 일이 생길지 알 수 없다.

수치는 서로 다른 것을 측정한다

미국의 Real-Time Population Survey는 18~64세 성인으로 구성된 전국 대표 온라인 표본에 업무 중 AI 사용을 묻는다. 지난주 사용 비율은 2024년 3분기 28.2%에서 2026년 2분기 39.2%로 올랐다. 전체 근로시간 중 AI가 보조한 것으로 추산된 비율도 4.1%에서 6.3%로 상승했다. 응답자들은 가장 최근 분기에 전체 근로시간의 2.2%를 AI로 절약했다고 추정했다. 마지막 수치는 기억을 바탕으로 회상한 절약 시간이지, 관측된 생산성이나 매출 증가가 아니다.

OpenAI가 관찰하는 것은 자사 기업 고객 안의 활동이라는 다른 현상이다. 8월 Enterprise Signals 보고서에 따르면 2026년 2월부터 6월 사이 주간 Codex 활성 사용자는 법률 분야에서 108배, 영업·채용에서 41배, 마케팅에서 26배 늘었고 엔지니어링은 5배 증가했다. 출발 규모가 공개되지 않아 변호사와 엔지니어 중 실제 이용자가 몇 명인지, 각 직종의 업무 중 AI가 얼마나 수행하는지 순위를 매길 수 없다. 6월 기업 고객의 Codex 및 ChatGPT 합산 출력 토큰 중 64%를 Codex가 차지했다. 에이전트 작업은 길어질수록 토큰을 더 쓴다. 토큰 비중은 노동자 비율도 가치 측정치도 아니다. OpenAI는 제품을 판매하며 사용 확산을 보여줄 이해관계가 있다.

OpenAI의 별도 미국 ChatGPT 메시지 80만 건 이상을 분석한 연구는 7월에 발표됐으며 업무 관련 메시지의 16.8%를 사용자의 직업이 아닌 다른 직업과 연관된 과제로 분류했다. 직업에 매핑할 만큼 구체적인 메시지만 보면 비율은 43.5%였다. 9월 후속 연구에서는 일부 노동자가 다음 달에도 그런 과제로 돌아온 것으로 나타났다. 이는 표본 사용자의 메시지 비중이며 직업은 기업 가입 정보로 추정했다. 사람들이 무엇을 요청하고 다시 시도하는지는 보여주지만, 과제를 완료했거나 직무를 바꿨다는 뜻은 아니다.

Anthropic의 6월 Economic Index도 자사 서비스의 활동을 살펴본다. 더 세분화된 표본으로 근무일 패턴을 파악하고 채팅, Cowork, 자사 API 사용을 구분한다. 함께 실시한 설문은 세션을 5회 이상 이용한 Claude 응답자 약 9,700명의 사용을 연결했다. Anthropic은 이 응답자들이 노동력을 대표하지 않는다고 경고한다. 컴퓨터·수학 직종 종사자는 응답자의 약 30%였지만 미국 고용에서 차지하는 비율은 약 4%였다. 육체노동 직종은 과소 대표됐다. 이전 3월 지수는 2026년 2월 Claude.ai 대화의 35%가 컴퓨터·수학 과제와 관련됐다고 밝혔다. 이는 한 제품 대화 중 비율이지 AI를 쓰는 개발자의 비율이 아니다. 코딩 활동은 API로도 옮겨가고 있었다. 공급업체 트래픽은 한 플랫폼 안의 과제와 빈도를 보여줄 수 있지만 그 자체로 경제 전체의 직종별 도입률을 나타내지는 못한다.

생산성은 과제와 검증 방식에 달려 있다

고객 지원 상담원 5,172명이 참여한 단계적 도입 연구에서 AI 대화 보조 도구를 이용하게 된 뒤 시간당 해결 건수는 평균 15% 늘었다. 경력이 짧고 숙련도가 낮은 상담원은 속도와 품질이 모두 개선됐다. 경력과 숙련도가 가장 높은 상담원은 속도가 소폭 올랐지만 품질은 약간 하락했다. 고객은 더 정중해졌고 관리자 연결을 요청하는 비율은 낮아졌다. 이 연구는 해결과 상향 전달을 추적할 수 있는 한 기업의 고객 지원 업무를 측정했다. 다른 고객센터의 수익을 계산하지는 않았다.

66개 기업의 지식 노동자 7,137명을 대상으로 한 실험은 이메일, 회의, 글쓰기 소프트웨어 안에서 AI 도구를 무작위로 제공했다. 6개월 연구의 후반부에 처치군 중 도구를 사용한 80%는 주당 이메일에 쓰는 시간이 2시간 줄었고 정규 근무시간 밖의 업무도 감소했다. 연구자들은 개인별 접근 권한만으로 과제의 양이나 구성이 더 넓게 바뀌는 현상은 발견하지 못했다. 저자 세 명은 Microsoft Research 소속이었으며 도구를 만든 Microsoft가 실험을 공동 주최하고 제품 원격측정 자료를 제공했다. 이 결과는 참여 기업에 관한 것이지 모든 사무직에 적용되는 것은 아니다.

758명의 Boston Consulting Group 컨설턴트가 참여한 현장 실험은 2023년에 시행되고 2026년 3월 발표됐다. GPT-4의 강점에 맞도록 의도적으로 고른 과제에서는 작업이 빨라지고 평가 품질도 나아졌다. 인터뷰 자료 해석이 필요한 다른 사례에서는 AI 사용자가 오답을 낼 가능성이 더 높았다. BCG가 협력한 이 연구는 실제 고객에게 전달한 결과물이 아니라 정해진 연습 과제를 시험했다.

METR의 무작위 개발자 연구는 개발자 16명이 익숙한 저장소의 이슈 246건을 처리하도록 했다. 2025년 초의 AI 도구를 허용하자 완료 시간이 19% 늘었다. 그럼에도 개발자들은 도구가 자신들의 속도를 높였다고 믿었다. METR의 후속 시도는 최신 도구로 속도 향상을 시사했지만, 연구자들은 AI 없이 작업하기를 원치 않는 개발자가 빠졌고 동시 에이전트 작업 때문에 시간 측정이 복잡해져 추정치가 신뢰하기 어렵다고 판단했다. 따라서 이 연구들로 서로 다른 도구와 연도에 걸친 코딩의 단일 생산성 효과를 확정할 수 없다.

코딩에서는 저장소가 맥락과 변경 사항을 보존하고 빌드, 테스트, 검토를 통해 실패를 드러낼 수 있어 피드백을 얻기 쉽다. 그래도 테스트 통과가 제품 전체를 의미하지는 않는다. 고객 지원에서는 문제 해결과 고객 반응이 다른 피드백을 제공한다. 이메일 초안은 기업 산출량을 바꾸지 않고도 시간을 줄일 수 있다. 법률·금융·의료 권고에는 결과의 중대성에 맞는 검증이 필요하며, 구매자는 도구 비용뿐 아니라 검토 작업도 계산해야 한다. 측정 문제는 서로 다르므로 사용량만으로 동등한 활용 강도나 가치를 입증할 수 없다.

임금 기록보다 먼저 바뀌는 업무

덴마크에서 연구자들은 AI 영향을 받은 11개 직종과 7,000개 사업장의 노동자 설문을 행정 기록과 연결했다. 이들의 2026년 3월 개정본은 고용주가 도입한 챗봇과 보고된 과제 변화는 나타났지만 ChatGPT 출시 2년 뒤 노동자 또는 사업장 수준의 소득이나 기록된 근무시간에 감지 가능한 영향은 없었다. 추정 결과는 2%를 넘는 영향을 배제한다. 이 발견은 덴마크, 연구 대상 직종, 관찰 기간에 한정된다. 이후 도입이 고용을 바꾸지 않을 것이라는 결론을 입증하지는 않는다.

노동자에게 반복 사용은 더 다양한 과제나 이메일 작업 시간 감소를 뜻할 수 있다. 구매자에게는 전체 업무 흐름이 감당 가능한 비용으로 신뢰할 수 있는 산출물을 만드는지가 중요하다. 고객 지원 답변을 받거나 전문가 조언에 의존하는 사람에게는 답이 정확하고 책임 있는지가 결과다. 이용 가능한 근거는 코딩 밖으로 사용이 넓어지고 일부 과제에서 측정 가능한 성과가 있음을 뒷받침한다. 다른 직종의 사용 깊이가 소프트웨어 개발과 비슷해질 시점이나, 직종 전반에 적용되는 단일 생산성·고용 효과까지는 아직 뒷받침하지 않는다.

출처 및 추가 읽을거리