Anthropic이 정량 사회과학자 1,260명을 조사했습니다. 81%가 AI 챗봇을 써봤지만, 코딩 에이전트를 매주 쓰는 사람은 20%에 그쳤습니다.
코딩 에이전트 사용자는 6개월간 작업 논문을 75% 더 냈습니다. 그러나 학술지 제출 건수는 늘지 않았습니다.
AI는 일의 시작을 가속했지만 완성의 병목은 그대로였습니다. 도입 격차도 성별, 연차, 소속에 따라 뚜렷했습니다.
AI가 시작을 75% 늘려도 완성이 그대로라면,
병목은 사라진 게 아니라 자리를 옮긴 것입니다.
귀사의 AI는 무엇을 늘렸고, 어디서 막혀 있습니까?
팀에 AI 도구를 깔았습니다. 보고서 초안이 쏟아집니다. 그런데 분기 말 실적은 작년과 비슷합니다. "AI를 도입하면 생산성이 오른다"는 가정 위에서 예산을 썼는데, 결과가 따라오지 않습니다. 이 장면을 데이터로 설명한 자료는 드뭅니다.
Anthropic이 Claude Code 같은 코딩 에이전트를 쓰는 사회과학자 1,260명을 조사했습니다. 결과는 두 갈래였습니다. 일의 시작은 늘었고, 완성은 그대로였습니다.
사회과학자 이야기지만 원리는 범용입니다. AI가 산출을 늘리면 병목은 사라지지 않고 다음 단계로 옮겨갑니다. 이 글은 그 이동을 어떻게 읽고 측정할지를 다룹니다.
많은 조직이 AI 도입 효과를 산출량으로 측정합니다. 보고서 수, 코드 양, 콘텐츠 건수로 성과를 봅니다. 하지만 산출이 늘어도 최종 성과가 그대로면 의미가 다릅니다.
이 조사는 그 간극을 수치로 보여줍니다. 써본 사람 81%와 매주 쓰는 사람 20%의 격차가 있습니다. 시작을 75% 더 한 집단도 완성에서는 차이가 없었습니다. AI 투자 효과를 어디서 측정해야 하는지 다시 묻게 합니다.
첫째, 시도와 습관은 다릅니다. 응답자 81%가 AI 챗봇을 연구에 써봤습니다. 그러나 코딩 에이전트를 매주 쓰는 사람은 20%뿐입니다. 그중 86%가 Claude Code를 골랐습니다. 도입률을 "써봤다"로 세면 착시가 생깁니다. 실제 효과는 습관적 사용에서 나옵니다.
둘째, AI는 파이프라인 앞단을 가속합니다. 코딩 에이전트 사용자는 6개월간 실증 프로젝트를 약 10% 더 시작했습니다. 작업 논문은 75% 더 게시했고, 연구비 제안서도 더 냈습니다. 일을 시작하고 초기 산출을 내는 속도가 분명히 빨라졌습니다.
셋째, 그러나 완성은 그대로였습니다. 학술지 제출과 재제출 건수에서는 유의미한 차이가 없었습니다. 앞단이 빨라진 만큼 뒷단도 빨라진 것이 아닙니다. 늘어난 산출물이 피어리뷰라는 병목 앞에 쌓입니다.
넷째, 도입 격차가 뚜렷합니다. 누가 쓰느냐가 갈렸습니다. 초기 경력 연구자와 상위 대학 소속, 경제학 전공이 앞섰습니다. 반대로 정년 보장 교수와 공중보건, 교육학 분야는 뒤처졌습니다. 남성으로 추정되는 이름이 여성 추정 이름의 2배로 사용했습니다.
| 집단 | 코딩 에이전트 사용 경향 |
|---|---|
| 박사과정, 박사후연구원 | 약 27% |
| 정년 보장 교수 | 약 11% |
| 상위 25개 대학 소속 | 평균 대비 40% 높음 |
| 남성 추정 이름 | 여성 추정 이름의 2배 |
| 경제학 / 정치학 | 39% / 25% |
| 공중보건 / 교육학 / 커뮤니케이션 | 4~6% |
다섯째, 병목은 사라지지 않고 옮겨갑니다. 연구진은 두 가지 우려를 함께 제기했습니다. 늘어난 제출물이 피어리뷰를 정체시킬 수 있습니다. 그리고 불균등한 도입이 연구 자원의 격차를 키울 수 있습니다. 개인의 생산성 낙관과 분야 전체의 부담은 별개 문제입니다.
기업도 똑같습니다. AI가 초안 생산을 10배로 늘리면, 검토와 품질 게이트가 새 병목이 됩니다. 산출을 늘린 만큼 검수 역량을 키우지 않으면 일은 빨라진 것이 아니라 앞쪽에 몰린 것입니다.
"AI를 써봤다"는 응답률은 의미가 적습니다. 도구 로그나 짧은 설문으로 최근 한 주간 실제 업무에 AI를 쓴 사람 비율을 세십시오. 이 숫자를 매월 같은 방식으로 추적합니다. 81%와 20%의 차이가 진짜 도입 수준입니다. (30분)
시작, 중간, 완성 중 어디가 빨라지고 어디가 막히는지 확인합니다. 산출량만 보면 병목이 보이지 않습니다. (1시간)
우리 팀의 핵심 업무 흐름을 시작-진행-완성 3단계로 나눠 주세요. 각 단계에서 AI 도입 후 처리량이 얼마나 변했는지 추정 지표를 제안해 주세요. 어느 단계가 빨라졌고 어느 단계가 새 병목이 되었는지 분석해 주세요. 업무 흐름: [여기에 팀의 주요 업무 프로세스 입력]
누가 매주 쓰고 누가 안 쓰는지 팀별, 직급별로 확인합니다. 앞서 쓰는 집단이 더 벌어지면 조직 내 격차가 됩니다. 뒤처진 집단에 교육과 도구를 우선 배치하십시오. (1시간)
자기 보고 데이터입니다. 생산성 수치는 연구자 본인의 응답입니다. 본인이 느낀 변화여서 과대 보고 가능성이 있습니다. 실측 산출과는 차이가 날 수 있습니다.
6개월은 짧습니다. 연구는 시작에서 출판까지 수년이 걸립니다. 지금 늘어난 작업 논문이 좋은 연구로 이어질지는 더 지켜봐야 합니다. 초기 신호일 뿐 최종 성과가 아닙니다.
격차가 고착될 수 있습니다. 앞서 쓰는 집단이 더 빨리 벌어집니다. 도입 격차를 방치하면 자원과 성과의 격차로 굳어집니다.
양이 질을 보장하지 않습니다. 작업 논문 75% 증가가 더 나은 연구를 뜻하지는 않습니다. 산출이 늘수록 검토 부담은 커집니다.
AI는 일의 시작을 가속합니다. 그러나 완성의 병목과 도입 격차는 저절로 풀리지 않습니다. 측정 지점을 산출량에서 병목으로 옮겨야 합니다.
코딩 에이전트(Coding Agent): 사람의 지시를 받아 분석 코드를 스스로 작성하고 실행하는 AI 도구입니다. Claude Code가 대표적입니다. 답만 주는 챗봇과 달리 작업을 끝까지 수행합니다.
작업 논문(Working Paper): 정식 학술지 게재 전에 먼저 공개하는 초기 연구 결과물입니다. 기업의 초안 보고서나 시제품에 가깝습니다.
피어리뷰(Peer Review): 정식 출판 전에 동료 전문가가 내용을 검증하는 절차입니다. 학술 품질의 게이트입니다. 기업의 검수, 감사 절차와 유사합니다.
- Lyttelton, T., Massenkoff, M., & Wilmers, N. (2026, May). Coding Agents in the Social Sciences [Article]. Anthropic. (원문 보기 ↗)