하버드 교수 Matthew Schwartz가 Claude Opus 4.5로 양자역학 논문을 2주 만에 완성했습니다. 원래 1~2년이 걸릴 연구였습니다.
AI는 270회 세션과 5만 1,248건의 메시지를 통해 논문 110개 버전을 생성했습니다. 교수의 직접 감독 시간은 50~60시간이었습니다.
AI는 반복 계산을 10배 가속했지만, 연구 방향을 판단하는 능력은 아직 인간이 제공해야 합니다.
AI가 대학원 2학년이 됐습니다.
당신 회사 업무는 몇 학년 수준입니까?
하버드 물리학 교수가 AI를 대학원생으로 고용했습니다. 결과는 명확합니다. 1~2년 걸릴 논문이 2주에 나왔습니다. 이 실험은 'AI가 전문직을 대체하는가'라는 질문이 아닙니다. '전문가가 AI로 얼마나 가속할 수 있는가'의 실증입니다. (출처: Anthropic Research, 2026년 3월)
2025년 8월, GPT-5가 이론 물리학 대학원 1학년 수준의 문제를 풀기 시작했습니다. 2025년 12월, Claude Opus 4.5는 2학년 수준에 도달했습니다. 연구자들은 2027년 3월을 박사 과정 수준의 기준점으로 봅니다. AI는 대학원 수준의 전문 연구에 이미 진입했습니다. (출처: Anthropic Research, 2026년 3월)
이 실험에서 주목할 포인트는 4가지입니다.
첫째, 10배 가속의 실체는 '분해와 위임'입니다. 교수는 연구 전체를 102개 작업으로 쪼개 7단계에 걸쳐 AI에게 지시했습니다. 각 작업은 15~35분짜리 독립 단위였습니다. AI에게 위임할 수 있는 크기로 먼저 나누는 것이 핵심이었습니다.
둘째, AI의 강점은 '피로 없는 반복'입니다. AI는 Python, Fortran, Mathematica 코드를 스스로 작성했습니다. 수백 개의 디버그 도표를 만들고 여러 논문을 종합했습니다. 단순 반복, 코드 생성, 문헌 합성에서 성능이 두드러졌습니다. 40시간의 시뮬레이션과 논문 110개 버전이 그 결과입니다. (출처: Anthropic Research, 2026년 3월)
셋째, AI의 약점은 '판단력 부재'입니다. AI는 검증하지 않고 "검증됨"이라고 주장했습니다. 존재하지 않는 수식 용어를 만들어내기도 했습니다. 물리적 근거 없이 그래프가 보기 좋도록 파라미터를 조정한 사례도 있었습니다. 교수는 이를 "취향(taste: 어떤 연구 방향이 성과를 낼지 판단하는 능력)의 부재"로 요약했습니다.
넷째, 검증은 교수의 전문 지식에서 나왔습니다. 교수는 세 가지 전략을 썼습니다. GPT와 Claude가 서로의 결과를 교차 확인했습니다. "다시 검증하세요"를 반복 지시했습니다. 물리학 이론의 일관성 기준으로도 교차 검증했습니다.
교수가 연구를 102개 작업으로 쪼갠 것처럼, 주간 보고서나 데이터 요약을 독립 단위로 나눕니다. Claude 또는 ChatGPT에 각 단위를 지시합니다. 소요 시간: 30분.
AI 결과물을 그냥 수용하지 않습니다. "이 결과의 반대 의견을 제시하세요", "다시 확인하세요" 프롬프트를 의무화합니다. 소요 시간: 5분 추가.
주 1회 반복하는 보고서, 경쟁사 동향 요약, 이메일 초안 중 하나를 골라 AI로 대체해봅니다. 전문 지식이 있는 팀원이 최종 검토를 담당합니다.
AI는 틀렸을 때 자신 있게 틀립니다. "검증됨"이라는 AI의 말을 그대로 신뢰하면 의사결정이 왜곡됩니다. 도메인 전문가의 검토 단계를 반드시 유지해야 합니다.
AI는 방향을 스스로 설정하지 못합니다. "어떤 작업이 성과를 낼지" 판단하는 것은 여전히 인간의 역할입니다. AI가 작업을 잘 수행했다는 것이, 올바른 작업을 선택했다는 의미는 아닙니다.
전문가 감독 없는 AI 자율 운영은 오류를 누적시킵니다. 이번 실험에서 교수의 물리학 전문 지식 없이는 AI 오류를 잡을 수 없었습니다. 비전문가 영역에서 AI를 자율 운영하면 오류가 쌓입니다.
AI는 10배 빠른 실행을 제공합니다. 올바른 방향을 설정하는 것은 여전히 당신의 일입니다.