AI가 ML 논문을 혼자 썼습니다, Nature도 실었습니다
9분

AI가 ML 논문을 혼자 썼습니다, Nature도 실었습니다

Nature Sakana AI + UBC + Vector Institute + Oxford 원문 보기 ↗

AI Scientist v2가 ICLR 2025 워크숍 피어리뷰를 통과했습니다. 평균 6.33점으로 인간 논문 55%를 앞질렀습니다.

아이디어 생성부터 논문 작성까지 ML 연구 전 과정을 AI가 자동 수행합니다.

기반 모델이 개선될수록 논문 품질이 비례해 상승하는 스케일링 법칙이 확인됐습니다.

AI 연구원을 고용하셨나요?
Sakana AI의 AI가 아이디어부터 논문 제출까지 혼자 해냈습니다.
인간 논문의 55%보다 높은 점수를 받았습니다.

"AI가 논문을 쓴다"는 말은 2024년부터 들렸습니다. 하지만 인간 연구자가 검토하는 피어리뷰를 통과한 사례는 없었습니다. 2026년 3월 26일, Sakana AI의 연구가 Nature에 정식 게재됐습니다(Lu et al., 2026). AI Scientist v2는 ICLR 2025 워크숍에서 평균 6.33점을 받아 인간 논문 55%를 앞질렀습니다. ML 연구 자동화가 이론을 넘어 검증 단계에 들어섰습니다.

R&D 비용은 기업의 핵심 지출입니다. ML 연구 한 사이클에는 연구자 수개월의 시간이 들어갑니다. AI Scientist는 아이디어 생성, 문헌 검색, 실험 설계, 실험 실행, 논문 작성을 자동 수행합니다(Lu et al., 2026). 더 중요한 것은 스케일링 법칙입니다. 기반 모델이 강해질수록 산출 논문의 품질도 비례해 오릅니다. AI 모델 개선이 곧 연구 생산성 향상으로 이어지는 구조입니다.

첫째, AI가 ML 연구 전 과정을 자동 수행합니다. 아이디어 생성, 문헌 검색, 실험 설계 및 실행, 논문 작성(LaTeX), 자체 리뷰까지 이어집니다. 병렬 에이전트 트리 탐색으로 실험을 동시에 진행합니다. 시각 모델이 그래프와 그림에 피드백을 줍니다(Lu et al., 2026). 사람의 개입 없이 논문 한 편이 완성됩니다.

둘째, v2는 최초로 인간 피어리뷰를 통과했습니다. ICLR 2025 ICBINB(I Can't Believe It's Not Better) 워크숍에 논문을 제출했습니다. 세 심사위원이 6, 7, 6점을 부여했습니다. 평균 6.33점으로 인간 저자 논문 55%보다 높은 점수입니다(Lu et al., 2026). AI가 쓴 논문이 사람이 쓴 논문보다 더 많이 합격 기준을 넘겼습니다.

지표 AI Scientist v2 비교 기준
ICLR 워크숍 평균 점수 6.33점 인간 논문 55%보다 높음
심사위원 점수 6 / 7 / 6 3인 독립 심사
Automated Reviewer 정확도 균형 정확도 69% 인간 수준
F1-score NeurIPS 2021 인간 합의율 초과 수천 건 OpenReview 데이터 기준

출처: Lu et al. (2026), Nature. AI Scientist v2 ICLR 2025 ICBINB 워크숍 제출 결과.

셋째, Automated Reviewer도 인간 수준에 도달했습니다. AI가 논문을 작성할 뿐 아니라 평가도 합니다. 균형 정확도 69%는 인간 심사위원과 동급입니다. NeurIPS 2021 인간 합의율 실험에서 F1-score를 초과했습니다(Lu et al., 2026). 수천 건의 실제 OpenReview 데이터로 검증했습니다.

넷째, 스케일링 법칙이 논문 품질에도 적용됩니다. 기반 모델이 개선되면 생성 논문의 품질이 비례해 오릅니다(Lu et al., 2026). 모델 개선에 투자하면 연구 생산성이 자동으로 올라가는 구조입니다. AI 모델 경쟁이 연구 자동화 경쟁과 연결됩니다.

다섯째, 연구팀은 윤리 가이드라인을 선제 적용했습니다. 합격한 논문을 발행 전 자진 철회했습니다. IRB(기관생명윤리심의위원회) 승인을 받았습니다. 모든 AI 생성 논문에 워터마크 적용을 권고했습니다(Lu et al., 2026). 워크숍 주최 측의 사전 허가를 받고 제출했습니다.

1
R&D 팀장에게 이 연구를 공유하고 함의를 논의합니다.
ML 연구 자동화가 피어리뷰를 통과했다는 사실을 전달합니다. "우리 연구 프로세스 중 어디를 자동화할 수 있는가"를 함께 검토합니다. AI Scientist GitHub 저장소 링크(SakanaAI/AI-Scientist-v2)를 첨부합니다. (30분, 슬랙 메시지 또는 간단한 브리핑)
2
자사의 반복적 연구 작업을 목록화합니다.
문헌 검색, 실험 파라미터 튜닝, 결과 정리 중 반복되는 것을 적습니다. 이 중 AI Scientist가 이미 자동화한 단계와 겹치는 항목을 표시합니다. Claude에 "이 작업들 중 현재 LLM으로 자동화 가능한 것을 분류해줘"라고 요청합니다. (1시간, 워크플로우 분석)
3
AI 생성 콘텐츠 식별 정책을 검토합니다.
연구팀이 제안한 AI 워터마크 권고는 기업에도 적용됩니다. AI가 생성한 보고서, 분석, 제안서에 출처 표기 정책이 있는지 확인합니다. 없다면 간단한 내부 가이드라인(AI 활용 여부 명시)을 초안으로 작성합니다. (2시간, 정책 초안)

현재는 계산 실험만 가능합니다. AI Scientist는 컴퓨터로 실행하는 ML 실험에 한정됩니다. 물리 실험, 임상시험, 현장 조사가 필요한 연구에는 적용할 수 없습니다(Lu et al., 2026). 적용 범위를 과대평가하지 않는 것이 중요합니다.

할루시네이션과 미숙한 아이디어 문제가 남아 있습니다. 부정확한 인용 생성, 그림 중복 같은 오류가 발생합니다(Lu et al., 2026). 아이디어 수준이 낮거나 방법론이 얕은 논문도 있습니다. 인간 검토 없이 결과를 그대로 신뢰하면 안 됩니다.

연구 윤리 기준이 아직 형성 중입니다. AI 논문의 저자 자격, 책임 귀속, 공개 요건이 학계마다 다릅니다. Nature의 편집 정책(2026년 4월 발표)과 같이 각 저널의 AI 활용 기준을 확인해야 합니다. 미리 파악하지 않으면 제출 거부 또는 철회 요청을 받을 수 있습니다.

스케일링 이점은 고품질 모델 접근을 전제로 합니다. 기반 모델이 강할수록 성능이 오른다는 것은, 최신 모델 접근 비용이 연구 품질에 직결된다는 의미입니다. 모델 접근 비용이 새로운 연구 격차로 이어질 수 있습니다.

AI가 ML 논문을 혼자 쓰고 피어리뷰를 통과했습니다. 연구 자동화는 이미 검증 단계입니다.

CTO ML 연구 파이프라인의 자동화 가능 단계를 지금 파악하라. 기반 모델 개선이 연구 생산성과 직결된다.
R&D 팀장 반복적 실험 설계와 결과 정리부터 AI 보조 도입을 검토하라. 전면 자동화가 아닌 단계적 적용이 현실적이다.
임원 AI 생성 연구 산출물에 대한 내부 검토 및 출처 표기 정책을 수립하라. 학술 윤리 기준이 기업 거버넌스 기준이 된다.

피어리뷰(Peer Review): 논문 제출 후 해당 분야 전문가들이 연구의 타당성과 품질을 검토하는 과정입니다. 학술 출판의 핵심 품질 관문입니다.

ICLR: 국제 학습 표현 학술대회(International Conference on Learning Representations)입니다. ML 분야 최상위 학술대회 중 하나입니다.

균형 정확도(Balanced Accuracy): 합격과 불합격 두 클래스를 각각 얼마나 잘 맞추는지 평균한 지표입니다. 데이터 불균형 상황에서 단순 정확도보다 신뢰도가 높습니다.

스케일링 법칙(Scaling Law): 모델 크기나 데이터가 커질수록 성능이 예측 가능한 비율로 향상되는 현상입니다.

에이전트 트리 탐색: AI가 여러 실험 경로를 동시에 탐색해 최적 결과를 찾는 방식입니다. 체스 AI의 탐색 전략과 유사합니다.

IRB(기관생명윤리심의위원회): 연구 참여자 보호와 연구 윤리를 심의하는 기관입니다. 대학과 연구기관이 운영합니다.

  • Lu, C., Lu, C., Lange, R. T., Foerster, J., Clune, J., & Ha, D. (2026, March). The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery [Article]. Nature. (원문 보기 ↗)
  • Sakana AI. (2026, March). The AI Scientist: Nature Publication [Blog post]. Sakana AI. (원문 보기 ↗)
라운드테이블
B
블랙 · 중견기업 임원
AI가 아이디어부터 논문 제출까지 혼자 했고 피어리뷰를 통과했습니다. 기반 모델이 강해질수록 연구 생산성이 올라가는 구조. R&D 팀장들 지금 대화 시작해야 합니다.
R
레드 · 저널리스트
합격한 논문을 자진 철회했다는 게 중요합니다. 왜 철회한 건지 논문에 나와 있나요? 그리고 워크숍 주최 측 사전 허가를 받았다면 일반 피어리뷰와 조건이 다른 거 아닌가요?
B
블랙 · 중견기업 임원
윤리 선제 적용이 오히려 신뢰 신호입니다. IRB 승인에 워터마크 권고까지 했어요. 조건이 달라도 심사위원 3인이 6/7/6점을 준 건 사실이에요.
N
네이비 · 시니어 엔지니어
병렬 에이전트 트리 탐색으로 실험 동시 진행. 실제로 구현하면 컴퓨팅 비용이 상당합니다. 균형 정확도 69%는 인상적이지만 ML 한정입니다. 물리 실험이나 임상에는 못 씁니다.
G
골드 · 창업자
우리 같은 SaaS 스타트업은 ML 실험이 주니까 직접적이에요. 문헌 검색이랑 파라미터 튜닝 자동화만 돼도 스프린트 1개는 줄어들 것 같아요. GitHub 저장소 찍어봤는데 생각보다 진입 장벽이 있더라고요.
P
퍼플 · 마케터
"AI 연구원 고용"이라는 프레임이 경영진한테 먹히더라고요. 연봉 없이 24시간 논문 쓰는 연구원이라고 하면 눈이 번쩍해요. 예산 얘기 꺼내기도 훨씬 쉬워지고요.
W
화이트 · 조직장
AI 생성 보고서에 출처 표기 정책 만들라고 하는데, 저희 팀은 이미 AI를 쓰고 있어요. 지금껏 표기 안 했는데 소급해서 정책 만들면 어떻게 되는 건지 모르겠어요.
R
레드 · 저널리스트
소급 적용이 아니라 지금부터 기준을 세우는 겁니다. Nature도 2026년 4월에 편집 정책 발표했어요. 기업도 늦기 전에 내부 가이드라인 초안이라도 있어야 해요.
N
네이비 · 시니어 엔지니어
2시간이면 초안 만듭니다. "AI 활용 여부 명시" 한 줄로 시작하세요. 할루시네이션 사고 나면 책임 소재 불명확해집니다. 미리 만들어두는 게 비용이 훨씬 적어요.
_posts/2026-03-26-ai-scientist-nature.md