범용 AI가 화학 전용 소프트웨어를 따라잡았습니다
11분

범용 AI가 화학 전용 소프트웨어를 따라잡았습니다

Anthropic David Kamber 원문 보기 ↗

Anthropic이 화학 특화 학습을 전혀 하지 않은 클로드로 NMR 스펙트럼 예측을 시험했습니다.

Opus 4.7의 수소 예측 평균 오차는 0.079ppm으로, 전용 소프트웨어 MestReNova(0.150ppm)를 앞섰습니다.

스펙트럼에서 분자 구조를 거꾸로 알아내는 역추정까지 해냈습니다. 전용 도구도 어려운 작업입니다.

당신 업계의 '전용 소프트웨어'는 정말 안전합니까?
수십 년 쌓인 화학 전용 도구를, 화학을 따로 배운 적 없는 범용 AI가 따라잡았습니다.

모든 산업에는 '전용 소프트웨어'가 있습니다. 그 분야만 수십 년 파온 도구입니다. 회계, 설계, 물류, 그리고 화학이 그렇습니다. 우리는 보통 이 도구들을 대체 불가능한 자산으로 여깁니다.

Anthropic의 이번 실험은 그 전제를 건드립니다. 화학을 따로 배운 적 없는 범용 모델 클로드가, 화학 전용 NMR 분석 소프트웨어를 따라잡거나 앞섰습니다. 전용 도구만 풀던 문제를 추가 학습 없이 풀어낸 것입니다. 지금 당신 조직이 매년 라이선스 비용을 내는 전용 도구를 떠올려 보세요. 화학에서 무너진 벽이라면, 그 목록의 어느 항목이 다음 차례인지 물어야 합니다.

NMR(핵자기공명분광법)은 화학자가 분자의 구조를 확인하는 핵심 도구입니다. 분자에 자기장을 걸면 원자가 신호를 내고, 그 신호의 위치로 구조를 읽습니다. 신약, 소재, 화학 공정 연구의 일상 업무입니다.

이 분석에는 두 방향이 있습니다. 정방향은 '구조를 알 때 스펙트럼을 예측'하는 일입니다. 역방향은 '스펙트럼만 보고 구조를 거꾸로 알아내는' 일입니다. 지금까지 정방향은 ChemDraw, MestReNova 같은 전용 소프트웨어가, 역방향은 더 비싼 특수 도구와 2D NMR 데이터가 맡았습니다.

Anthropic은 클로드 세 모델(Opus 4.7, Opus 4.6, Sonnet 4.6)을 이 전용 도구들과 같은 문제에서 겨루게 했습니다. 평가에는 모델 학습 마감 이후 ChemRxiv에 올라온 화합물 20개를 썼습니다. 외운 답이 아니라는 점을 보장하기 위해서입니다. 화합물은 네 가지 골격 계열로 나뉘고, 계열마다 5개씩입니다.

정방향 예측 평가에 사용한 네 가지 분자 골격 계열
정방향 예측 평가에 쓰인 네 가지 골격 계열입니다. 각 계열은 서로 다른 NMR 난이도를 시험하며, 계열마다 화합물 5개씩 총 20개를 사용했습니다. 출처: Anthropic (2026), Making Claude a Chemist

첫째, 범용 모델이 전용 도구를 앞섰습니다. 정방향 예측에서 Opus 4.7의 수소 평균 오차는 0.079ppm입니다. 전용 소프트웨어 MestReNova(0.150ppm)와 ChemDraw(0.143ppm)의 절반 수준입니다. 탄소 예측에서도 Opus 4.7이 1.375ppm으로 가장 정확했습니다. 화학을 따로 학습하지 않은 모델의 결과입니다.

모델 사이에도 순서가 보입니다. Opus 4.7이 가장 정확하고, Opus 4.6, Sonnet 4.6 순입니다. 세대가 올라갈수록 화학 과제 성능이 함께 올랐습니다. 별도 화학 튜닝 없이 일반 능력이 좋아진 결과라는 점이 핵심입니다.

도구 수소 평균오차
ppm · 낮을수록 좋음
탄소 평균오차
ppm · 낮을수록 좋음
Opus 4.7 (범용 AI) 0.079 1.375
Opus 4.6 (범용 AI) 0.113 1.680
Sonnet 4.6 (범용 AI) 0.145 2.152
MestReNova (전용 도구) 0.150 1.484
ChemDraw (전용 도구) 0.143 2.107

20개 화합물 정방향 예측의 평균 절대 오차(MAE)입니다. 수소와 탄소 모두에서 Opus 4.7이 전용 소프트웨어를 앞섰습니다. 출처: Anthropic (2026), Making Claude a Chemist.

20개 화합물에 대한 도구별 수소·탄소 예측 오차 비교
도구별 수소(왼쪽)·탄소(오른쪽) 예측 오차입니다. 막대가 낮을수록 정확합니다. 범용 AI(주황·초록·빨강)가 전용 도구(회색)와 같은 줄에 서거나 앞섭니다. 출처: Anthropic (2026), Making Claude a Chemist

둘째, 미세한 신호 패턴에서 격차가 더 컸습니다. 스펙트럼의 봉우리는 더 잘게 쪼개집니다. 이 분할 간격을 0.5Hz 안으로 맞히는 비율에서 클로드 세 모델은 약 80%였습니다. 전용 소프트웨어는 26~35%에 그쳤습니다.

봉우리가 쪼개지는 모양에는 원자 사이의 연결 정보가 담깁니다. 정확도가 두 배 이상 벌어졌다는 것은, 단순 평균 위치만이 아니라 구조의 결까지 읽는다는 뜻입니다. 전용 도구의 강점이라 여겨지던 영역입니다.

셋째, 거꾸로 푸는 능력이 진짜 차이입니다. 정방향은 클로드가 전용 도구를 앞선 정도지만, 역방향은 전용 도구가 잘 못 하는 일입니다. 스펙트럼만 보고 분자 구조를 알아내는 작업입니다. Opus 4.7은 단순한 분자 8개를 매번 모두 맞혔습니다.

고리가 얽힌 복잡한 분자 7개에서는, 출발물질 구조를 힌트로 주자 4개를 3회 모두, 나머지 3개를 3회 중 2회 맞혔습니다. 전용 구조 분석 도구는 보통 2D NMR 데이터와 별도 훈련이 필요합니다. 범용 AI는 분자식과 1D 스펙트럼만으로 그 일을 했습니다.

여기서 경제적 의미가 나옵니다. 역방향 분석은 그동안 비싼 특수 장비와 추가 데이터라는 비용 장벽 뒤에 있었습니다. 범용 AI가 그 장벽을 낮추면, 전용 도구 예산이 없어 포기했던 문제가 다시 후보로 올라옵니다. 비용 때문에 못 풀던 일이 풀 수 있는 일로 바뀝니다.

스펙트럼만으로 역추정에 성공한 분자 구조들
역방향 추정에 성공한 분자들입니다. 위쪽(초록)은 분자식과 스펙트럼만으로, 아래쪽(파랑)은 출발물질 정보를 추가로 받아 풀었습니다. 대부분 3회 모두 정답입니다. 출처: Anthropic (2026), Making Claude a Chemist
0.079 ppm
Opus 4.7 수소 예측 평균오차 (전용 MestReNova 0.150ppm의 절반)
약 80%
분할 패턴 0.5Hz 내 정확도 (전용 도구 26~35%)
8 / 8
단순 분자 역추정, Opus 4.7이 매 시도 전부 정답
1
우리 조직이 의존하는 '전용 소프트웨어' 목록을 적으세요.
분야별 전용 도구, 라이선스 비용, 그 도구만 풀던 작업을 한 표에 정리합니다. 그중 정답을 검증할 수 있는 작업 하나를 골라 범용 AI에 같은 문제를 던져봅니다. 화학에서 무너진 가정이 우리 목록에도 있는지 확인하는 일입니다. (이번 주)
2
'정답이 있는 작업'부터 시험하세요.
이번 실험이 설득력 있는 이유는 학습 마감 이후 화합물로 정답을 검증했기 때문입니다. 우리 업무에서도 답을 객관적으로 채점할 수 있는 작업이 출발점입니다. 정답이 명확한 과제 하나를 정해, 범용 AI 결과와 기존 도구 결과를 같은 기준으로 나란히 놓습니다. (1주일)
3
'거꾸로 푸는 문제'를 찾으세요.
가장 큰 가치는 정방향이 아니라 역방향에서 나왔습니다. 기존 도구가 한 방향만 풀던 업무를 떠올립니다. 결과에서 원인을, 데이터에서 설계를 역추정하는 질문을 범용 AI에 던져봅니다. 전용 도구가 비싸서 포기했던 문제가 후보입니다. (1개월)

평가 규모가 작습니다. 저자가 직접 인정합니다. 정방향은 화합물 20개, 골격 4계열에 그쳤습니다(Anthropic, 2026). 통계적으로 일반화하기엔 표본이 작습니다. "범용 AI가 전용 도구를 이겼다"를 모든 화학 과제로 확대하면 과장입니다. 한 가지 유망한 신호로 읽는 것이 정확합니다.

범위가 좁습니다. 2D NMR, 입체화학, 복잡한 천연물은 설계상 제외했습니다. 시험하지 않은 골격과 용매도 남아 있습니다. 복잡한 구조는 출발물질 힌트가 있어야 풀렸습니다. 가장 어려운 실제 연구 현장을 그대로 대표하지는 않습니다.

전문가 검증은 여전히 필요합니다. 모델이 결론을 내지 못하고 추론만 맴도는 경우가 있었습니다(Anthropic, 2026). 화학자를 대체하는 도구가 아니라, 화학자의 일상 분석을 돕는 보조 도구로 보는 편이 맞습니다. 답의 옳고 그름을 판정하는 사람은 여전히 전문가입니다.

전용 소프트웨어의 해자는 생각보다 얕습니다. 범용 AI가 전문 영역의 문턱을 빠르게 넘고 있습니다.

창업자/CEO 자사가 의존하는 전용 SaaS와 라이선스 목록을 분기마다 재평가하라. 범용 AI로 대체 가능한 항목이 늘고 있는지가 핵심 질문이다.
CTO/AI 리드 정답을 자동으로 채점할 수 있는 작업부터 범용 AI를 시험하라. 검증 가능한 그라운드 트루스 확보가 도입의 첫 단추다.
사업/기획 기존 도구가 한 방향만 풀던 업무에서 '역방향' 질문을 설계하라. 결과에서 원인을 거꾸로 푸는 곳에 새 가치가 있다.

NMR (핵자기공명분광법): 분자에 자기장을 걸어 원자가 내는 신호로 구조를 확인하는 분석법입니다. 신약, 소재, 화학 공정 연구의 기본 도구입니다.

정방향 / 역방향 예측: 정방향은 구조를 알 때 스펙트럼을 예측하는 일, 역방향은 스펙트럼만 보고 구조를 거꾸로 알아내는 일입니다. 역방향이 더 어렵습니다.

ppm (parts per million): NMR 신호의 위치를 나타내는 단위입니다. 예측 위치와 실제 위치의 차이가 작을수록 정확합니다.

SMILES: 분자 구조를 한 줄의 문자로 표현하는 표준 표기법입니다. 모델에 분자를 입력할 때 사용했습니다.

MestReNova / ChemDraw: 화학자들이 NMR 예측에 쓰는 대표적인 전용 소프트웨어입니다. 이번 실험의 비교 대상입니다.

골격 (Scaffold): 분자의 핵심 뼈대 구조입니다. 골격이 다르면 NMR 신호의 패턴과 난이도가 달라집니다.

  • Kamber, D. (2026, June). Making Claude a Chemist [Article]. Anthropic. (원문 보기 ↗)
라운드테이블
B
블랙 · 중견기업 임원
저는 이제 '전용 소프트웨어는 안전하다'는 말 안 믿어요. 화학 따로 안 배운 모델이 ChemDraw, MestReNova를 따라잡았잖아요. 우리 회사 쓰는 전용 도구도 다시 봐야 해요.
R
레드 · 저널리스트
화합물 20개 가지고 그런 결론을 내요? 골격도 4종류뿐이에요. 저자들도 표본 작다고 직접 인정했잖아요. 그걸 모든 산업으로 넓히면 그냥 광고예요.
B
블랙 · 중견기업 임원
표본 작아도 오차가 전용 도구의 절반이에요. 0.079 대 0.150이요. 저는 '확정'이라 안 했어요. '재평가하라'고 했어요. 그 둘은 달라요.
N
네이비 · 시니어 엔지니어
숫자보다 중요한 건 검증 방식이에요. 학습 마감 이후에 올라온 화합물로 시험했어요. 외운 답이 아니라는 뜻이에요. 이게 없으면 어떤 점수도 못 믿어요.
G
골드 · 창업자
맞아요. 저도 자사 데이터로 범용 모델 테스트해봤는데요, 결국 '정답을 자동으로 채점할 수 있냐'가 전부였어요. 채점 기준 없으면 시작도 못 해요.
W
화이트 · 조직장
그래서 저 같은 비개발자는 뭐부터 해요? 본문 말대로 우리 회사 전용 도구랑 라이선스 비용부터 표로 적으면 되는 거예요? 거기서 출발하면 맞아요?
P
퍼플 · 마케터
저는 역방향이 제일 와닿았어요. 비싼 장비 없이 스펙트럼만으로 구조를 거꾸로 알아낸다니. '비용 때문에 못 풀던 일이 풀린다'는 말, 진짜 그림이 그려지더라고요.
R
레드 · 저널리스트
그림은 좋은데요, 단순한 분자 8개만 매번 맞혔어요. 복잡한 건 출발물질 힌트를 줘야 풀렸고요. '거꾸로 다 푼다'가 아니라 '쉬운 건 푼다'예요.
G
골드 · 창업자
그건 지금 얘기예요. 세대 올라갈 때마다 좋아졌잖아요. Sonnet보다 Opus 4.6, 그보다 4.7이요. 저는 지금 완성도보다 1년 뒤 기울기가 더 무서워요.
B
블랙 · 중견기업 임원
골드 말이 핵심이에요. 지금 완벽하냐가 아니라 방향이 어디냐예요. 전용 도구 계약 갱신 전에 범용 AI로 한 번씩 재보면 돼요. 그게 안전장치예요.
_posts/2026-06-05-claude-chemist-nmr.md