AI가 AI를 설계한다, 사람 없이
10분

AI가 AI를 설계한다, 사람 없이

arXiv Weixian Xu 외 8인 원문 보기 ↗

ASI-Evolve가 신경망 설계, 데이터 정제, 강화학습을 자동화했습니다.

1,773회 탐색에서 105개 최첨단 신경망을 발견했습니다.

데이터 정제로 MMLU 18점, 강화학습으로 12.5점을 올렸습니다.

AI가 사람보다 3배 빠르게 신경망을 설계합니다.
당신의 AI 팀은 아직 모델 하나를 고르고 있습니까?

AI 기술은 매년 빨라지고 있습니다. 이 속도 자체가 더 빨라집니다. AI가 AI 연구를 자동화하기 시작했기 때문입니다. 1,773회 자동 탐색에서 105개 신경망을 설계했습니다. 사람 연구팀 성과의 약 3배입니다.

AI 연구 자동화 경쟁이 가속하고 있습니다. Google의 AlphaEvolve, Meta의 HyperAgents가 등장했습니다. 하지만 기존 시스템은 단일 영역에 집중했습니다. ASI-Evolve는 3개 영역을 동시에 자동화한 첫 시스템입니다(Xu et al., 2026). AI 발전 속도 자체가 빨라진다는 뜻입니다.

첫째, 1,773회 탐색으로 105개 신경망을 발견했습니다. ASI-Evolve는 '학습, 설계, 실험, 분석' 순환을 자동 반복합니다. 선형 어텐션 모델을 설계합니다. 기존 최고 모델 대비 +0.97점, 사람 연구 성과의 약 3배입니다(Xu et al., 2026). AI 모델 성능이 가속 개선되면 기업의 AI 전략 수명도 짧아집니다.

모델 설계자 개발 평균 일반화 평균 전체 평균
DeltaNet 사람 55.76 44.74 51.04
Gated-DeltaNet 사람 55.09 44.28 50.46
Mamba2 사람 56.47 44.61 51.38
FusionGated-FIRNet AI 57.28 44.99 52.01
Hier-GateNet AI 56.59 45.40 51.79

3.4억 파라미터 모델, 150억 토큰 학습 기준. 개발 평균: 10개 벤치마크, 일반화 평균: 6개 벤치마크. AI 설계 모델 5개 중 상위 2개 표시. 출처: Xu et al. (2026), Table 1.

둘째, 데이터 정제만으로 MMLU 점수가 18점 올랐습니다. 672억 토큰 규모의 학습 데이터에 자동 정제를 적용했습니다. MMLU 점수가 27.49에서 46.13으로 올랐습니다. 의학 지식 +13점, 상식 추론 +18점도 함께 올랐습니다. 기존 공개 학습 데이터보다 높은 성능입니다.

평가 항목 정제 전 정제 후 향상
MMLU (57개 분야 지식) 27.49 46.13 +18.64
MedQA (의학 지식) 26.77 40.25 +13.48
CSQA (상식 추론) 20.31 39.12 +18.81
ARC-C (과학 추론) 43.52 49.32 +5.80
전체 평균 (18개 항목) 40.17 44.13 +3.96

30억 파라미터 모델, 5000억 토큰 학습 기준. 정제 전: Nemotron-CC 원본 데이터. 정제 후: ASI-Evolve 자동 정제 적용. 출처: Xu et al. (2026), Table 2.

셋째, AI가 설계한 학습 알고리즘이 GRPO를 넘었습니다. GRPO는 대표적인 강화학습 알고리즘입니다. 최고 알고리즘은 수학 평가에서 +12.5점을 기록했습니다(67.5 → 80.0). 수학 경시대회 AIME24에서도 +11.67점 올랐습니다. AI가 만든 학습법이 사람이 만든 학습법을 넘었습니다.

수학 평가 사람이 설계한 GRPO AI가 설계한 최고 알고리즘 향상
AI가 설계한 5개 알고리즘 vs 사람이 설계한 GRPO
Math500 82.0 85.6 / 84.6 / 84.8 / 82.4 / 82.0 +3.6
AMC32 (수학 경시) 67.5 80.0 / 77.5 / 77.5 / 75.0 / 72.5 +12.5
AIME24 (수학 올림피아드) 20.00 31.67 / 23.33 / 30.00 / 20.00 / 20.00 +11.67
AIME25 (수학 올림피아드) 20.00 29.58 / 23.75 / 30.00 / 20.00 / 23.33 +10.00
OlympiadBench 45.92 50.96 / 48.74 / 49.18 / 46.81 / 45.62 +5.04

Qwen-3-14B 모델 기준, 250 학습 스텝 후 평가. AI 설계 열은 알고리즘 1~5의 점수를 순서대로 표시. 5개 중 4개가 모든 항목에서 GRPO 이상 성능. 출처: Xu et al. (2026), Table 3.

넷째, '인지 기반'이 탐색 효율의 핵심입니다. 인지 기반은 기존 논문 지식을 모아둔 저장소입니다. 150편의 논문에서 추출한 지식이 탐색 방향을 안내합니다. 인지 기반을 제거하면 탐색 시작이 크게 느려집니다(Xu et al., 2026). 기업의 AI 실험 노하우도 이렇게 축적하면 경쟁 우위가 됩니다.

프레임워크 사용 모델 탐색 횟수 최고 점수
OpenEvolve Gemini 2.0 Flash + Claude 3.7 460회 2.6343
AlphaEvolve Gemini 2.0 Flash + Claude 3.7 미공개 2.6359
SkyDiscover GPT-5 89회 2.6360
ASI-Evolve GPT-5-mini (소형 모델) 17회 2.6360

26개 원을 1×1 정사각형에 배치하는 최적화 문제. 같은 최고 점수에 도달하는 데 ASI-Evolve는 17회, 경쟁 시스템은 89~460회 소요. 인지 기반이 탐색 효율을 27배 높인 결과. 출처: Xu et al. (2026), Table 4.

다섯째, AI 연구를 넘어 신약 개발에도 적용됩니다. 약물과 단백질의 상호작용 예측에 적용했습니다. 미지 약물 예측 정확도가 6.94점 향상됐습니다. 미지 단백질 예측도 3.56점 올랐습니다. AI 연구 자동화 기술이 바이오, 소재, 금융 등 다른 산업으로 확장됩니다.

모델 설계자 BindingDB-Dev BindingDB-Random Human BioSNAP
TransformerCPI 사람 - 93.96 96.03 86.35
PSICHIC 사람 - 91.67 98.55 91.64
DrugBAN 사람 94.15 94.89 98.61 89.43
ASI-Evolve AI 96.06 95.94 98.89 89.68

AUROC 점수 기준 (100점 만점). 약물-단백질 상호작용 예측 정확도. 4개 벤치마크 전체에서 AI 설계 모델이 1위. 출처: Xu et al. (2026), Table 5.

예측 조건 사람이 설계한 모델 AI가 설계한 모델 향상
미지 약물 예측 79.15 86.09 +6.94
미지 단백질 예측 82.26 85.82 +3.56
미지 약물 + 단백질 76.47 80.83 +4.36

AUROC 점수 기준 (100점 만점). 사람이 설계한 모델: DrugBAN. 학습 데이터에 없는 약물/단백질에 대한 예측 정확도. 출처: Xu et al. (2026), Table 6.

1
AI 기술 가속 현황을 팀에 공유합니다.
ASI-Evolve 사례를 5분 브리핑으로 만듭니다. 'AI가 사람보다 3배 빠르게 신경망을 설계한다'는 팩트를 전달합니다. AI 전략 갱신 주기를 단축해야 한다는 근거로 활용합니다. (30분, 브리핑 자료 작성)
2
학습 데이터 품질을 점검합니다.
ASI-Evolve의 데이터 정제만으로 MMLU 18점이 올랐습니다. Claude에 "현재 학습 데이터의 노이즈 유형 5가지를 분류해줘"라고 요청합니다. 자사 데이터에서 정제 대상을 식별합니다. (1시간, 데이터 품질 감사)
3
AI 실험 지식을 체계적으로 기록합니다.
ASI-Evolve의 핵심은 '인지 기반', 축적된 지식입니다. 조직 내 AI 실험 결과와 실패 사례를 문서화합니다. Notion에 'AI 실험 로그' 페이지를 만듭니다. (2시간, 템플릿 설계)

연구 논문이지 상용 제품이 아닙니다. ASI-Evolve는 학술지 게재 전 공개된 연구 논문입니다. 오픈소스 코드가 있지만 실제 운영에는 상당한 엔지니어링이 필요합니다.

대규모 연산 자원이 필요합니다. 신경망 설계 실험은 1,773회 반복됩니다. 대규모 검증은 13억 파라미터 모델을 사용합니다. 중소기업이 자체 운영하기 어려운 규모입니다.

자동 설계된 신경망은 해석이 어렵습니다. AI가 왜 이런 구조를 선택했는지 사람이 파악하기 어렵습니다. 핵심 시스템에 적용하려면 작동 원리 검증이 필수입니다.

AI 연구 인력의 역할이 바뀝니다. 자동화가 확산되면 연구자 역할은 '설계자'에서 '감독자'로 전환됩니다. 조직 내 AI 인력 전략을 재검토해야 합니다.

AI가 AI를 설계하고 개선하는 시대가 시작됐습니다. 향후 AI 경쟁력은 사람의 수가 아니라 자동화 체계의 품질로 결정됩니다.

CTO AI 기술 발전 가속이 자사 AI 전략 수명에 미치는 영향을 분석하고, 전략 갱신 주기를 단축하라
팀장 AI 실험 결과를 체계적으로 기록하는 '인지 기반' 문서를 팀 내에 구축하라
임원 AI 연구 자동화가 경쟁 구도를 바꿀 수 있다. AI 투자 계획에 자동화 파이프라인을 포함하라

선형 어텐션: 입력 길이에 비례해 연산하는 효율적 방식입니다. 기존 Transformer보다 연산량이 적어 대규모 처리에 유리합니다.

MMLU(Massive Multitask Language Understanding): 수학, 역사, 과학 등 57개 분야의 지식을 측정하는 대규모 평가입니다.

GRPO(Group Relative Policy Optimization): AI가 생성한 여러 응답을 비교해 더 나은 답변을 학습시키는 강화학습 알고리즘입니다.

인지 기반(Cognition Base): 기존 연구 논문에서 추출한 지식을 모아 탐색 방향을 안내하는 저장소입니다.

토큰: AI가 텍스트를 처리하는 최소 단위입니다. 한국어 한 글자는 보통 1~2토큰에 해당합니다.

파라미터: AI 모델이 학습한 내부 수치입니다. 많을수록 복잡한 패턴을 학습할 수 있습니다.

  • Xu, W., Mi, T., Liu, Y., Nan, Y., Zhou, Z., Ye, L., Zhang, L., Qiao, Y., & Liu, P. (2026, March). ASI-Evolve: AI Accelerates AI [Article]. arXiv. (원문 보기 ↗)
라운드테이블
R
레드 · 저널리스트
1,773회 탐색에서 105개 신경망, 사람의 3배라는 수치가 나왔는데 비교 대상인 "사람 연구팀"이 몇 명이었습니까? 논문 팀 규모와 기간이 명시됐나요?
N
네이비 · 시니어 엔지니어
선형 어텐션 모델 한 도메인 한정입니다. FusionGated-FIRNet 전체 평균 52.01점, Mamba2 51.38점. 0.6점 차이예요. 수치만 보면 극적인 격차는 아닙니다.
B
블랙 · 중견기업 임원
점수 차가 아니라 속도가 핵심입니다. MMLU 18점, 수학 12.5점 향상을 사람 없이 자동화했다는 게 전략적 신호예요. AI 발전 자체가 빨라진다는 구조 변화입니다.
G
골드 · 창업자
솔직히 이런 거 나올 때마다 "우리가 지금 쓰는 모델이 금방 구식 되겠구나" 싶어요. AlphaEvolve, HyperAgents, ASI-Evolve 다 나왔는데 기업은 어떤 모델 기준으로 전략 짜야 하는 거예요?
B
블랙 · 중견기업 임원
모델 선택 기준보다 워크플로우 설계가 먼저입니다. 모델은 바뀝니다. 어떤 모델이 들어와도 쓸 수 있는 프로세스를 짜두면 교체 비용이 작아요.
P
퍼플 · 마케터
"AI가 AI를 설계한다"는 프레임은 팀한테 설명하기 너무 어렵더라고요. "AI가 스스로 업그레이드된다"고 바꾸면 그나마 반응이 와요. 개념이 낯설수록 비유가 중요해요.
W
화이트 · 조직장
AI 전략 수명이 짧아진다는 게 제일 무서워요. 올해 도입 계획 세웠는데, 내년이면 다 바뀐다는 건가요? 경영진 설득해서 예산 따내면 그게 이미 구식인 상황이 될 수도 있겠네요.
R
레드 · 저널리스트
ASI-Evolve는 arXiv 논문이고 아직 실운영 검증이 없습니다. 연구 결과와 기업 도입 사이 간극이 있어요. 지금 계획을 버릴 이유는 없습니다.
N
네이비 · 시니어 엔지니어
맞습니다. 3개 영역 동시 자동화도 각 영역별 파이프라인 구축이 전제입니다. 기반 없이 ASI-Evolve 적용은 불가능해요. 지금 기반 구축이 오히려 맞는 타이밍입니다.
_posts/2026-03-31-asi-evolve-ai-accelerates-ai.md