ASI-Evolve가 신경망 설계, 데이터 정제, 강화학습을 자동화했습니다.
1,773회 탐색에서 105개 최첨단 신경망을 발견했습니다.
데이터 정제로 MMLU 18점, 강화학습으로 12.5점을 올렸습니다.
AI가 사람보다 3배 빠르게 신경망을 설계합니다.
당신의 AI 팀은 아직 모델 하나를 고르고 있습니까?
AI 기술은 매년 빨라지고 있습니다. 이 속도 자체가 더 빨라집니다. AI가 AI 연구를 자동화하기 시작했기 때문입니다. 1,773회 자동 탐색에서 105개 신경망을 설계했습니다. 사람 연구팀 성과의 약 3배입니다.
AI 연구 자동화 경쟁이 가속하고 있습니다. Google의 AlphaEvolve, Meta의 HyperAgents가 등장했습니다. 하지만 기존 시스템은 단일 영역에 집중했습니다. ASI-Evolve는 3개 영역을 동시에 자동화한 첫 시스템입니다(Xu et al., 2026). AI 발전 속도 자체가 빨라진다는 뜻입니다.
첫째, 1,773회 탐색으로 105개 신경망을 발견했습니다. ASI-Evolve는 '학습, 설계, 실험, 분석' 순환을 자동 반복합니다. 선형 어텐션 모델을 설계합니다. 기존 최고 모델 대비 +0.97점, 사람 연구 성과의 약 3배입니다(Xu et al., 2026). AI 모델 성능이 가속 개선되면 기업의 AI 전략 수명도 짧아집니다.
| 모델 | 설계자 | 개발 평균 | 일반화 평균 | 전체 평균 |
|---|---|---|---|---|
| DeltaNet | 사람 | 55.76 | 44.74 | 51.04 |
| Gated-DeltaNet | 사람 | 55.09 | 44.28 | 50.46 |
| Mamba2 | 사람 | 56.47 | 44.61 | 51.38 |
| FusionGated-FIRNet | AI | 57.28 | 44.99 | 52.01 |
| Hier-GateNet | AI | 56.59 | 45.40 | 51.79 |
3.4억 파라미터 모델, 150억 토큰 학습 기준. 개발 평균: 10개 벤치마크, 일반화 평균: 6개 벤치마크. AI 설계 모델 5개 중 상위 2개 표시. 출처: Xu et al. (2026), Table 1.
둘째, 데이터 정제만으로 MMLU 점수가 18점 올랐습니다. 672억 토큰 규모의 학습 데이터에 자동 정제를 적용했습니다. MMLU 점수가 27.49에서 46.13으로 올랐습니다. 의학 지식 +13점, 상식 추론 +18점도 함께 올랐습니다. 기존 공개 학습 데이터보다 높은 성능입니다.
| 평가 항목 | 정제 전 | 정제 후 | 향상 |
|---|---|---|---|
| MMLU (57개 분야 지식) | 27.49 | 46.13 | +18.64 |
| MedQA (의학 지식) | 26.77 | 40.25 | +13.48 |
| CSQA (상식 추론) | 20.31 | 39.12 | +18.81 |
| ARC-C (과학 추론) | 43.52 | 49.32 | +5.80 |
| 전체 평균 (18개 항목) | 40.17 | 44.13 | +3.96 |
30억 파라미터 모델, 5000억 토큰 학습 기준. 정제 전: Nemotron-CC 원본 데이터. 정제 후: ASI-Evolve 자동 정제 적용. 출처: Xu et al. (2026), Table 2.
셋째, AI가 설계한 학습 알고리즘이 GRPO를 넘었습니다. GRPO는 대표적인 강화학습 알고리즘입니다. 최고 알고리즘은 수학 평가에서 +12.5점을 기록했습니다(67.5 → 80.0). 수학 경시대회 AIME24에서도 +11.67점 올랐습니다. AI가 만든 학습법이 사람이 만든 학습법을 넘었습니다.
| 수학 평가 | 사람이 설계한 GRPO | AI가 설계한 최고 알고리즘 | 향상 |
|---|---|---|---|
| AI가 설계한 5개 알고리즘 vs 사람이 설계한 GRPO | |||
| Math500 | 82.0 | 85.6 / 84.6 / 84.8 / 82.4 / 82.0 | +3.6 |
| AMC32 (수학 경시) | 67.5 | 80.0 / 77.5 / 77.5 / 75.0 / 72.5 | +12.5 |
| AIME24 (수학 올림피아드) | 20.00 | 31.67 / 23.33 / 30.00 / 20.00 / 20.00 | +11.67 |
| AIME25 (수학 올림피아드) | 20.00 | 29.58 / 23.75 / 30.00 / 20.00 / 23.33 | +10.00 |
| OlympiadBench | 45.92 | 50.96 / 48.74 / 49.18 / 46.81 / 45.62 | +5.04 |
Qwen-3-14B 모델 기준, 250 학습 스텝 후 평가. AI 설계 열은 알고리즘 1~5의 점수를 순서대로 표시. 5개 중 4개가 모든 항목에서 GRPO 이상 성능. 출처: Xu et al. (2026), Table 3.
넷째, '인지 기반'이 탐색 효율의 핵심입니다. 인지 기반은 기존 논문 지식을 모아둔 저장소입니다. 150편의 논문에서 추출한 지식이 탐색 방향을 안내합니다. 인지 기반을 제거하면 탐색 시작이 크게 느려집니다(Xu et al., 2026). 기업의 AI 실험 노하우도 이렇게 축적하면 경쟁 우위가 됩니다.
| 프레임워크 | 사용 모델 | 탐색 횟수 | 최고 점수 |
|---|---|---|---|
| OpenEvolve | Gemini 2.0 Flash + Claude 3.7 | 460회 | 2.6343 |
| AlphaEvolve | Gemini 2.0 Flash + Claude 3.7 | 미공개 | 2.6359 |
| SkyDiscover | GPT-5 | 89회 | 2.6360 |
| ASI-Evolve | GPT-5-mini (소형 모델) | 17회 | 2.6360 |
26개 원을 1×1 정사각형에 배치하는 최적화 문제. 같은 최고 점수에 도달하는 데 ASI-Evolve는 17회, 경쟁 시스템은 89~460회 소요. 인지 기반이 탐색 효율을 27배 높인 결과. 출처: Xu et al. (2026), Table 4.
다섯째, AI 연구를 넘어 신약 개발에도 적용됩니다. 약물과 단백질의 상호작용 예측에 적용했습니다. 미지 약물 예측 정확도가 6.94점 향상됐습니다. 미지 단백질 예측도 3.56점 올랐습니다. AI 연구 자동화 기술이 바이오, 소재, 금융 등 다른 산업으로 확장됩니다.
| 모델 | 설계자 | BindingDB-Dev | BindingDB-Random | Human | BioSNAP |
|---|---|---|---|---|---|
| TransformerCPI | 사람 | - | 93.96 | 96.03 | 86.35 |
| PSICHIC | 사람 | - | 91.67 | 98.55 | 91.64 |
| DrugBAN | 사람 | 94.15 | 94.89 | 98.61 | 89.43 |
| ASI-Evolve | AI | 96.06 | 95.94 | 98.89 | 89.68 |
AUROC 점수 기준 (100점 만점). 약물-단백질 상호작용 예측 정확도. 4개 벤치마크 전체에서 AI 설계 모델이 1위. 출처: Xu et al. (2026), Table 5.
| 예측 조건 | 사람이 설계한 모델 | AI가 설계한 모델 | 향상 |
|---|---|---|---|
| 미지 약물 예측 | 79.15 | 86.09 | +6.94 |
| 미지 단백질 예측 | 82.26 | 85.82 | +3.56 |
| 미지 약물 + 단백질 | 76.47 | 80.83 | +4.36 |
AUROC 점수 기준 (100점 만점). 사람이 설계한 모델: DrugBAN. 학습 데이터에 없는 약물/단백질에 대한 예측 정확도. 출처: Xu et al. (2026), Table 6.
ASI-Evolve 사례를 5분 브리핑으로 만듭니다. 'AI가 사람보다 3배 빠르게 신경망을 설계한다'는 팩트를 전달합니다. AI 전략 갱신 주기를 단축해야 한다는 근거로 활용합니다. (30분, 브리핑 자료 작성)
ASI-Evolve의 데이터 정제만으로 MMLU 18점이 올랐습니다. Claude에 "현재 학습 데이터의 노이즈 유형 5가지를 분류해줘"라고 요청합니다. 자사 데이터에서 정제 대상을 식별합니다. (1시간, 데이터 품질 감사)
ASI-Evolve의 핵심은 '인지 기반', 축적된 지식입니다. 조직 내 AI 실험 결과와 실패 사례를 문서화합니다. Notion에 'AI 실험 로그' 페이지를 만듭니다. (2시간, 템플릿 설계)
연구 논문이지 상용 제품이 아닙니다. ASI-Evolve는 학술지 게재 전 공개된 연구 논문입니다. 오픈소스 코드가 있지만 실제 운영에는 상당한 엔지니어링이 필요합니다.
대규모 연산 자원이 필요합니다. 신경망 설계 실험은 1,773회 반복됩니다. 대규모 검증은 13억 파라미터 모델을 사용합니다. 중소기업이 자체 운영하기 어려운 규모입니다.
자동 설계된 신경망은 해석이 어렵습니다. AI가 왜 이런 구조를 선택했는지 사람이 파악하기 어렵습니다. 핵심 시스템에 적용하려면 작동 원리 검증이 필수입니다.
AI 연구 인력의 역할이 바뀝니다. 자동화가 확산되면 연구자 역할은 '설계자'에서 '감독자'로 전환됩니다. 조직 내 AI 인력 전략을 재검토해야 합니다.
AI가 AI를 설계하고 개선하는 시대가 시작됐습니다. 향후 AI 경쟁력은 사람의 수가 아니라 자동화 체계의 품질로 결정됩니다.
선형 어텐션: 입력 길이에 비례해 연산하는 효율적 방식입니다. 기존 Transformer보다 연산량이 적어 대규모 처리에 유리합니다.
MMLU(Massive Multitask Language Understanding): 수학, 역사, 과학 등 57개 분야의 지식을 측정하는 대규모 평가입니다.
GRPO(Group Relative Policy Optimization): AI가 생성한 여러 응답을 비교해 더 나은 답변을 학습시키는 강화학습 알고리즘입니다.
인지 기반(Cognition Base): 기존 연구 논문에서 추출한 지식을 모아 탐색 방향을 안내하는 저장소입니다.
토큰: AI가 텍스트를 처리하는 최소 단위입니다. 한국어 한 글자는 보통 1~2토큰에 해당합니다.
파라미터: AI 모델이 학습한 내부 수치입니다. 많을수록 복잡한 패턴을 학습할 수 있습니다.
- Xu, W., Mi, T., Liu, Y., Nan, Y., Zhou, Z., Ye, L., Zhang, L., Qiao, Y., & Liu, P. (2026, March). ASI-Evolve: AI Accelerates AI [Article]. arXiv. (원문 보기 ↗)