청화대·일리노이대 공동 연구팀이 AI 모델이 복잡한 문서를 읽고 스스로 전문 기술을 추출하는 프레임워크 Ctx2Skill을 발표했습니다.
5개 AI 에이전트가 인간 주석 없이 서로 경쟁하며 기술을 자동 정제합니다.
GPT-5.1 기준 컨텍스트 학습 성능이 21.1%에서 25.8%로 향상됐습니다(프리프린트 논문).
직원이 업무 매뉴얼을 숙달하는 데 수개월이 걸립니다.
AI는 같은 문서로 전문가 수준 기술을 스스로 추출합니다.
신입 교육 예산을 다시 검토해야 할 때입니다.
기업이 AI를 도메인에 특화하는 방법은 크게 두 가지입니다. 모델을 재훈련하거나, 지식 베이스를 직접 구축하는 것입니다. 둘 다 비쌉니다. 재훈련은 수억 원, 지식 베이스 구축은 수개월의 인력이 필요합니다.
청화대·일리노이대 연구팀이 다른 방법을 제시했습니다. 기존 문서를 입력하면 AI가 스스로 전문 기술을 추출합니다. 사람이 분류하고 태깅하는 과정이 없습니다. GPT-5.1 기준 컨텍스트 학습 성능이 4.7%p 향상됐습니다(Si 외, 2026). 도메인 특화에 드는 인력 비용을 줄일 수 있다는 의미입니다.
기업 AI 도입의 가장 큰 장벽 중 하나는 도메인 특화입니다. 법률, 의료, 금융 분야는 범용 모델만으로 충분하지 않습니다. 현재 주류 접근법인 RAG는 전문가가 문서를 직접 분류하고 구조화해야 합니다. 이 연구는 그 과정을 자동화합니다. 프리프린트 단계지만, 방향성은 도메인 특화 AI 구축 방식을 바꿀 수 있습니다.
첫째, 5개 AI 에이전트가 경쟁하며 기술을 자동 정제합니다. Ctx2Skill은 도전자, 추론자, 판정자 등 5개 에이전트로 구성됩니다(Si 외, 2026). 도전자는 문서 기반 과제를 만들고, 추론자는 현재 기술로 풀어냅니다. 판정자가 결과를 평가하고, 실패 원인을 분석해 기술을 업데이트합니다. 이 과정이 5회 반복됩니다.
둘째, 인간 주석 없이 성능이 일관되게 향상됐습니다. 평가 벤치마크 CL-Bench는 500개 문서, 1,899개 과제로 구성됩니다. 도메인 지식 추론, 규칙 적용, 절차 실행, 실증 발견 4개 영역을 포함합니다(Si 외, 2026). 모든 모델에서 Ctx2Skill이 기준 성능을 웃돌았습니다.
| 모델 | 기준 성능 | Ctx2Skill 적용 후 | 향상 |
|---|---|---|---|
| GPT-4.1 | 11.1% | 16.5% | +5.4%p |
| GPT-5.1 | 21.1% | 25.8% | +4.7%p |
| GPT-5.2 | 18.2% | 21.4% | +3.2%p |
출처: Si 외 (2026), CL-Bench 전체 카테고리 평균.
셋째, 강한 모델의 기술을 약한 모델에 이전할 수 있습니다. GPT-5.1이 추출한 기술을 GPT-4.1에 이식하면 16.1% 성능이 나옵니다(Si 외, 2026). GPT-4.1이 스스로 추출할 때(16.5%)와 거의 같습니다. GPT-5.1 하나로 기술을 추출하면, GPT-4.1에 이식해 운영 비용을 낮출 수 있습니다. 한 번 추출한 기술은 반복 사용할 수 있습니다.
넷째, 기술은 파라미터 변경 없이 시스템 프롬프트에 추가됩니다. 추출된 기술은 모델 재훈련 없이 시스템 프롬프트에 삽입해 즉시 적용합니다. 폐쇄형 모델(GPT, Claude)에도 적용 가능합니다(Si 외, 2026). 기술은 사람이 읽고 수정할 수 있는 텍스트 형태입니다. 도입 비용이 낮습니다.
Claude에 내부 업무 매뉴얼 또는 표준 업무 절차서를 붙여넣고 다음 프롬프트를 입력합니다. "이 문서를 기반으로 이 업무를 수행하는 데 필요한 전문 기술 10가지를 추출해줘. 각 기술은 실행 가능한 규칙 형태로 작성해줘." 결과물을 현업 담당자와 검토합니다. 기대 결과: 사람이 직접 정리하면 수 시간 걸리는 업무 규칙이 5분 내에 텍스트로 정리됩니다. (30분)
Ctx2Skill 방식은 RAG 지식 베이스 구축에 드는 인력 비용을 줄일 수 있습니다. IT 또는 AI 담당자에게 논문 URL(arxiv.org/abs/2604.27660)을 공유하고 자동 기술 추출 파이프라인 도입 가능성을 검토하도록 요청합니다. (1주)
팀 내에서 반복적으로 복잡한 문서를 다루는 업무 2~3개를 선별합니다. 해당 업무의 핵심 문서 목록을 작성하고, 자동 기술 추출 파일럿의 우선순위를 정합니다. 이 목록이 AI 도입 실행 계획의 출발점이 됩니다. (1개월)
프리프린트 단계로, 독립적인 피어리뷰를 거치지 않았습니다. 이 연구는 arXiv에 공개된 프리프린트 논문입니다. 결과는 의미 있지만, 학술지 검증은 진행 중입니다. 방법론과 수치를 절대값으로 받아들이기보다 방향성과 접근법으로 검토해야 합니다.
실험 규모가 제한적입니다. 반복 횟수(N=5)와 회당 과제 수(M=5)는 API 예산 제약으로 결정됐습니다(Si 외, 2026). 더 많은 반복이 성능에 어떤 영향을 미치는지는 확인되지 않았습니다. 기업 도입 전 자체 파일럿을 통한 검증이 필요합니다.
초반 반복 기술이 오히려 더 일반적일 수 있습니다. 연구에서 후반 반복으로 갈수록 기술이 특수 과제에 과잉 특화되는 현상이 발견됐습니다(Si 외, 2026). 최종 기술이 항상 최적이 아닐 수 있습니다. Ctx2Skill은 이를 교차 시간 재생 메커니즘으로 보완하지만, 완전히 해결된 문제는 아닙니다.
기술 품질이 기반 모델 역량에 비례합니다. GPT-4.1 기술 품질은 89.8점입니다(Si 외, 2026). GPT-5.1은 93.6점으로 더 높습니다. 활용 가능한 모델의 성능이 기술 품질의 상한을 결정합니다. 고품질 기술을 추출하려면 성능이 높은 모델이 필요합니다.
AI가 문서에서 스스로 전문 기술을 추출하는 접근법이 등장했습니다. 도메인 특화 AI를 구축하는 비용과 방식을 재검토할 시점입니다.
컨텍스트 학습 (Context Learning): 모델 파라미터를 변경하지 않고, 입력 텍스트(컨텍스트)만으로 새 작업을 수행하게 하는 방식입니다. 별도 훈련 없이 문서를 읽혀 도메인 과제를 처리합니다.
멀티에이전트 셀프 플레이: 여러 AI 에이전트가 각자 역할을 맡아 서로 경쟁하고 피드백을 주고받으며 성능을 개선하는 방법입니다. 인간의 개입 없이 자동으로 진행됩니다.
스킬 (Skill): 특정 도메인 문서에서 추출된, AI가 과제를 수행하는 데 필요한 규칙·절차·지식의 집합입니다. 텍스트 형태로 시스템 프롬프트에 삽입해 즉시 활용합니다.
CL-Bench: 이 연구에서 사용된 컨텍스트 학습 평가 기준입니다. 500개 문서, 1,899개 과제, 31,607개 채점 기준으로 구성됩니다. 도메인 지식 추론, 규칙 적용, 절차 실행, 실증 발견 4개 영역을 포함합니다.
RAG (검색 증강 생성): 외부 문서 데이터베이스를 AI에 연결해 답변 품질을 높이는 방식입니다. 현재 기업 AI 특화의 주류 기술이지만, 구축에 상당한 인력이 필요합니다.
- Si, S., Zhao, H., Lei, Y., Wang, Q., 외 5인. (2026, April). From Context to Skills: Can Language Models Learn from Context Skillfully? [Preprint]. arXiv. (원문 보기 ↗)