당신이 AI에게 "아니, 그거 말고"라고 교정할 때마다 버려지던 피드백이 있습니다. Princeton 연구팀은 이 피드백을 학습 데이터로 바꾸는 시스템, OpenClaw-RL을 만들었습니다.
엔지니어도, 재훈련도, 다운타임도 없이 36회 대화만으로 AI 개인화 점수가 0.17에서 0.81로 뛰었습니다. 채점 AI가 24번 사용되는 동안 더 따뜻하고 상세한 피드백을 쓰는 법을 스스로 배웠습니다.
핵심 원리는 단순합니다. 사용자가 같은 질문을 다시 하면 AI가 실패한 것이고, 대화가 자연스럽게 이어지면 성공한 것입니다. AI는 이 신호만으로 사용자가 원하는 것을 파악하고 스스로 조정합니다.
당신이 AI에게 "아니, 그거 말고"라고 할 때마다
세상에서 가장 값비싼 피드백이 쓰레기통으로 갑니다.
Princeton이 그걸 주워서 학습 데이터로 바꿨습니다.
36번 대화, 비용 0원, 성능 376% 향상.
지금 모든 AI 시스템에는 동일한 문제가 있습니다. 사용자가 "그건 아닌데"라고 교정하거나, 같은 질문을 두 번 하거나, 결과를 수정해서 다시 요청할 때, 이 반응은 AI가 받을 수 있는 가장 정확한 피드백입니다. 그런데 오늘날 모든 AI 시스템은 이 피드백을 완전히 무시합니다. Princeton 연구팀이 만든 OpenClaw-RL은 이 버려지는 신호를 학습 데이터로 전환합니다. 엔지니어 없이, 재훈련 없이, AI가 사용되는 동안 실시간으로 더 나아집니다.
기업들이 AI 에이전트에 투자하는 속도는 빨라지고 있지만, 정작 "우리 조직에 맞게" 만드는 데는 수주에서 수개월이 걸립니다. 전문가가 라벨링 데이터를 수백, 수천 건씩 만들어야 하기 때문입니다. OpenClaw-RL이 중요한 이유는 이 병목을 근본적으로 제거할 수 있기 때문입니다. 에이전트를 배포하는 순간부터 학습이 시작됩니다. 도입과 훈련이 분리되지 않고 하나의 흐름이 됩니다. 쓰면 쓸수록 똑똑해지는 에이전트, 이 구조가 실현 가능하다는 것을 이 논문이 처음 증명했습니다.
이 논문의 핵심 질문은 하나입니다. "사용자가 이미 주고 있는 피드백으로 AI를 훈련시킬 수 있는가?" 답은 "가능하다"이고, 그 방법은 4가지로 요약됩니다.
첫째, 사용자의 반응 자체가 학습 데이터다.
사용자가 같은 질문을 다시 하면, 그건 AI가 실패했다는 신호입니다. 대화가 자연스럽게 이어지면, 성공했다는 신호입니다. OpenClaw-RL은 이처럼 이미 발생하고 있는 반응에서 두 가지를 추출합니다. "이 행동이 좋았는가"라는 평가와 "어떻게 고쳐야 하는가"라는 교정 방향입니다. 새로운 데이터를 만들 필요가 없습니다. AI가 작동하는 것 자체가 학습 데이터를 생성합니다.
둘째, "채점"과 "교정"을 동시에 돌린다.
AI가 자기 행동의 좋고 나쁨만 아는 것으로는 부족합니다. "무엇이 잘못됐는지"와 "어떻게 고쳐야 하는지"를 동시에 알아야 빠르게 개선됩니다. OpenClaw-RL은 Binary RL(채점)과 OPD(교정)를 결합합니다. 채점만 쓰면 방향을 못 잡고(0.23), 교정만 쓰면 기준이 흔들리지만(0.72), 둘을 합치면 0.81로 최고 성능을 기록합니다.
셋째, 최종 결과가 아니라 매 단계를 평가한다.
10단계짜리 작업에서 마지막 결과만 보면, 어느 단계가 문제였는지 알 수 없습니다. OpenClaw-RL은 매 단계마다 개별 채점합니다. 효과는 복잡한 작업일수록 극적입니다. 도구 호출 에이전트에서 과정별 평가(0.30)는 최종 결과 평가(0.17)보다 76% 높은 성능을 기록했습니다.
| 에이전트 유형 | 최종 결과 보상 | 과정별 보상 | 향상폭 |
|---|---|---|---|
| 도구 호출(Tool-call) | 0.17 | 0.30 | +76% |
| GUI 조작 | 0.31 | 0.33 | +6% |
넷째, 에이전트 5종을 하나의 파이프라인으로 동시 훈련한다.
기업 내 AI 에이전트는 대화형, 터미널, GUI, 코드 작성, 도구 호출 등 여러 유형으로 나뉩니다. 보통은 각각 별도 파이프라인이 필요합니다. OpenClaw-RL은 5가지 유형을 하나의 비동기 아키텍처에서 동시에 처리합니다. 4개 모듈(모델 서빙, 환경 호스팅, 보상 판정, 정책 훈련)이 완전히 독립적으로 작동해, 에이전트가 늘어나도 파이프라인은 하나입니다.
지금 기업이 AI 에이전트 훈련에 쓰는 돈의 대부분은 "데이터 만드는 비용"입니다. 전문가가 라벨링 데이터를 직접 작성하고, 품질을 검수하고, 도메인 전문가를 참여시킵니다. 에이전트 1개당 수천만 원에서 수억 원. 에이전트를 10개로 늘리면 비용도 10배입니다.
OpenClaw-RL은 이 비용 구조를 뒤집습니다. 사용자가 에이전트를 쓰는 행위 자체가 훈련 데이터를 만듭니다. 36회 대화, 재훈련 없음, 다운타임 없음, 비용 거의 제로. 에이전트가 사용되는 동안 학습이 진행되니, 에이전트를 100개로 늘려도 라벨링 비용은 0원입니다. 채점 보조 AI는 24번 사용되는 동안 "더 따뜻하고 상세한 피드백"을 쓰는 법을 스스로 터득했습니다.
"다시 해줘", "아니 그거 말고", 같은 질문 반복, 결과 수정 후 재요청. 지금 이 신호들을 로깅하고 있는지 확인합니다. 로깅하지 않으면 학습 전환 자체가 불가능합니다. (2시간)
라벨링 인건비, 품질 검수, 도메인 전문가 참여 비용을 분리합니다. 이 비율이 높을수록 OpenClaw-RL 방식의 ROI가 큽니다. (1시간)
github.com/Gen-Verse/OpenClaw-RL에서 코드 구조와 지원 환경(CUDA 12.9, Python 3.12, 기본 8GPU 구성)을 확인합니다. 자사 에이전트 아키텍처와 맞는지 ML 엔지니어와 함께 점검합니다. (반나절)프라이버시. 사용자 대화로 학습한다는 것은 대화 내용이 모델에 직접 반영된다는 뜻입니다. "그거 말고"라는 교정 한 마디에 기밀 정보가 포함될 수 있습니다. 명시적 동의 절차와 데이터 처리 정책이 반드시 선행되어야 합니다.
잘못된 피드백의 누적. 사용자의 교정이 항상 정확하지는 않습니다. 틀린 피드백이 쌓이면 AI가 오히려 나빠집니다. 논문에서는 다수결 투표로 노이즈를 걸러내지만, 수천 명이 동시에 쓰는 환경에서 이 필터가 충분한지는 아직 미검증입니다.
실험실과 현장의 격차. 36회 대화로 0.81을 달성한 결과는 통제된 벤치마크에서 나왔습니다. GPU 수, 훈련 시간, 연산 비용 같은 인프라 정보는 공개되지 않았습니다. 실 서비스에서의 안정성과 비용 효율성은 별도 검증이 필요합니다.
당신이 AI에게 "아니, 그거 말고"라고 할 때마다 세상에서 가장 정확한 피드백이 생성됩니다. 지금까지 모든 AI가 이 피드백을 버렸습니다. OpenClaw-RL은 이걸 주워서 학습 데이터로 바꿨고, 36번 대화만으로 0.17에서 0.81로 만들었습니다. 엔지니어도, 재훈련도, 다운타임도 없이. "쓸수록 똑똑해지는 AI"는 더 이상 마케팅 문구가 아닙니다.
- Wang, Y., Chen, X., Jin, X., Wang, M., & Yang, L. (2026, March 10). OpenClaw-RL: Train Any Agent Simply by Talking [Preprint]. arXiv:2603.10165. (원문 보기 ↗)