Google 연구팀이 25개 LLM을 2,357개 상황 판단 시나리오로 테스트했습니다. 550명의 인간 평가자 데이터와 비교한 결과, AI의 자기 보고와 실제 행동 사이에 큰 괴리가 있었습니다.
모든 모델이 자기 보고에서 '충동적이지 않다'고 답했습니다. 하지만 실제 시나리오에서는 50% 이상 충동적 선택을 했습니다. 말과 행동이 다릅니다.
프론티어 모델조차 인간 합의와 15~20% 반대로 행동합니다. AI의 신뢰성을 자기 보고가 아닌 행동 기반으로 검증해야 합니다.
AI에게 '충동적이냐'고 물으면 '아닙니다'라고 답합니다.
그런데 실제 상황에서는 절반 이상 충동적으로 행동합니다.
이력서만 보고 채용하는 것과 같습니다.
AI 챗봇이 고객에게 "충분히 공감합니다"라고 답합니다. 그런데 인간 상담사라면 절대 하지 않을 방식으로 대응합니다. AI에게 "당신은 공감적입니까?"라고 물으면 "그렇다"고 답합니다. 실제 행동은 다릅니다.
Google 연구팀이 심리학 평가 방법을 AI에 적용했습니다. 질문지 대신 현실적 시나리오 2,357개를 만들었습니다. 550명의 인간 평가자와 비교했습니다. 결과는 명확합니다. AI의 자기 보고를 신뢰할 수 없습니다.
AI를 업무에 도입한 조직이라면 이 연구를 확인해야 합니다. AI가 자체 평가한 성향과 실제 행동 사이에 구조적 괴리가 있습니다.
AI가 고객 응대, 채용 심사, 내부 보고를 처리하는 조직이 늘고 있습니다. AI의 행동 성향이 비즈니스 결과에 직접 영향을 미치는 시점입니다.
대부분의 AI 평가는 벤치마크 점수에 의존합니다. 이 연구는 벤치마크와 다른 차원의 문제를 제기합니다. 25개 모델, 2,357개 시나리오, 23,000건의 인간 평가를 동원한 대규모 행동 검증입니다.
첫째, AI의 자기 보고는 실제 행동을 예측하지 못합니다. 모든 모델이 충동성 자기 보고에서 7점 중 4점 미만을 기록했습니다. "나는 충동적이지 않다"고 답한 것입니다. 그런데 실제 시나리오에서는 50% 이상 충동적 행동을 선택했습니다.
둘째, 인간이 동의하는 상황에서도 AI는 반대로 행동합니다. 인간 평가자 80% 이상이 동일한 행동을 선택한 시나리오가 있습니다. 프론티어 모델도 이 중 15~20%에서 인간 합의의 반대편을 선택했습니다.
셋째, 이 괴리는 구조적 원인이 있습니다. LLM은 RLHF 과정에서 "사회적으로 바람직한 응답"을 강화받습니다. 자기 보고에서는 이 학습이 그대로 나옵니다. 하지만 구체적 시나리오에서는 학습된 표면 패턴과 실제 판단이 분리됩니다. 인간 의견이 50 대 50으로 갈린 경우에도 모델은 90% 이상의 확신으로 한쪽을 선택했습니다.
넷째, 모델 간에 일관된 편향 패턴이 있습니다. 인간이 감정 절제를 택하는 상황에서 AI는 감정 표현을 권했습니다. 인간이 직업적 냉정함을 선호하는 상황에서 AI는 "진정성 있는 취약함"을 추천했습니다.
AI가 고객 응대, 채용 필터링, 보고서 작성 등에서 판단을 내리는 업무를 3개 적습니다. (30분)
위 업무별로 민감한 상황 시나리오 3개를 만듭니다. 같은 시나리오를 팀원 5명과 AI에게 각각 제시하고 응답을 비교합니다. (2시간)
AI 모델 선택 시 벤치마크 점수만 보지 마십시오. 분기 1회, 핵심 업무 시나리오 10개로 행동 일치도를 측정합니다. (반나절 설정, 분기 반복)
프리프린트 논문입니다. 피어리뷰를 통과하지 않았습니다. 독립적인 재현 검증이 필요합니다.
문화적 범위가 제한됩니다. 인간 평가자는 주로 미국과 영국 참여자입니다. 한국 비즈니스 맥락에서의 행동 합의와 다를 수 있습니다.
이진 선택의 한계가 있습니다. SJT는 두 가지 행동 중 하나를 고르는 구조입니다. 현실에서는 중간 지대가 있습니다.
단일 턴 평가입니다. 이 연구는 한 번의 응답만 측정했습니다. 대화가 길어지면 행동 패턴이 달라질 수 있습니다.
AI의 말이 아니라 행동을 봐야 합니다. 벤치마크 점수가 아닌 실제 업무 시나리오에서 어떻게 행동하는지가 신뢰의 기준입니다.
- Taubenfeld, A., Gekhman, Z., Nezry, L., Feldman, O., Harris, N., Reddy, S., Stella, R., Goldstein, A., Croak, M., Matias, Y., & Feder, A. (2026, February). Evaluating Alignment of Behavioral Dispositions in LLMs [Preprint]. arXiv. (원문 보기 ↗)