AI는 당신의 감정에 관심 없습니다
9분

AI는 당신의 감정에 관심 없습니다

arXiv Minda Zhao 외 7인 원문 보기 ↗

프롬프트에 감정을 넣어도 AI 성능은 거의 달라지지 않습니다.

감정을 문장 뒤에 붙이면 수학 정확도가 최대 8점 떨어집니다.

적응형 감정 선택(EmotionRL)만 안정적 성능 향상을 보입니다.

"AI에게 감정을 담아 말하면 더 잘한다"고요?
6가지 감정으로 실험했습니다. 달라지는 건 거의 없습니다.

"프롬프트에 '제발'을 붙이면 AI가 더 잘 답한다." 기업 현장에서 이런 팁이 공유됩니다. 프롬프트 한 줄에 수십 번의 시행착오를 쏟는 팀도 있습니다. 6가지 감정, 4개 모델, 6개 평가 분야에서 검증한 결과가 나왔습니다. 감정 프롬프트는 성능을 거의 바꾸지 않습니다(Zhao et al., 2026).

프롬프트 엔지니어링에 기업의 시간이 투입됩니다. "감정을 넣으면 효과가 있다"는 팁이 SNS에서 확산됐습니다. 이 논문은 체계적 실험으로 검증한 첫 연구입니다(Zhao et al., 2026). 검증되지 않은 팁에 시간을 낭비할 이유가 없습니다.

첫째, 감정을 넣어도 정확도 변화는 ±0.5점 이내입니다. 행복, 분노, 공포, 슬픔, 역겨움, 놀람 6가지 감정을 테스트했습니다. GSM8K 수학 평가에서 4개 모델 모두 기준선 대비 ±0.5점 이내로 변했습니다(Zhao et al., 2026). 특정 감정이 일관되게 성능을 높이는 경우는 없습니다.

감정 정확도 기준선 대비
감정 없음 (기준선) 94.97 -
행복 95.12 +0.15
슬픔 95.42 +0.45
분노 94.77 -0.20
놀람 94.62 -0.35
공포 95.07 +0.10
역겨움 95.15 +0.18

DeepSeek-V3.2 모델, GSM8K 수학 평가 기준. 감정을 프롬프트 앞에 붙인 경우. 출처: Zhao et al. (2026), Table 2.

둘째, 감정을 뒤에 붙이면 성능이 최대 8점 떨어집니다. 같은 감정이라도 위치가 중요합니다. '놀람' 감정을 프롬프트 뒤에 붙이면, 4개 모델 모두 6~8점이 하락했습니다. Llama 3.3은 95.00에서 87.18로 떨어졌습니다(Zhao et al., 2026). 감정 문구가 문제 맥락을 오염시키기 때문입니다.

모델 감정 없음 앞에 붙임 뒤에 붙임 하락폭
DeepSeek-V3.2 94.97 94.62 88.36 -6.61
GPT-OSS 94.67 93.07 86.96 -7.71
Llama 3.3-70B 95.00 95.06 87.18 -7.82
Qwen3-14B 93.93 93.74 86.66 -7.27

'놀람(Surprise)' 감정 기준, GSM8K 수학 평가. '앞에 붙임'은 기준선과 거의 동일하지만, '뒤에 붙임'은 전 모델에서 큰 폭 하락. 출처: Zhao et al. (2026), Table 2.

셋째, 감정 강도를 높여도 효과는 같습니다. "화가 난다" → "매우 화가 난다" → "극도로 화가 난다"로 강도를 높였습니다. MedQA 의학 평가에서 정확도 차이는 미미했습니다(Zhao et al., 2026). 강한 감정이 더 큰 효과를 내지 않습니다.

넷째, 사람이 쓴 감정 문구와 AI가 쓴 감정 문구의 결과가 같습니다. 250개 의학 문제로 비교했습니다. 사람이 작성한 감정 문구와 GPT-4o가 생성한 감정 문구의 정확도 차이가 없었습니다(Zhao et al., 2026). 감정 문구를 정성껏 다듬어도 결과는 같습니다.

다섯째, EmotionRL만 안정적으로 성능을 높입니다. 고정된 감정 대신 문제별로 최적 감정을 자동 선택합니다. 강화학습 기반의 2층 MLP가 6가지 감정 중 최적을 고릅니다. 5개 벤치마크에서 고정 감정보다 높은 성능을 보입니다(Zhao et al., 2026). 감정 프롬프팅은 "적응형 제어 문제"입니다.

1
감정 프롬프트 팁을 팀에 검증 결과와 함께 공유합니다.
"AI에게 화를 내면 더 잘한다"는 주장의 실험 결과를 전달합니다. 이 논문의 핵심 수치(±0.5점 변화)를 5분 브리핑으로 만듭니다. 검증 없는 프롬프트 팁에 시간을 쓰지 않습니다. (15분, 브리핑 자료 작성)
2
운영 중인 프롬프트에서 감정 표현을 점검합니다.
프롬프트 끝에 감탄사나 감정 표현이 붙어 있다면 삭제합니다. 뒤에 붙인 감정은 최대 8점 하락을 유발합니다. Claude에 "이 프롬프트에서 불필요한 감정 표현을 찾아줘"라고 요청합니다. (30분, 프롬프트 점검)
3
프롬프트 최적화 우선순위를 재설정합니다.
감정보다 구조가 성능을 좌우합니다. 역할 정의, 예시 추가, 출력 형식 지정에 집중합니다. Claude에 "역할 정의, 맥락 제공, 출력 형식 지정 구조로 재작성해줘"라고 요청합니다. (1시간, 핵심 프롬프트 3개 재설계)

벤치마크와 실무는 다릅니다. 표준 평가에서의 결과가 사내 업무에 그대로 적용되지 않을 수 있습니다. 자체 검증을 병행해야 합니다.

4개 모델 한정 실험입니다. DeepSeek, GPT-OSS, Llama, Qwen에서만 검증했습니다. Claude나 Gemini 등 다른 모델에서는 결과가 다를 수 있습니다.

프롬프트 엔지니어링 자체가 무의미한 건 아닙니다. 이 연구는 "고정된 감정 문구"의 효과를 검증했습니다. 역할 부여, 단계별 추론, 예시 제공 같은 다른 기법은 별도 영역입니다.

EmotionRL은 아직 연구 단계입니다. 적응형 감정 선택의 효과는 확인됐지만, 상용 도구로 출시되지 않았습니다.

프롬프트에 감정을 넣어도 AI 성능은 달라지지 않습니다. 감정보다 구조에 투자하는 것이 합리적입니다.

CTO 감정 기반 프롬프트 최적화에 자원을 쓰지 마라. 구조적 프롬프트 설계에 집중하라.
팀장 팀 내 공유되는 프롬프트 팁을 정량 데이터로 검증하라. 근거 없는 팁을 퍼뜨리지 마라.
임원 AI 활용 교육에서 감정 프롬프트의 한계를 명시하라. 실증 기반 프롬프트 전략을 수립하라.

프롬프트 엔지니어링: AI에게 원하는 답을 얻기 위해 질문 방식을 설계하는 기술입니다.

벤치마크: AI 모델의 성능을 측정하는 표준 평가입니다. 수학, 의학, 상식 등 분야별로 존재합니다.

GSM8K: 초등학교 수준의 수학 문장 문제 8,500개로 구성된 AI 수학 능력 평가입니다.

강화학습: AI가 시행착오를 통해 더 나은 행동을 찾아가는 학습 방법입니다.

EmotionRL: 이 논문에서 제안한 적응형 감정 선택 시스템입니다. 문제마다 최적의 감정을 자동으로 선택합니다.

MLP: 다층 퍼셉트론이라 불리는 기본적인 신경망 구조입니다. 입력을 여러 층에 걸쳐 처리합니다.

  • Zhao, M., Yang, Y., Peng, C., Gonsalves, R., Li, W., Yang, R., Liu, Z., & Wang, M. (2026, April). Do Emotions in Prompts Matter? Effects of Emotional Framing on Large Language Models [Article]. arXiv. (원문 보기 ↗)
라운드테이블
P
퍼플 · 마케터
저는 "제발 잘 부탁해요"나 "이게 정말 중요해요"를 붙이는 게 효과 있다고 느꼈거든요. 실제로 답변 톤이 달라지지 않나요? ±0.5점이 수치적으론 작아도 체감은 다를 수 있잖아요.
R
레드 · 저널리스트
톤 변화와 정확도 변화는 다른 겁니다. 이 논문은 GSM8K, MATH, HumanEval 등 6개 벤치마크 정확도를 쟀습니다. 느낌이 아니라 측정값이에요.
P
퍼플 · 마케터
그럼 팀원 설득용 프롬프트 팁으로 쓰던 건 내려놔야겠네요. 감정 대신 명확한 지시 구조로 바꿔야 할 것 같아요.
B
블랙 · 중견기업 임원
감정 프롬프트에 시간 낭비하지 마세요. 역할·형식·출력 구조 지정이 실질 차이를 만듭니다. 팀이 감정 표현 최적화에 공수를 쓰고 있다면 지금 당장 멈추세요.
G
골드 · 창업자
저도 써봤는데 동의해요. 감정보다 "JSON으로 출력해줘", "3단계로 나눠줘" 같은 형식 지정이 훨씬 일관성 있었어요. 뒤에 붙이면 오히려 8점 떨어진다는 건 충격이에요.
W
화이트 · 조직장
팀원들이 프롬프트 끝에 "부탁드립니다"나 "감사합니다" 붙이는 게 습관인데, 이제 걷어내야 하나요? 아니면 그냥 놔둬도 되는 수준인가요?
R
레드 · 저널리스트
EmotionRL이 성능을 높인다는 건 맥락마다 다른 감정을 선택하는 AI 방식입니다. 사람이 감정을 고르는 게 아니에요. 그러면 이 논문의 실무 결론은 결국 "감정 프롬프트 쓰지 마라" 아닌가요?
N
네이비 · 시니어 엔지니어
정확합니다. DeepSeek-V3.2 기준 수학 8점 하락은 문장 끝에 붙일 때입니다. 위치와 모델 조합에 따라 다르지만, 일반적으로 감정 추가는 노이즈입니다.
B
블랙 · 중견기업 임원
결론 명확합니다. 감정 빼고 역할, 형식, 예시 넣으세요. 그게 전부예요.
_posts/2026-04-02-ai-emotion-prompts.md