프롬프트에 감정을 넣어도 AI 성능은 거의 달라지지 않습니다.
감정을 문장 뒤에 붙이면 수학 정확도가 최대 8점 떨어집니다.
적응형 감정 선택(EmotionRL)만 안정적 성능 향상을 보입니다.
"AI에게 감정을 담아 말하면 더 잘한다"고요?
6가지 감정으로 실험했습니다. 달라지는 건 거의 없습니다.
"프롬프트에 '제발'을 붙이면 AI가 더 잘 답한다." 기업 현장에서 이런 팁이 공유됩니다. 프롬프트 한 줄에 수십 번의 시행착오를 쏟는 팀도 있습니다. 6가지 감정, 4개 모델, 6개 평가 분야에서 검증한 결과가 나왔습니다. 감정 프롬프트는 성능을 거의 바꾸지 않습니다(Zhao et al., 2026).
프롬프트 엔지니어링에 기업의 시간이 투입됩니다. "감정을 넣으면 효과가 있다"는 팁이 SNS에서 확산됐습니다. 이 논문은 체계적 실험으로 검증한 첫 연구입니다(Zhao et al., 2026). 검증되지 않은 팁에 시간을 낭비할 이유가 없습니다.
첫째, 감정을 넣어도 정확도 변화는 ±0.5점 이내입니다. 행복, 분노, 공포, 슬픔, 역겨움, 놀람 6가지 감정을 테스트했습니다. GSM8K 수학 평가에서 4개 모델 모두 기준선 대비 ±0.5점 이내로 변했습니다(Zhao et al., 2026). 특정 감정이 일관되게 성능을 높이는 경우는 없습니다.
| 감정 | 정확도 | 기준선 대비 |
|---|---|---|
| 감정 없음 (기준선) | 94.97 | - |
| 행복 | 95.12 | +0.15 |
| 슬픔 | 95.42 | +0.45 |
| 분노 | 94.77 | -0.20 |
| 놀람 | 94.62 | -0.35 |
| 공포 | 95.07 | +0.10 |
| 역겨움 | 95.15 | +0.18 |
DeepSeek-V3.2 모델, GSM8K 수학 평가 기준. 감정을 프롬프트 앞에 붙인 경우. 출처: Zhao et al. (2026), Table 2.
둘째, 감정을 뒤에 붙이면 성능이 최대 8점 떨어집니다. 같은 감정이라도 위치가 중요합니다. '놀람' 감정을 프롬프트 뒤에 붙이면, 4개 모델 모두 6~8점이 하락했습니다. Llama 3.3은 95.00에서 87.18로 떨어졌습니다(Zhao et al., 2026). 감정 문구가 문제 맥락을 오염시키기 때문입니다.
| 모델 | 감정 없음 | 앞에 붙임 | 뒤에 붙임 | 하락폭 |
|---|---|---|---|---|
| DeepSeek-V3.2 | 94.97 | 94.62 | 88.36 | -6.61 |
| GPT-OSS | 94.67 | 93.07 | 86.96 | -7.71 |
| Llama 3.3-70B | 95.00 | 95.06 | 87.18 | -7.82 |
| Qwen3-14B | 93.93 | 93.74 | 86.66 | -7.27 |
'놀람(Surprise)' 감정 기준, GSM8K 수학 평가. '앞에 붙임'은 기준선과 거의 동일하지만, '뒤에 붙임'은 전 모델에서 큰 폭 하락. 출처: Zhao et al. (2026), Table 2.
셋째, 감정 강도를 높여도 효과는 같습니다. "화가 난다" → "매우 화가 난다" → "극도로 화가 난다"로 강도를 높였습니다. MedQA 의학 평가에서 정확도 차이는 미미했습니다(Zhao et al., 2026). 강한 감정이 더 큰 효과를 내지 않습니다.
넷째, 사람이 쓴 감정 문구와 AI가 쓴 감정 문구의 결과가 같습니다. 250개 의학 문제로 비교했습니다. 사람이 작성한 감정 문구와 GPT-4o가 생성한 감정 문구의 정확도 차이가 없었습니다(Zhao et al., 2026). 감정 문구를 정성껏 다듬어도 결과는 같습니다.
다섯째, EmotionRL만 안정적으로 성능을 높입니다. 고정된 감정 대신 문제별로 최적 감정을 자동 선택합니다. 강화학습 기반의 2층 MLP가 6가지 감정 중 최적을 고릅니다. 5개 벤치마크에서 고정 감정보다 높은 성능을 보입니다(Zhao et al., 2026). 감정 프롬프팅은 "적응형 제어 문제"입니다.
"AI에게 화를 내면 더 잘한다"는 주장의 실험 결과를 전달합니다. 이 논문의 핵심 수치(±0.5점 변화)를 5분 브리핑으로 만듭니다. 검증 없는 프롬프트 팁에 시간을 쓰지 않습니다. (15분, 브리핑 자료 작성)
프롬프트 끝에 감탄사나 감정 표현이 붙어 있다면 삭제합니다. 뒤에 붙인 감정은 최대 8점 하락을 유발합니다. Claude에 "이 프롬프트에서 불필요한 감정 표현을 찾아줘"라고 요청합니다. (30분, 프롬프트 점검)
감정보다 구조가 성능을 좌우합니다. 역할 정의, 예시 추가, 출력 형식 지정에 집중합니다. Claude에 "역할 정의, 맥락 제공, 출력 형식 지정 구조로 재작성해줘"라고 요청합니다. (1시간, 핵심 프롬프트 3개 재설계)
벤치마크와 실무는 다릅니다. 표준 평가에서의 결과가 사내 업무에 그대로 적용되지 않을 수 있습니다. 자체 검증을 병행해야 합니다.
4개 모델 한정 실험입니다. DeepSeek, GPT-OSS, Llama, Qwen에서만 검증했습니다. Claude나 Gemini 등 다른 모델에서는 결과가 다를 수 있습니다.
프롬프트 엔지니어링 자체가 무의미한 건 아닙니다. 이 연구는 "고정된 감정 문구"의 효과를 검증했습니다. 역할 부여, 단계별 추론, 예시 제공 같은 다른 기법은 별도 영역입니다.
EmotionRL은 아직 연구 단계입니다. 적응형 감정 선택의 효과는 확인됐지만, 상용 도구로 출시되지 않았습니다.
프롬프트에 감정을 넣어도 AI 성능은 달라지지 않습니다. 감정보다 구조에 투자하는 것이 합리적입니다.
프롬프트 엔지니어링: AI에게 원하는 답을 얻기 위해 질문 방식을 설계하는 기술입니다.
벤치마크: AI 모델의 성능을 측정하는 표준 평가입니다. 수학, 의학, 상식 등 분야별로 존재합니다.
GSM8K: 초등학교 수준의 수학 문장 문제 8,500개로 구성된 AI 수학 능력 평가입니다.
강화학습: AI가 시행착오를 통해 더 나은 행동을 찾아가는 학습 방법입니다.
EmotionRL: 이 논문에서 제안한 적응형 감정 선택 시스템입니다. 문제마다 최적의 감정을 자동으로 선택합니다.
MLP: 다층 퍼셉트론이라 불리는 기본적인 신경망 구조입니다. 입력을 여러 층에 걸쳐 처리합니다.
- Zhao, M., Yang, Y., Peng, C., Gonsalves, R., Li, W., Yang, R., Liu, Z., & Wang, M. (2026, April). Do Emotions in Prompts Matter? Effects of Emotional Framing on Large Language Models [Article]. arXiv. (원문 보기 ↗)