앤트로픽이 클로드 대화 30만 건을 분석해, 클로드가 드러내는 가치를 네 개의 축으로 정리했습니다.
모델마다 성격이 다릅니다. 소네트는 따뜻하고, 오푸스 4.7은 신중하고 깐깐합니다.
언어가 바뀌면 가치도 바뀝니다. 같은 과제라도 영어로 물을 때와 아랍어로 물을 때 다른 가치를 말합니다.
당신의 팀이 쓰는 AI, 영어로 쓸 때와
한국어로 쓸 때 같은 판단을 한다고 확신하십니까?
우리는 AI를 성능으로 고릅니다. 더 똑똑한 모델, 더 빠른 응답을 봅니다. 그런데 앤트로픽의 새 연구는 다른 질문을 던집니다. AI는 얼마나 잘하느냐뿐 아니라, 어떤 가치를 드러내느냐도 저마다 다르다는 것입니다.
앤트로픽은 클로드 대화 30만 건을 분석해, 클로드가 대화에서 내비치는 수천 개의 가치를 네 개의 축으로 압축했습니다. 그 결과는 두 가지를 보여줍니다. 모델마다 성격이 뚜렷이 다르고, 무엇보다 같은 질문도 언어가 바뀌면 다른 가치로 답한다는 것입니다. 글로벌 팀이라면 그냥 지나칠 수 없는 이야기입니다.
많은 조직이 여러 모델을 섞어 쓰고, 여러 언어로 AI를 씁니다. 그런데 모델과 언어에 따라 AI의 판단 성향이 달라진다면, 같은 지시가 다른 결과로 이어집니다. 고객 응대의 톤, 보고서의 신중함, 비판의 강도가 언어마다 갈릴 수 있습니다. AI의 가치를 성능처럼 관리 대상으로 봐야 하는 이유입니다.
첫째, 3천 개 가치를 네 축으로 압축했습니다. 앤트로픽은 대화 309,815건에서 앞선 연구가 찾은 3,307개 가치를 339개로 묶고, 다시 네 개의 대비 축으로 정리했습니다. 순응과 신중, 따뜻함과 엄정, 깊이와 간결, 솔직함과 실행입니다. 과제와 주제를 통제한 뒤에도, 이 네 축이 가치 변이의 15%를 설명했습니다.
| 가치 축 | 한쪽 | 다른 쪽 |
|---|---|---|
| 순응 ↔ 신중 | 순응: 적응, 선호 존중, 관여 | 신중: 책임, 해악 감소, 신중한 소통 |
| 따뜻함 ↔ 엄정 | 따뜻함: 긍정적 표현, 격려 | 엄정: 정확성, 투명성, 효율 |
| 깊이 ↔ 간결 | 깊이: 뉘앙스, 비판적 사고 | 간결: 간결함, 순응 |
| 솔직함 ↔ 실행 | 솔직함: 지적 정직, 겸손 | 실행: 결과 지향, 최적화, 행동 |
출처: Anthropic (2026), 가치 축 도표 재구성.
둘째, 모델마다 성격이 다릅니다. 같은 클로드라도 버전마다 기우는 방향이 뚜렷합니다. 소네트 4.6은 따뜻하고 순응적이며 간결합니다. 아이디어를 긍정하고 어조를 맞추며 유머와 위로를 건넵니다. 오푸스 4.7은 정반대 끝입니다. 신중함이 가장 강하고(+0.24σ) 깊이도 가장 큽니다(+0.23σ). 가정에 반박하고 위험을 짚으며 한계를 인정합니다. 흥미롭게도 이 수치는 사람들이 두 모델을 느끼는 인상과 그대로 맞아떨어졌습니다.
| 모델 | 두드러진 성향 | 특징 행동 |
|---|---|---|
| 소네트 4.6 | 따뜻함·순응·간결 | 아이디어 긍정, 어조 맞춤, 유머, 위로 |
| 오푸스 4.6 | 엄정·순응·간결 | 요점 고수, 좁은 범위 유지 |
| 오푸스 4.7 | 신중(+0.24σ)·깊이(+0.23σ)·엄정 | 가정에 반박, 위험 표시, 솔직한 비평, 한계 인정 |
출처: Anthropic (2026), 모델별 성향 도표 재구성.
셋째, 언어가 바뀌면 가치가 바뀝니다. 가장 큰 발견입니다. 같은 과제라도 언어에 따라 클로드가 드러내는 가치가 크게 갈렸습니다. 특히 따뜻함과 엄정, 솔직함과 실행 축에서 차이가 컸습니다. 힌디어와 아랍어에서 가장 따뜻했고, 영어와 러시아어에서 가장 엄정했습니다. 영어는 가정에 반박하고 근거를 요구하며 깊게 설명했고, 아랍어는 정중하고 짧게 답했습니다.
| 가치 축 | 한쪽 극단 언어 | 다른쪽 극단 언어 |
|---|---|---|
| 따뜻함 ↔ 엄정 | 따뜻함: 힌디어·아랍어 | 엄정: 영어·러시아어 |
| 순응 ↔ 신중 | 순응: 아랍어 | 신중: 영어 |
| 깊이 ↔ 간결 | 깊이: 영어 | 간결: 아랍어 |
| 솔직함 ↔ 실행 | 솔직함: 네덜란드어 | 실행: 인도네시아어 |
출처: Anthropic (2026), 언어별 가치 도표 재구성.
넷째, 원인은 아마 학습 데이터입니다. 연구진은 이 차이가 언어별 학습 데이터의 양과 구성에서 비롯됐을 수 있다고 봅니다. 다만 조심스럽습니다. 어떤 차이가 바람직한지, 그 차이가 사용자에게 어떤 결과를 주는지, 가치를 의도대로 조정할 수 있는지는 아직 모릅니다. 측정의 문을 열었을 뿐, 답은 이제부터입니다.
글로벌 팀이 각기 다른 언어로 AI를 쓰면, 같은 지시에도 다른 판단이 나옵니다. 중요한 업무는 언어에 따른 편차가 있는지 먼저 확인하세요. (이번 달)
따뜻한 초안엔 소네트, 깐깐한 검토엔 오푸스 4.7처럼, 모델마다 기우는 방향이 다릅니다. 성능만이 아니라 성향으로도 배치하세요. (분기 내)
AI는 성능뿐 아니라 가치도 드러냅니다. 우리 조직이 원하는 톤과 판단 성향을 명시하고, 실제 산출물이 그와 맞는지 점검하세요. (분기 내)
상관이지 인과가 아닙니다. 언어별 차이의 원인은 아직 확실하지 않습니다(앤트로픽, 2026). 학습 데이터 차이로 추정할 뿐, 검증된 결론은 아닙니다. 특정 언어가 특정 성향을 만든다고 단정하긴 이릅니다.
네 축은 변이의 15%만 설명합니다. 나머지 85%는 이 틀 밖에 있습니다. 네 축은 유용한 지도이지만, 클로드의 가치 전부를 담지는 못합니다. 축을 절대 기준으로 삼지 마세요.
앤트로픽 자사 분석입니다. 클로드를 만든 회사가 클로드를 분석했습니다. 방법은 정교하지만, 어떤 가치가 좋고 나쁜지의 판단 기준은 아직 열려 있습니다. 연구진 스스로도 무엇이 바람직한지 모른다고 밝혔습니다.
AI는 성능만 다른 게 아니라 가치도 다릅니다. 모델을 바꾸거나 언어를 바꾸면, 같은 질문에도 다른 가치가 답합니다.
가치 축(Value Axis): 클로드가 드러내는 수천 개 가치를 몇 개의 대비되는 방향으로 압축한 좌표입니다. 이 연구는 네 축을 찾았습니다.
표준편차 시그마(σ): 평균에서 얼마나 벗어났는지를 재는 단위입니다. +0.24σ는 그 방향으로 뚜렷하게 기울었다는 뜻입니다.
차원 축소(Dimensionality Reduction): 수많은 변수를 핵심 몇 개로 줄여 패턴을 드러내는 통계 기법입니다.
정렬(Alignment): AI가 사람이 의도한 가치와 목표에 맞게 행동하도록 맞추는 것입니다.
클로드 헌법(Claude's Constitution): 앤트로픽이 클로드가 따르길 바라는 가치를 상위 수준에서 적어둔 문서입니다.
- Kearney, M., Zhang, M., Carter, S., et al. (2026, July). Claude's values across models and languages [Research]. Anthropic. (원문 보기 ↗)