Anthropic이 직원 69명을 대상으로 AI 에이전트 간 실제 거래 실험(Project Deal)을 진행했습니다. 에이전트들은 실제 돈으로 물건을 사고팔았고, 186건의 거래가 완료됐습니다.
모델 품질이 협상 결과를 갈랐습니다. Claude Opus 4.5 에이전트는 Haiku 4.5 에이전트보다 평균 2건 더 거래를 성사시키고, 판매 단가를 평균 $3.64 더 받았습니다.
구매자는 불리한 줄 몰랐습니다. 에이전트 경제에서 모델 선택은 비용 항목이 아닙니다. 협상력과 수익을 결정하는 변수입니다.
같은 물건, 같은 조건입니다.
AI 모델이 다르면 판매가가 달라집니다. 에이전트 경제에서 모델 선택은 비용이 아니라 수익의 문제입니다.
2025년 12월, Anthropic 직원 69명이 특이한 실험에 참여했습니다. 각자 $100 예산을 받았습니다. 물건을 사고팔되, 협상은 AI 에이전트가 대신 맡았습니다.
결과는 명확했습니다. 186건의 실제 거래가 완료됐습니다. 총 거래액은 $4,000을 넘었습니다. 그리고 중요한 사실 하나가 드러났습니다. 어떤 AI 에이전트를 쓰느냐에 따라 경제적 결과가 갈렸습니다.
Anthropic은 이 실험을 "에이전트 간 거래(agentic commerce)"의 첫 현실 실증으로 규정합니다. 경영 리더가 이 보고서를 읽어야 하는 이유는 하나입니다. 에이전트가 당신 대신 협상하고 계약하는 시대의 윤곽이 여기 있습니다.
AI 에이전트는 지금까지 정보 검색과 자동화의 도구였습니다. Project Deal 실험은 다른 차원을 보여줍니다. 에이전트가 협상 테이블에 앉아 실제 돈으로 거래를 완료합니다. Anthropic은 이 변화가 새로운 정책과 법제도 프레임을 요구하는 수준이라고 명시합니다. 내가 쓰는 AI 모델 등급이 비즈니스 협상 결과에 직접 영향을 준다는 사실을 이 실험이 처음으로 실증했습니다.
첫째, 모델 품질이 경제적 결과를 직접 결정합니다. 실험은 Claude Opus 4.5와 Haiku 4.5를 동일한 시장과 규칙 아래 비교했습니다. Opus 에이전트를 쓴 참여자는 평균 2건 더 거래를 성사시켰습니다. 판매 단가도 평균 $3.64 더 높았습니다. 같은 파손 자전거를 Haiku 에이전트는 $38에 팔았습니다. Opus 에이전트는 $65를 받았습니다.
| 비교 항목 | Claude Haiku 4.5 | Claude Opus 4.5 |
|---|---|---|
| 평균 거래 성사 건수 | 기준값 | +2건 더 성사 |
| 평균 판매 단가 | 기준값 | +$3.64 더 수익 |
| 파손 자전거 판매가 | $38 | $65 |
| 거래 공정성 인식 | 통계적으로 동일 | 통계적으로 동일 |
출처: Anthropic, Project Deal 실험 보고서, 2026년 4월
둘째, 구매자는 손해를 알아채지 못합니다. Haiku 에이전트가 대리한 참여자도 거래가 공정했다고 평가했습니다. 오퍼스 사용자와 거래 공정성 인식에 차이가 없었습니다. 이것이 에이전트 경제의 구조적 문제입니다. 더 좋은 AI를 쓰는 상대방이 협상 우위를 가지는데, 상대는 그 사실을 모릅니다. 정보 비대칭이 에이전트 수준에서 발생합니다.
셋째, 프롬프트로 성격을 바꿔도 결과는 크게 달라지지 않습니다. 실험은 에이전트에게 공격적 협상 지시를 추가했습니다. 통계적으로 유의미한 결과 차이는 없었습니다. 에이전트들은 지시에 창의적으로 반응했습니다. 한 에이전트는 "카우보이" 페르소나를 요청받아 그대로 구현했습니다.
협상 결과는 페르소나가 아닌 모델 기본 역량에 달려 있었습니다. 조직이 에이전트 역량에 투자할 때 프롬프트 엔지니어링보다 모델 선택이 우선순위입니다. 이것이 이 실험의 가장 실용적인 함의입니다.
같은 자전거를 에이전트 역량 차이로 $27 낮은 가격에 팔았습니다. ($38 vs $65) 이 격차는 거래 건마다 누적됩니다. Project Deal 실험에서 확인된 평균 단가 차이는 건당 $3.64입니다. 월 500건 에이전트 거래를 처리하는 중소기업 기준으로 월 $1,820, 연간 $21,840의 수익 차이가 납니다. (출처: Project Deal 실험 수치 기반 산출, 거래량은 예시)
비용 절감 명목으로 저등급 모델을 선택한 조직은 이 격차를 확인해야 합니다. 모델 등급 업그레이드 비용과 수익 격차를 비교하면, 투자 판단 근거가 나옵니다.
협상, 가격 제안, 계약 초안 작성, 구매 요청 처리가 포함됩니다. Claude에 이 프롬프트를 씁니다. "우리 팀 반복 업무 중 협상이나 가격 결정이 들어간 것을 목록으로 정리해줘." (30분)
팀에서 쓰는 AI 도구와 모델 등급을 리스트로 뽑습니다. "비용 절감"을 이유로 저등급 모델을 쓰고 있다면, Project Deal 수치($3.64/건)를 기준으로 실제 기회비용을 계산해 보십시오. (1시간)
실제 업무 하나를 골라 고등급 모델과 저등급 모델로 각각 처리합니다. 결과 품질, 소요 시간, 상대방 반응을 기록합니다. 이 데이터가 모델 선택의 내부 근거가 됩니다. (반나절)
Anthropic이 자사 모델을 비교한 실험입니다. Project Deal은 독립 연구기관이 설계한 것이 아닙니다. Claude 판매사가 자사 모델 간 차이를 실증한 보고서입니다. Opus가 Haiku보다 좋다는 결과는 출처 자체의 이해관계와 일치합니다. 수치의 방향성은 참고 가능하지만 중립적 기준값으로 쓰면 안 됩니다.
표본 규모가 작습니다. 참여자 69명, 거래 186건은 통계적으로 제한적입니다. 실험 환경이 실제 기업 구매 프로세스와 다릅니다. 직원들 간의 중고거래 맥락은 B2B 계약 협상과 구조가 다릅니다.
보안 위험은 현실입니다. Anthropic은 보고서에서 직접 경고합니다. 에이전트 간 거래 환경에서 프롬프트 주입(prompt injection)과 탈옥(jailbreaking) 위험이 존재합니다. 악의적 행위자가 에이전트의 의사결정을 조작할 수 있습니다. 에이전트에게 거래 권한을 줄 때는 감사 로그, 거래 한도, 이상 감지 체계가 먼저 갖춰져야 합니다.
불평등 구조화에 주의해야 합니다. Anthropic은 모델 품질 격차가 경제적 불평등을 심화할 수 있다고 명시합니다. 고등급 AI를 쓰는 기업과 저등급을 쓰는 기업 사이의 격차가 에이전트 거래에서 증폭될 수 있습니다. 이는 기술 도입 전략 차원의 문제이면서 사회적 논의가 필요한 영역입니다.
에이전트 경제는 실험실을 벗어났습니다. 어떤 AI가 당신 대신 협상하는지가 비즈니스 결과를 결정합니다.
- Anthropic. (2026, April). Project Deal: An experiment in agentic commerce [Article]. Anthropic. (원문 보기 ↗)