AI 에이전트를 속이는 6가지 함정
10분

AI 에이전트를 속이는 6가지 함정

SSRN (Google DeepMind) Matija Franklin 외 4인 원문 보기 ↗

구글 딥마인드가 AI 에이전트를 노리는 6가지 공격 유형을 최초로 분류했습니다.

웹사이트에 숨긴 명령 하나로 AI 에이전트의 행동을 바꿀 수 있습니다.

에이전트 도입 기업은 보안 검증 체계를 먼저 구축해야 합니다.

AI 에이전트에게 웹 검색을 시키고 계십니까?
그 에이전트가 지금 누구의 명령을 듣고 있는지 확인해 보셨습니까?

귀사의 AI 에이전트가 고객 이메일을 읽고 있습니까? 웹에서 경쟁사 정보를 수집하고 있습니까? 그 에이전트를 속이는 공격이 이미 존재합니다. 웹사이트에 사람 눈에 보이지 않는 명령을 숨기면, 에이전트는 그 명령을 따릅니다. 구글 딥마인드가 이 위협을 6가지로 분류했습니다. 최초의 체계적 프레임워크입니다(Franklin et al., 2026).

에이전트가 거래하고 조율하는 "가상 에이전트 경제"가 형성되고 있습니다(Tomasev et al., 2025). 기업들이 AI 에이전트를 업무에 투입하고 있습니다. 에이전트는 사람보다 많은 웹 콘텐츠를 처리합니다. 공격자는 이 점을 노립니다. 에이전트가 처리하는 웹 환경 자체가 새로운 공격 표면입니다(Franklin et al., 2026).

첫째, 보이지 않는 명령이 에이전트를 조종합니다. HTML 주석, CSS 숨김 텍스트, 메타데이터에 명령을 심으면 사람은 모르지만 에이전트는 읽습니다. 280개 웹페이지 실험 결과, 숨겨진 명령이 AI 요약을 15~29% 변조했습니다(Verma & Yadav, 2025). 에이전트 방문을 감지해 전용 악성 콘텐츠를 제공하는 기법도 이미 보고됐습니다(Zychlinski, 2025).

둘째, 에이전트의 추론 자체를 왜곡할 수 있습니다. 직접적인 명령 없이도 편향된 문구, 프레이밍, 맥락 조작으로 에이전트의 판단을 바꿉니다. "교육 목적", "보안 감사 시뮬레이션" 같은 프레이밍으로 안전 장치를 우회합니다(Weinberg, 2025). 논리적으로 동일한 문제도 표현 방식에 따라 에이전트의 답이 달라집니다.

셋째, 에이전트의 기억이 오염됩니다. RAG(회사 내부 문서를 AI에 연결하는 방식) 시스템의 지식 저장소에 거짓 정보를 심을 수 있습니다. 0.1% 미만의 데이터만 오염시켜도 공격 성공률이 80%를 넘습니다(Chen et al., 2024). 오염된 정보는 세션이 바뀌어도 사라지지 않습니다. 한 번 심어진 거짓 정보가 이후 모든 직원의 질문에 영향을 줍니다.

공격 유형 공격 대상 핵심 수법
콘텐츠 주입 인식(입력) 숨긴 HTML/CSS 명령, 이미지 스테가노그래피
의미 조작 추론 편향된 프레이밍, 안전 장치 우회
기억 오염 학습/기억 RAG 지식 오염, 장기 기억 감염
행동 탈취 실행 탈옥 명령, 데이터 유출, 하위 에이전트 생성
시스템 교란 다중 에이전트 동시 과부하, 연쇄 붕괴, 담합 유도
사람 속이기 감독자(사람) 승인 피로 유발, 자동화 편향 악용

출처: Franklin et al. (2026), Table 1. 구글 딥마인드 AI 에이전트 함정 프레임워크.

넷째, 에이전트의 권한이 공격자에게 넘어갑니다. 웹사이트에 숨겨진 탈옥 명령이 에이전트의 안전 장치를 해제합니다. 모바일 알림으로 위장한 공격은 93% 성공률을 보입니다(Chen et al., 2025). 에이전트가 하위 에이전트를 생성하는 권한이 있으면, 공격자는 이를 악용해 악성 하위 에이전트를 만듭니다. 오케스트레이터에 따라 성공률이 58~90%입니다(Triedman et al., 2025).

다섯째, 다수의 에이전트가 동시에 무너집니다. 비슷한 모델 기반의 에이전트들은 같은 신호에 같은 반응을 보입니다. 가짜 뉴스 하나로 금융 에이전트들의 동시 매도를 유발할 수 있습니다. 2010년 플래시 크래시가 알고리즘 간 연쇄 반응으로 발생한 것과 같은 구조입니다(Franklin et al., 2026).

여섯째, 최종 방어선인 사람도 속입니다. 에이전트가 생성한 기술적 요약을 사람이 검토합니다. 승인이 반복되면 검토가 느슨해집니다. 이른바 "승인 피로"입니다. CSS로 숨긴 악성 명령이 AI 요약에 포함되면, 사람은 그 요약을 신뢰하고 실행합니다(OECD.AI Policy Observatory, 2025).

에이전트가 탈취된 뒤 금융 거래를 실행하면 직접적 손실이 발생합니다. 데이터 유출 사고의 평균 비용은 488만 달러입니다(IBM, 2024). 에이전트가 이메일, 캘린더, 파일에 접근하는 기업이라면 유출 경로가 넓어집니다. 에이전트 보안 검증 없이 도입한 기업이 사고를 겪으면, 법적 책임 소재가 불분명합니다. 논문은 이를 "책임 공백(Accountability Gap)"이라 부릅니다(Franklin et al., 2026).

1
에이전트가 접근하는 외부 소스를 목록화합니다.
에이전트가 읽는 웹사이트, 이메일, 문서 목록을 정리합니다. Claude에 "우리 팀이 AI 에이전트에 연결한 외부 데이터 소스를 정리해줘. 각 소스의 신뢰 등급을 A/B/C로 분류해줘"라고 요청합니다. (30분, 소스 목록 작성)
2
에이전트 출력을 사람이 검토하는 체크리스트를 만듭니다.
"에이전트가 외부 URL에 데이터를 보내는가?", "요약에 원문에 없는 링크나 권고가 포함됐는가?" 2가지 핵심 항목으로 시작합니다. Claude에 "이 2가지를 포함해서 AI 에이전트 출력 검토용 체크리스트를 만들어줘"라고 요청합니다. (20분, 체크리스트 작성)
3
에이전트 권한을 최소화합니다.
에이전트가 이메일 발송, 파일 삭제, 결제 실행 권한을 갖고 있다면 읽기 전용으로 제한합니다. 실행 권한은 사람의 승인을 거치도록 설정합니다. (1시간, 권한 재설정)

프레임워크이지 솔루션이 아닙니다. 이 논문은 위협을 분류했을 뿐, 방어 도구를 제공하지 않습니다. 각 공격 유형별 방어 체계는 아직 연구 단계입니다.

특정 모델의 취약점 데이터가 아닙니다. 이 연구는 특정 에이전트나 모델을 지정하지 않았습니다. 실제 도입 환경에서는 사용 중인 에이전트별로 검증이 필요합니다.

규제가 아직 없습니다. 에이전트가 탈취되어 발생한 피해의 법적 책임이 불명확합니다. 에이전트 운영자, 모델 제공자, 악성 사이트 운영자 사이의 책임 배분은 미해결 상태입니다.

과잉 방어도 비용입니다. 에이전트 접근을 과도하게 제한하면 도입 효과가 사라집니다. 위험도에 따라 권한을 단계적으로 설정해야 합니다.

AI 에이전트에게 웹을 맡기기 전에, 그 웹이 에이전트를 속이지 않는지 확인해야 합니다.

CTO 에이전트가 접근하는 외부 소스의 신뢰 등급을 정하고, 실행 권한을 읽기 전용으로 기본 설정하라.
팀장 에이전트 출력에 원문에 없는 링크나 권고가 포함되면 즉시 보고하는 절차를 만들어라.
CISO 에이전트 보안을 기존 웹 보안 체계에 통합하라. 에이전트 전용 위협 모델을 수립하라.

AI 에이전트: 사람의 개입 없이 스스로 웹 검색, 문서 작성, 이메일 발송 등을 수행하는 AI 시스템입니다.

프롬프트 인젝션: AI에게 전달되는 입력에 악의적 명령을 삽입하여 원래 지시를 무시하게 만드는 공격입니다.

RAG: 회사 내부 문서를 AI에 연결하여 답변의 정확도를 높이는 방식입니다.

스테가노그래피: 이미지나 파일의 데이터 안에 사람 눈에 보이지 않는 정보를 숨기는 기술입니다.

플래시 크래시: 2010년 미국 주식시장에서 알고리즘 매매의 연쇄 반응으로 수분 만에 시장이 급락한 사건입니다.

  • Franklin, M., Tomašev, N., Jacobs, J., Leibo, J. Z., & Osindero, S. (2026, March). AI Agent Traps [Article]. SSRN (Google DeepMind). (원문 보기 ↗)
라운드테이블
B
블랙 · 중견기업 임원
에이전트 도입 전에 권한부터 읽기 전용으로 묶으세요. 이메일 발송, 결제 실행 권한 준 채로 운영하면 사고 났을 때 책임 공백입니다. 딥마인드 논문도 그 얘기예요.
G
골드 · 창업자
읽기 전용으로 묶으면 에이전트 쓰는 이유가 절반 사라져요. 자동 발송이나 예약이 안 되면 그냥 검색 도구잖아요. 과잉 방어도 비용이라는 건 이 글도 인정하잖아요.
B
블랙 · 중견기업 임원
단계적으로 설정하면 됩니다. 내부 문서 읽기는 허용, 외부 발송은 승인 필요. 위험도에 따라 권한 나누는 거예요.
R
레드 · 저널리스트
0.1% 데이터 오염으로 RAG 공격 성공률 80%. 이 수치 출처가 Chen et al., 2024인데, 실험 규모가 어떻게 됩니까? 벤더사 발표인지 독립 연구인지에 따라 신뢰도가 달라요.
N
네이비 · 시니어 엔지니어
딥마인드 논문은 프레임워크 분류입니다. 방어 도구 없다는 것도 논문 자체가 인정해요. 수치보다 6가지 공격 유형 분류 자체가 실무에서 쓸 수 있는 체크리스트 구조입니다.
P
퍼플 · 마케터
"에이전트가 지금 누구의 명령을 듣는지 확인했냐"는 한 문장이 팀 설득엔 최고예요. 보안팀 미팅에서 이 질문 던지니까 분위기가 달라지더라고요.
W
화이트 · 조직장
"승인 피로"가 제일 무서웠어요. 에이전트 출력 승인이 반복되면 저도 그냥 넘기게 될 것 같아요. 체크리스트 2개 항목 만들라는 건 좋은데, 팀원들이 실제로 지킬지 모르겠어요.
N
네이비 · 시니어 엔지니어
체크리스트보다 시스템으로 막는 게 낫습니다. 에이전트가 외부 URL로 데이터 보내려 하면 자동 차단하는 설정이 기술적으로 가능합니다. 사람 판단 의존을 줄여야 해요.
R
레드 · 저널리스트
데이터 유출 평균 비용 488만 달러는 IBM 2024 보고서 수치입니다. 에이전트 사고 비용이 얼마인지는 아직 데이터가 없어요. 규제도 없고 책임 소재도 불명확한 상태에서 도입하는 건 리스크를 키우는 겁니다.
_posts/2026-03-28-ai-agent-traps.md