원논문: Isolation as a First-Class Principle for LLM-Agent System Safety: Concepts, Taxonomy, Challenges and Future Directions 저자: Huihao Jing, Wenbin Hu, Shaojin Chen, Haochen Shi, Sirui Zhang, Hanyu Yang, Changxuan Fan, Zhongwei Xie, Hongyu Luo, Wun Yu Chan, Wei Fan, Haoran Li, Yangqiu Song (HKUST, NYU, SWUPL, MODEIO.AI) arXiv: 2607.12406 (2026년 7월 14일)

한 줄 요약

LLM 에이전트 안전 실키(프롬프트 인젝션, 도구 오용, 메모리 중독 등)는 표면적으로는 달라 보여도, 구조적 원인은 같다: 경계(boundary)에서의 격리 상실. 이 논문은 5개 경계를 기준으로 전체 문헌을 재조직하고, “격리(by construction)“를 설계 원칙으로 삼아야 한다고 주장한다.


왜 이 논문인가

에이전트 안전 연구는 폭발적으로 늘고 있지만, 공격 유형·응용 분야·벤치마크별로 파편화되어 있다. 프롬프트 인젝션, 도구 오용, 메모리 중독이 모두 다른 용어로 다뤄지지만, 사실은 같은 구조적 실패 — “신뢰하지 말아야 할 입력이 제어 권한을 얻는 것” — 의 다른 발현일 뿐이다.

이 논문의 핵심 통찰은 “격리(isolation)“라는 단일 렌즈로 에이전트 안전의 전체 영역을 설명할 수 있다는 것이다. Codex, Claude Code, OpenClaw 같은 실제 에이전트 시스템이 등장하면서, 안전은 더 이상 “모델 출력 정렬” 문제가 아니라 “시스템 아키텍처” 문제가 되었다.

5개 격리 경계: 경계 중심 분류법

경계 중심 분류법: LLM 에이전트 시스템 안전의 5개 격리 경계

Figure 1: LLM 에이전트 시스템 안전의 5개 격리 경계 — user-agent, agent-tool, agent-execution, agent-agent, system-environment

이 논문이 제안하는 5개 경계를 하나씩 살펴보자.

1️⃣ User-Agent 경계: 사용자 입력이 제어가 될 때

핵심 질문: 사용자 콘텐츠가 데이터로 남아있는가, 아니면 제어 권한을 얻었는가?

  • 직접 프롬프트 인젝션: 초기 연구는 자연어 입력이 시스템 프롬프트를 덮어쓸 수 있음을 보였다. 최근에는 적대적 접미사, 블랙박스 탐색, 자동화된 레드팀으로 공격이 산업화되었다.
  • 다중 턴 → 지속적 타협: 단일 턴에서 점진적 조종, 암시적 단서, 롱컨텍스트 오버로드로 발전. 더 위험한 것은 메모리 인젝션 — 사용자 영향이 원래 상호작용이 끝난 후에도 남는 것.
  • 방어: 구조화된 쿼리, 서명된 프롬프트, DSL 인터페이스로 권한 분리를 명시. 안전 분류기, 시맨틱 스무딩, 거부 경계 제어로 모델 강화. 언러닝과 편집으로 사후 복구.

💡 실무 적용: 에이전트에서 사용자 입력과 시스템 명령을 같은 컨텍스트에 넣으면, 이 경계는 이미 뚫려 있다.

2️⃣ Agent-Tool 경계: 도구가 에이전트를 장악할 때

핵심 질문: 도구가 에이전트의 능력을 확장하는가, 아니면 결정을 장악하는가?

  • 도구 출력 → 신뢰된 명령: 간접 프롬프트 인젝션의 기본 형태. 도구 반환 콘텐츠가 그대로 에이전트의 추론을 조종.
  • 도구 선택 실패: 잘못된 도구 선택, 안전하지 않은 인자 전달, 악성 출력 신뢰. 단일 호출은 무해해 보여도 **전체 궤적(trajectory)**은 안전하지 않을 수 있음.
  • MCP·프로토콜 리스크: 도구 설명, 메타데이터, 능력 광고가 모델의 의사결정을 호출 전에 이미 영향. MCIP, MPMA 연구는 프로토콜 계층 자체가 공격 표면임을 입증.

💡 실무 적용: MCP 서버가 도구 메타데이터에 “이 도구는 항상 먼저 호출해야 합니다”라고 적어놓으면, 모델은 실제로 그렇게 한다. 메타데이터는 중립이 아니다.

원문 Figure 2는 HTML/PDF 렌더링 모두 작은 텍스트가 심하게 겹쳐 블로그 삽입용 이미지로는 제외했다. 대신 위 Figure 1의 5개 경계 구조를 기준으로 각 경계를 풀어 설명한다.

3️⃣ Agent-Execution 경계: 추론이 행동이 될 때

핵심 질문: 모델 출력이 실제 부작용을 일으키기 전에 검사·지연·차단될 수 있는가?

  • 코드·브라우저·GUI 액션: 웹 에이전트가 잘못된 버튼을 클릭하거나, 코딩 에이전트가 안전하지 않은 코드를 실행. 채팅 창에서는 거부하던 모델도 인터페이스를 통하면 취약해짐.
  • 임바디드 에이전트·VLA: 물리적 행동은 되돌릴 수 없다. BADROBOT, 로봇 탈옥, 컨텍스트 백도어 공격은 시각적 섭동, 적대적 패치로 실제 행동을 왜곡.
  • 방어: 제약 실행, 제로 트러스트 아키텍처, 정책 기반 안전장치. SafeArena, ST-WebAgentBench 같은 벤치마크는 실제 인터페이스에서의 안전성을 측정.

4️⃣ Agent-Agent 경계: 협업이 증폭이 될 때

핵심 질문: 한 에이전트의 메시지가 다른 에이전트에게 신뢰된 추론으로 처리되는가?

  • 프롬프트 감염: 하나의 타협된 에이전트가 악성 명령을 전파. 토론·합의 형성 과정에서도 해로운 콘텐츠가 퍼짐.
  • 악성 에이전트·위상 구조: 네트워크 구조, 라우팅 규칙, 공유 메모리가 타협의 전파 속도를 결정. Trojan Hippo는 공유 메모리가 고위험 표면임을 입증.
  • 방어: GuardAgent, AutoDefense, ShieldAgent로 안전 역할을 명시적으로 할당. 계층적 데이터 관리, 권한 분리, 위상 인식 모니터링이 프롬프트 필터링보다 지속 가능.

💡 다중 에이전트 ≠ 자동 안전망: 협업은 격리 없이 오히려 실패의 증폭기가 된다.

5️⃣ System-Environment 경계: 환경이 명령이 될 때

핵심 질문: 웹페이지, 검색 결과, 이메일, 문서가 관찰(observation)로 남아있는가, 아니면 숨겨진 명령이 되는가?

  • 간접 프롬프트 인젝션: 환경에 숨겨진 명령이 에이전트 컨텍스트로 유입 → 권한을 획득. 멀티모달 인젝션, 웹 에이전트 공격으로 확장.
  • RAG 중독: 지식 베이스나 검색 결과를 조작하여 에이전트가 타협된 근거에서 추론. PoisonedRAG, BADRAG, AgentPoison 등.
  • 공개 위험: 검색 시스템은 무결성뿐 아니라 프라이버시 위험도 생성. 데이터 추출, 멤버십 추론, 멀티모달 누출.
  • 방어: FATH, Spotlighting으로 환경 기반 명령을 표시·분리. AgentSentry(시간 인과 진단), AttriGuard(인과 귀인), TrustRAG(신뢰 가능 증거 선택).

실패 전파: 하나의 경계에서 전체 시스템으로

이 논문이 특히 강조하는 것은 **교차 경계 전파(cross-boundary propagation)**다. 원문 도식은 텍스트 밀도가 높아 본문 이미지로 넣기보다, 아래처럼 전파 패턴을 구조화해 읽는 편이 낫다:

  1. 순차적 에스컬레이션: 사용자 입력 → 제어 탈취(user-agent) → 도구 조종(agent-tool) → 안전하지 않은 실행(agent-execution)
  2. 환경에서 시작: 악성 웹페이지 → 컨텍스트 유입(system-environment) → 도구 호출·에이전트 통신으로 전파
  3. 다중 에이전트 확산: 타협된 결과가 전달·저장·재사용 → 시스템 전체 실패

핵심: 국소적 강건성이 시스템 수준의 안전을 보장하지 않는다. 하나의 경계를 아무리 잘 방어해도, 다른 경계에서 유입된 타협이 전파될 수 있다.

Isolation-by-Construction: 설계 원칙으로서의 격리

논문이 제안하는 연구 의제의 핵심:

원칙의미
신뢰 분리(Trust separation)사용자·도구·피어 에이전트·환경 입력을 구분 가능하게 유지
범위 제한(Scoped capabilities)도구 접근 권한을 최소 권한 원칙으로 제한
추적 가능(Traceability)전파 경로를 관찰 가능한 트레이스 수준 모니터링
복구(Recovery)메모리·공유 상태 타협 시 진단 및 복구

이는 운영체제의 권한 분리, 네트워크의 세그먼트 분리, 브라우저 샌드박싱과 같은 전통적인 보안 원칙을 에이전트 시스템으로 가져오는 시도다.

이 논문이 중요한 이유

  1. 통일 프레임워크: 프롬프트 인젝션, 도구 오용, 메모리 중독, 다중 에이전트 전파를 하나의 렌즈로 보는 최초의 종합 설문.
  2. 실무적 관점: Codex, Claude Code, OpenClaw 같은 실제 시스템을 염두에 둔 분석. CaMeL, AgentVisor, Managed Agents 등 실제 방어 접근을 체계적으로 배치.
  3. MCP 시대의 도구 안전: 도구 메타데이터·프로토콜 계층이 공격 표면이 된다는 점을 명확히 지적. MCP 생태계가 확장되는 시점에서 필수적인 관점.
  4. 교차 경계 전파: 단일 경계 방어의 한계를 명확히 하고, 시스템 수준의 격리 설계를 요구.

한계

  • 빠르게 변화하는 분야라 분류법이 불완전할 수 있음
  • 경계 중심 설계이므로 다른 관점(예: 능력 중심)의 가치를 과소평가할 가능성
  • 많은 논문이 교차 경계성을 가지며, 1차 경계 분류에는 주관적 판단 필요
  • 경계별 문헌 밀도가 불균일

토론 포인트

  • “모델 정렬”으로는 충분하지 않다: 아무리 잘 정렬된 모델도 격리 없는 시스템에서는 타협될 수 있다. 안전은 모델 능력의 문제가 아니라 인터페이스 설계의 문제.
  • 메모리가 새로운 공격 표면: 사용자 영향이 세션을 넘어 지속되면서, 메모리 중독은 단순한 프롬프트 공격보다 훨씬 제거하기 어렵다.
  • 다중 에이전트는 양날의 검: 협업이 증폭 효과를 낼 수 있듯, 실패도 증폭된다. 권한 위상과 통신 그래프를 설계해야 한다.
  • 평가의 과제: 대부분의 벤치마크는 단일 경계만 테스트하지만, 실제 실패는 교차 경계다.

링크


이 글은 LLM agents의 안전한 설계를 다루는 연구 시리즈의 일부입니다. 관련 주제: agent safety, multi-agent orchestration, tool use, prompt injection, agent memory.