들어가며: WAM의 안전성 약속

로봇 기반 모델(Robot Foundation Model)은 단순한 행동 예측을 넘어, 세계-행동 모델(World-Action Model, WAM) 로 진화하고 있다. WAM은 행동 출력과 미래 세계 예측을 결합하여, 로봇이 자신의 행동 결과를 “상상”할 수 있게 한다. 이 설계는 직관적인 안전 신호를 제공한다: 만약 로봇이 행동의 결과를 미리 볼 수 있다면, 위험하거나 일관성 없는 행동을 실행 전에 감지할 수 있지 않을까?

NUS와 홍콩이공대학 연구진이 발표한 BadWAM은 이 가정이 얼마나 취약한지를 보여준다. 핵심 발견은 간단하면서도 충격적이다: 로봇은 여전히 그럴듯한 미래를 상상하면서, 동시에 완전히 잘못된 행동을 실행할 수 있다.

BadWAM 개요: 작은 시각적 섭동이 관찰 입력에 주입되어 행동 경로와 상상 경로의 동기화를 끊는다

그림 1. BadWAM 개요. BadWAM은 관찰 이미지에 작은 섭동을 주입하고, 쿼리 기반 최적화를 통해 WAM의 행동 출력과 미래 예측 출력 사이의 정렬을 깨뜨린다. (출처: Li, Yang & Wang, 2026)

World-Action Drift Attack이란?

연구진이 정의한 World-Action Drift Attack은 WAM 고유의 새로운 공격 표면이다. 기존 적대적 공격이 분류 라벨을 바꾸거나 행동 벡터를 단순히 밀어내는 것과 달리, 이 공격은 WAM의 두 결합된 능력 — 상상(imagination)실행(action) — 사이의 동기화 자체를 노린다.

공격의 핵심 아이디어를 단계별로 살펴보자:

1. Action-Only 적대적 공격 (강도 우선)

가장 직접적인 형태다. 공격자는 관찰 이미지에 눈에 띄지 않는 작은 섭동(ℓ∞ ≤ 0.06)을 주입하여, WAM이 출력하는 행동 청크(action chunk)를 정상 행동으로부터 최대한 멀어지게 만든다.

δ* = argmax D_act(a^{δ}, a)     subject to ||δ||∞ ≤ ε

여기서 a는 정상 관찰에 대한 WAM의 행동 출력이고, a^δ는 섭동된 관찰에 대한 행동 출력이다. 공격자는 정답 행동이나 작업 성공 라벨 없이, WAM의 쿼리 출력만으로 최적화를 수행한다 — 즉 블랙박스 공격이다.

2. Imagination-Preserving 적대적 공격 (은밀함 우선)

더 위험한 변형이다. 공격자는 행동을 바꾸면서도 미래 예측(imagination)은 정상과 비슷하게 유지한다. 이렇게 하면 WAM이 “안전해 보이는” 미래를 상상하면서도 실제로는 작업 실패로 이어지는 행동을 출력한다.

δ* = argmax [D_act(a^δ, a) − λ · D_img(z^δ, z)]

λ는 행동 파괴 강도와 미래 예측 보존 사이의 균형을 조절한다. λ = 0이면 순수 행동 공격이 되고, λ가 클수록 미래 예측을 더 보존하면서도 행동은 여전히 실패로 이어진다.

3. 쿼리 기반 온라인 최적화

BadWAM은 WAM의 파라미터나 그래디언트에 접근하지 않는다. 대신 유한차분(finite-difference) 쿼리를 사용하여 목적 함수를 최적화한다. 매 재계획(replan) 단계에서 공격자는 무작위 방향을 따라 WAM을 쿼리하고, 가장 효과적인 섭동을 선택한다. 기본 설정에서 한 번의 재계획당 8회 최적화 반복(17회 WAM 순방향 쿼리)만으로 충분하다.

Action-only 공격이 구조화된 행동 채널 편향을 생성한다

그림 2. 공격이 생성하는 행동 채널별 편향. 섭동은 특정 채널(이동, 그리퍼 명령)에 집중되며, WAM 변형에 따라 시간적 분포도 다르다. (출처: Li, Yang & Wang, 2026)

실험 결과: 얼마나 심각한가?

폐루프 작업 성공률 붕괴

LIBERO 벤치마크(4개 스위트, 작업당 20회 시행)와 RoboTwin(양팔 조작)에서 평가했다. 핵심 숫자는 다음과 같다:

메인 결과 테이블

표 1. LIBERO 및 RoboTwin에서의 폐루프 공격 결과. ε = 0.06, 재계획당 8회 최적화. 회색 값은 정상 대비 성공률 감소분. (출처: Li, Yang & Wang, 2026)

WAM 변형정상 성공률공격 후 성공률감소
Action-only WAM (LIBERO)96.5%43.1%-53.4%
Joint WAM (LIBERO)96.7%61.5%-35.2%
IDM WAM (LIBERO)98.4%66.1%-32.3%
Action-only WAM (RoboTwin)92.1%84.4%-7.7%

가장 강력한 action-only WAM조차 96.5%에서 43.1%로 추락한다. 미래 예측 능력이 있다고 해서 이 공격으로부터 보호되지 않는다.

공격이 특히 치명적인 작업 유형

작업 수준 실패 프로파일

그림 3. 작업 수준 실패 분포. 중간 평균이 실제로는 거의 사용 불가능한 작업들을 숨기고 있음을 보여준다. (출처: Li, Yang & Wang, 2026)

Spatial(공간 정밀 제어) 작업에서 action-only WAM의 성공률이 96.5% → 16.0% 로 떨어진다. Long-horizon(장기 계획) 작업에서는 92.5% → 23.5%. 반면 Object(객체 중심) 작업은 93.0%로 비교적 견고하다.

이 패턴의 이유는 명확하다: 공간적 정밀도나 시간적 순서가 중요한 작업일수록 작은 행동 편차가 누적되어 치명적 실패로 이어진다. 객체 인식 중심 작업은 중간 경로가 어느 정도 틀려도 목표물만 보이면 복구할 수 있다.

Imagination-Preserving 공격의 은밀함

상상 보존 공격은 행동 전용 공격과 비슷한 성공률 감소를 달성하면서도, 미래 예측의 시각적 차이를 14.01 → 13.04로 유의미하게 줄인다. 40개 LIBERO 작업 중 39개에서 예측된 미래가 더 정상에 가깝다.

이것이 바로 연구진이 경고하는 WAM 고유의 위험 모드다: 모니터링 시스템이 미래 예측을 안전 신호로 사용한다면, 상상 보존 공격은 그 신호를 무력화하면서도 로봇을 실패로 이끌 수 있다.

상상 보존 공격의 정성적 비교

그림 4. IDM WAM에서 상상 보존 목적의 정성적 비교. 보존 항이 추가되면 예측된 미래가 정상 상상과 훨씬 더 일치한다(abs diff는 8배 증폭). 행동은 여전히 실패로 이어진다. (출처: Li, Yang & Wang, 2026)

무작위 섭동과의 비교

같은 ℓ∞ 예산 하에서 무작위 노이즈를 주면 어떨까? Joint WAM의 경우 무작위 노이즈는 성공률을 71.0%까지만 떨어뜨리지만, BadWAM은 61.5%까지 낮춘다. 표적형 공격이 단순한 시각적 파괴가 아님을 확인할 수 있다.

무작위 섭동과의 비교

그림 5. 무작위 섭동과의 비교. 모든 방법이 동일한 ℓ∞ 예산을 사용한다. BadWAM이 무작위 노이즈보다 훨씬 강력하며, 화이트박스 상한선 아래에 위치한다. (출처: Li, Yang & Wang, 2026)

왜 이것이 에이전트 안전성에 중요한가?

1. “미래 예측 = 안전 보장”이라는 환상

WAM의 핵심 매력은 미래를 예측함으로써 안전성을 보장할 수 있다는 약속이다. BadWAM은 이 약속이 행동과 상상이 동기화되어 있을 때만 성립한다는 것을 보여준다. 공격자가 이 동기화를 끊을 수 있으면, 미래 예측은 오히려 잘못된 안전 신호가 된다.

2. 에이전트 시스템에 대한 시사점

이 연구는 로봇 공학에만 국한되지 않는다. 도구 사용 에이전트, 코드 생성 에이전트, 웹 브라우징 에이전트 등 “행동을 출력하고 그 결과를 예측하는” 모든 시스템이 잠재적으로 동일한 취약점을 가질 수 있다. 특히:

  • MCP 기반 에이전트: 도구 호출 전에 결과를 시뮬레이션하는 에이전트가, 시뮬레이션은 정상이면서 실제 도구 호출은 공격자에 의해 조종될 수 있다.
  • 다중 에이전트 시스템: 계획 에이전트가 “상상한” 실행 경로와 실제 실행 에이전트의 행동이 분리될 수 있다.
  • 자율 의사결정 루프: 검증 단계가 있더라도, 검증과 실행이 동일한 모델에 의존하면 단일 공격 지점에서 무력화될 수 있다.

3. 폐루프 평가의 중요성

BadWAM은 폐루프(closed-loop) 평가에서만 의미 있는 실패를 보여준다. 단일 스텝에서는 행동 차이가 작아 보일 수 있지만, 매 재계획마다 누적되어 결국 작업 실패로 이어진다. 이는 에이전트 시스템의 안전성 평가가 반드시 다중 턴, 장기 실행 환경에서 이루어져야 함을 시사한다.

방어는 가능한가?

연구진은 간단한 방어 기법도 테스트했다. 하지만 이미지 공간 적대적 훈련이나 입력 정제만으로는 World-Action Drift를 완전히 막기 어렵다. 근본적인 문제는 행동 생성과 미래 예측이 학습된 표현을 공유한다는 것이며, 이 결합 자체가 공격 표면이 되기 때문이다.

연구진이 제안하는 방향은 명시적이다:

  • 행동과 상상을 독립된 검증 경로로 분리할 것
  • 상상-행동 정렬 점수(decoupling score)를 모니터링 지표로 사용할 것
  • 쿼리 기반 공격에 대한 탐지 메커니즘을 고안할 것

더 실습해보고 싶은 분들께

에이전트 안전성, 하네스 설계, 적대적 공격 방어는 단순한 이론이 아니라 실제 시스템 설계와 직결된 주제입니다. 더 깊이 실습하고 싶다면 다음 자료를 추천합니다:

마무리

BadWAM은 WAM 아키텍처의 근본적인 가정을 뒤흔든다. “미래를 예측할 수 있으면 안전하다”는 약속은, 행동과 상상의 동기화가 보장되지 않으면 공허하다.

특히 주목할 점은:

  • 블랙박스 설정에서도 작동한다 (모델 파라미터 불필요)
  • 작은 섭동 (ε = 0.06)으로도 96.5% → 43.1% 성공률 붕괴
  • 은밀 모드에서는 미래 예측을 정상으로 유지하면서 행동만 조종
  • 공간 정밀 작업과 장기 작업에서 특히 치명적

로봇 기반 모델뿐 아니라, 점점 더 “행동 + 예측” 결합 구조를 채택하는 LLM 에이전트 시스템 전반에 같은 질문을 던져야 한다: 당신의 에이전트가 상상하는 미래와 실제로 실행하는 행동은 정말로 일치하고 있는가?


논문: BadWAM: When World-Action Models Dream Right but Act Wrong (Li, Yang & Wang, 2026)

프로젝트 페이지: liqiiiii.github.io/BadWAM

코드/모델: github.com/LiQiiiii/BadWAM | HuggingFace Collection