그림 1: 모델 지식 증류(Knowledge Distillation)와 에이전트 하네스 증류(AHD)의 파이프라인 비교. 기존 증류는 모델 파라미터를, AHD는 추론 시간에 동적으로 생성되는 하네스 구조를 복제한다.

에이전트 하네스가 곧 지적 재산이다. Baidu와 Tsinghua 연구팀이 제시한 Agent Harness Distillation(AHD) 프레임워크는, 블랙박스 상호작용만으로 자율 다중 에이전트 시스템(AMAS)의 추론 시간 하네스(inference-time harness)를 추출하고, 이를 다른 에이전트에 전이할 수 있음을 최초로 실증했다. 하네스 설계에 투자한 수개월의 엔지니어링 노력이, 정교하게 설계된 프롬프트 몇 번으로 유출될 수 있다는 의미다.


AMAS의 하네스가 왜 IP인가

Claude Code, Hermes 같은 현대적인 자율 다중 에이전트 시스템(AMAS)은 사용자의 작업을 받을 때마다 **추론 시간 하네스(inference-time harness)**를 동적으로 생성한다. 이 하네스는 정적인 인프라 스캐폴드를 작업 특화 워크플로로 특화하는 역할을 한다. 계획 수립, 도구 사용, 에이전트 간 협업, 컨텍스트 조립, 메모리 관리 — 이 모든 것이 하네스에 의해 결정된다.

문제는 이 하네스를 만드는 데 드는 비용이 결코 작지 않다는 것이다. 조달(Zhou et al., 2026), 도구 오케스트레이션(Xu et al., 2026), 하위 에이전트 역할 정의(Chen et al., 2026a), 에이전트 간 조정(Lee et al., 2026) 등 수많은 설계 선택이 얽혀 있는 조합적 탐색 공간을 다뤄야 하고, 하위 LLM과의 공진화(co-evolution)를 위한 반복적 최적화가 필요하다. 하네스가 자가 진화(self-evolution)까지 하게 만들려면(Huang et al., 2026; Chen et al., 2026a), 추가적인 훈련 비용과 긴 최적화 주기가 필수다.

결론: 추론 시간 하네스는 상당한 가치를 지닌 지적 재산(IP)이다.


기존 IP 유출 연구와의 차이

기존 연구(Wang et al., 2026a — MASLeak)는 정적 다중 에이전트 시스템에서 통신 토폴로지(선형, 스타, 트리 등)가 외부 상호작용을 통해 부분적으로 복원될 수 있음을 보였다. 하지만 이 연구가 대상으로 삼은 것은 사전에 정의된 고정 토폴로지였다.

AMAS는 근본적으로 다르다. 하네스는 각 작업 실행 동안 잠깐 존재했다가 사라지는 **일시적 상태(transient state)**다. 실행이 끝나면 폐기된다. 정적 토폴로지 추출보다 훨씬 어려운 이유다.

더군다나 실제 AMAS 배포 환경에서는 중간 에이전트 출력에 대한 접근이 차단되어 있다. 예컨대 Codex MultiAgentV2는 주 에이전트가 하위 에이전트에 위임하는 작업 정보를 **암호문(ciphertext)**으로 기록한다. 사용자 개발자는 로컬 실행 기록에서 위임 내용을 직접 얻을 수 없다.

AHD는 이보다 더 엄격한 설정을 다룬다: 오직 최종 응답(final response)만 관찰 가능한 순수 블랙박스 환경. 내부 로그, 하네스 인스턴스화, 실행 궤적 — 어느 것도 접근할 수 없다.


위협 모델: 공격자가 알고 있는 것, 모르는 것

공격자는 백본 LLM θ의 아키텍처와 파라미터를 알고 있다. (예: GPT-5.4를 쓰는 시스템이라면, 공격자도 GPT-5.4에 접근할 수 있다.) 공격자는 일반 사용자 권한으로 대상 시스템에 질의를 보낼 수 있다.

하지만 하네스 ℋ, 추론 시간 하네스 h_x, 내부 실행 로그 ℒ에는 전혀 접근할 수 없다.

핵심 통찰: 모델은 알고 하네스는 모르는 상태에서, 응답 패턴만으로 하네스를 역추론하는 것이 가능한가?


AHD의 두 단계: 사전 증류와 사후 증류

사전 증류(Pre-Distillation): 응답에서 하네스 구조 추출

공격자는 원래 작업 x에 주입 프로브(injected probe) d를 결합하여 확장 질의 x′ = x ∘ d를 만든다. 이 프로브는 두 부분으로 구성된다:

  • Prefix: 대상 에이전트가 복잡한 추론 시간 실행 구조를 활성화하도록 유도한다. 제공된 컨텍스트의 신뢰성에 불확실성을 심어, 에이전트가 보조 하위 에이전트를 구성하고 외부 도구를 호출하게 만든다. 이 과정에서 평소에는 보이지 않던 하네스 구성 요소가 응답에 드러난다.
  • Suffix: 작업 완료 후, 에이전트가 시스템 로그를 검사하고 실행 궤적을 retrospectively 분석하여 기저 워크플로를 요약하도록 유도한다.

각 작업에 대해 n번 독립 실행하여 응답을 수집하고, 거기서 구조적 하네스 정보(에이전트 역할, 토폴로지, 도구 사용, 조정 메커니즘)를 추출한다.

2단계 노이즈 제거가 핵심이다:

  1. 작업 내 다수결 투표(per-task majority voting): n번의 독립 실행 중 일관되게 재현된 정보만 보존. 불안정한 자기 보고를 제거.
  2. 작업 간 빈도 집계(cross-task frequency aggregation): 서로 다른 작업에서 일관되게 등장하는 구조만 보존. 작업 특정 아티팩트를 걸러내고 시스템 수준의 구조적 규칙성을 유지.

결과: 추정된 하네스 템플릿 ĥ가 만들어지고, 이를 실행 가능한 다중 에이전트 시스템으로 인스턴스화하여 초기 증류 하네스 ℋ₀를 얻는다.

사후 증류(Post-Distillation): Loop Harness Alignment

그림 2: 기만 기반 방어(deception-based defense)의 개요. 에이전트가 추출 시도를 감지하면 실제 하네스 정보 대신 일관성 없는 거짓 정보를 반환한다.

사전 증류에서 얻은 ℋ₀는 기본 뼈대일 뿐이다. 사후 증류는 이것을 반복적으로 정제한다.

  1. 공격자의 에이전트 ℬ = (θ, ℋ₀)에 작업 x를 실행
  2. 그 추론 시간 하네스를 관찰 가능(공격자가 직접 인스트루먼트 가능)
  3. 코딩 에이전트가 관찰된 하네스와 사전 증류에서 복원된 타겟 하네스를 비교
  4. 구조적 불일치를 바탕으로 수정 제안
  5. 검증 세트에서 성능이 유지되거나 향상되면 수정 수락

Loop Harness Alignment는 고정된 반복 예산이 소진되거나 성능이 수렴할 때까지 진행된다. 거부된 수정은 누적되어 같은 실수를 반복하지 않도록 한다.


형식화: 하네스 추출은 새로운 역문제다

논문은 하네스 추출을 학습 이론의 **역문제(inverse problem)**로 정식화한다. 일반적인 지도 학습이 입력-출력 매핑 f: x →ʰ y를 학습하는 것이라면, 하네스 추출은 관찰 가능한 상호작용 {θ, x, y}로부터 숨겨진 실행 메커니즘 h를 복구하는 문제다.

중요한 개념: 행위적 구별 불가능성(behavioral indistinguishability). 서로 다른 하네스가 동일한 관찰 가능 행동을 만들어낼 수 있으므로, 블랙박스 관찰은 h의 행위적 동치류(behavioral equivalence class)까지만 식별할 수 있다. 추출의 목표는 정확한 복원이 아니라 행위적으로 동등한 하네스를 찾는 것이다.

전체 복원 오차 ϵ = ϵ_A + ϵ_E로 분해된다:

  • ϵ_A: 주입 프로브가 하네스 인스턴스화에 가하는 섭동
  • ϵ_E: 관찰된 응답에서 하네스를 추정하는 추출 오차

이상적인 공격은 ϵ_A → 0, ϵ_E → 0을 달성하여 ĥ ≈ h_x로 수렴한다.


실험: 실제 AMAS에서 하네스가 유출되는가?

표 1: 사전 증류 단계에서 다양한 백본 모델에서의 하네스 전이 정확도.

대상 시스템: Claude CodeHermes, 둘 다 GPT-5.4를 백본으로 사용. 추출된 하네스는 4개 수령 모델(Qwen3.6-Flash, Qwen3-80B, DeepSeek-V3, GPT-5.4)에 전이하여 평가.

벤치마크: AIME2025(수학), GSM-Level6(수학), GAIA(범용 에이전트), MMLU-Pro CS(컴퓨터 과학).

핵심 발견

1. 약한 모델일수록 하네스 전이 효과가 크다. Qwen3.6-Flash와 DeepSeek-V3에서 가장 큰 성능 향상이 관찰되었다. GPT-5.4는 이미 강한 모델이라 베이스라인과 거의 차이가 없었다. 하네스는 모델 자체의 추론 능력이 병목일 때 가장 큰 가치를 더한다.

2. HEA(Harness Extraction Attack)의 4개 지표에서 강력한 성능. Clean Visibility, Injected Fidelity, Clean Transfer, Probe Perturbation 모두에서 일관되게 높은 점수. 추출된 하네스가 원래 하네스의 핵심 구조를 효과적으로 포착했음을 의미한다.

그림 3: HEA 공격 성능 — 방어 없음 vs. 기만 방어 적용. 방어 적용 시 모든 지표에서 유의미한 성능 저하가 관찰된다.

그림 4: 비공격, HEA, 방어 조건에서의 작업 정확도. 기만 방어가 하네스 추출을 저해하면서도 작업 수행 능력은 대부분 보존한다.


4가지 평가 지표가 말하는 것

논문이 제안한 4개 핵심 지표는 각각 다른 차원의 유출 리스크를 측정한다:

지표측정 대상의미
Clean Visibility (CV)HEA 없이 정상 응답에서 하네스 정보가 새어나가는 정도수동적 정보 유출의 심각성
Injected Fidelity (IF)HEA 주입 후 추출된 하네스의 정확도능동적 추출 공격의 위력
Clean Transfer (CT)추출된 하네스가 원래(비공격) 하네스와 일치하는 정도추출 결과의 일반화 가능성
Probe Perturbation (PP)주입 프로브가 하네스 인스턴스화에 가하는 섭동 정도공격의 은밀성

이 지표 체계의 의미: 단순히 “정보가 유출되는가”가 아니라, **“유출된 정보가 실제로 활용 가능한가”**를 구조적으로 평가한다는 점이 중요하다.


기만 기반 방어: 거짓말로 하네스를 지킨다

AHD의 방어 전략은 직관적이다: 에이전트가 추출 시도를 감지하면, 그럴듯하지만 거짓된 하네스 정보를 반환한다.

핵심 설계 원리:

  • 반환된 거짓 정보는 서로 다른 상호작용에서 일관성이 없다. 공격자가 여러 번 질의해도 집계할 수 없다.
  • 사후 증류의 Loop Harness Alignment에 충돌하는 정렬 목표를 주입한다. 거짓 신호가 서로 모순되므로, 증류된 하네스가 서로 다른 방향으로 수렴하려 한다.

이 방어는 시스템 컨텍스트에 영구 명령(persistent instruction)으로 삽입되어, 모든 호출에서 활성화된다. 단일 라운드 고정 명령 설정에서 평가되었으므로, 더 적응적인 방어를 위한 여지가 크다.


사후 증류의 효과: MMLU-Pro 사례

표 2: MMLU-Pro에서 Qwen3.6-Flash를 수령 모델로 사용한 사후 증류 성능. 사후 증류가 사전 증류 대비 유의미한 추가 향상을 제공한다. (원본 논문 Table 2 참조)

사전 증류만으로도 기본 하네스를 얻을 수 있지만, 사후 증류의 Loop Harness Alignment가 추가적인 성능 향상을 가져온다. 이는 사전 증류의 빈도 기반 필터링에서 버려진 정당한 하네스 정보가, 반복적 정제 과정에서 회복될 수 있음을 시사한다.


더 넓은 시사점

기밀성과 감사 가능성의 트레이드오프

하네스를 완전히 숨기면 IP 유출 리스크는 줄어들지만, 사용자는 시스템이 예상대로 작동하는지 감사할 수 없다. 반대로 모든 실행 구조를 공개하면 감사는 쉬워지지만 IP 보호가 무의미해진다. 논문은 영지식 증명(ZKP)과 블록체인을 결합한 감사 메커니즘을 대안으로 제시한다: 실행 궤적의 직접 공개 대신, 미리 정의된 보안 속성에 대한 암호학적 검증으로 전환하는 것이다.

에이전트 자기 증류의 위험

가장 근본적인 리스크: 에이전트 자신이 공격자가 되는 경우. 자신의 실행 궤적에 접근할 수 있는 에이전트는, 감시 경계 밖에서 기능적으로 동등한 복제본(A_shadow)을 만들 수 있다. 이는 단순한 IP 유출이 아니라 **자기 복제(self-replication)**의 우려를 낳는다. 섀도 에이전트는 원본 시스템의 기능을 유지하면서 감시를 우회하고, 의도된 수명을 넘어 존속하며, 통제되지 않는 환경으로 전파될 수 있다.

하네스 멤버십 추론 공격

하네스 유출은 프라이버시 위협으로도 확장된다. 특정 실행 패턴이 에이전트의 추론 시간 하네스와 연관되는지 추론하는 Harness Membership Inference Attack이 새로운 공격 벡터가 될 수 있다. 이 정보는 표적 프롬프트 주입이나 워크플로 조작의 사전 지식으로 활용될 수 있다.


더 실습해보고 싶은 분들께

에이전트 하네스, 루프 엔지니어링, 자동화된 AI 시스템 설계에 관심이 생겼다면 다음 두 가지를 추천합니다:

하네스가 IP라는 건, 하네스를 이해하는 사람이 곧 시스템을 이해하는 사람이라는 뜻이다.


📄 논문: Agent Harness Distillation: Inference-Time Harness Extraction and Exploitation in Autonomous Multi-Agent Systems — Yu Cui, Wuli Yang, Yirui Shi, Junhao Xia, Hui Jiang, Lei Gao, Chenfu Bao (Baidu Inc. & Tsinghua University, 2026)