핵심 요약

AutoSaddler(arXiv 2608.23041, Microsoft/POSTECH/KAIST, 2026)는 LLM 에이전트의 하네스(프롬프트, 도구, 미들웨어) 최적화를 실패 실행 트레이스 기반의 오프라인 학습 문제로 정의한 연구이다. GAIA2에서 +9.0%p, SWE-Bench Pro에서 +9.6%p, Terminal-Bench 2.0에서 +10.0%p의 Pass@1 향상을 보고했다.

또한 최고 개발 성적 도달에 소요된 롤아웃은 147개였다.

항목
GAIA2 Pass@1 향상+9.0%p
SWE-Bench Pro 향상+9.6%p
Terminal-Bench 2.0 향상+10.0%p
최고 성적 도달 롤아웃 수147
비교 기법 최고 성적64.6%, 61.5% (약 2,800 실행)

문제 정의

하네스는 에이전트의 성능에 큰 영향을 주지만 지금까지 최적화는 대부분 수작업이었다. 본 논문은 하네스 최적화를 미니배치 기반 오프라인 학습으로 재정식화하고, 반복적으로 실패 신호를 하네스 업데이트에 반영한다.

방법론

제안 방식은 세 구성요소로 이루어진다.

AutoSaddler 파이프라인

  1. 증거 기반 진단(evidence-grounded diagnosis): 실패 트레이스로부터 원인을 근거와 함께 특정한다.
  2. 구조화된 패치 생성(structured patching): 하네스를 코드로 취급하여 국소적 수정을 생성한다.
  3. 일반화 인지 선택(generalization-aware selection): 검증을 통과한 패치만 하네스에 반영한다.

실험 결과

세 벤치마크에서 기본 하네스 대비 일관된 향상이 확인되었다.

메인 결과 비교

옵티마이저 비용(런타임, 금액, LLM 호출 수)은 테이블 13에 정리되어 있다.

옵티마이저 비용

어블레이션에 따르면 (1) 얕은 반성보다 깊은 디버깅, (2) 자유 수정보다 표적 수정, (3) 트레이지토리 수리보다 일반화 인지 선택이 각각 성능에 기여했다.

더 실습해보고 싶은 분들께

자주 묻는 질문

학습 대상은 모델 가중치입니까? 아니요. 프롬프트, 도구, 미들웨어로 구성된 하네스입니다.

온라인 RL과의 차이는 무엇입니까? 수집된 실패 트레이스로 오프라인 학습하며, 147개 롤아웃으로 최고 성적에 도달했습니다.

공개 자료는 어디에서 확인할 수 있습니까? arXiv 2608.23041 및 프로젝트 페이지(aka.ms/AutoSaddler-website)에서 확인할 수 있습니다.

참고 자료