결론 먼저

LLM 에이전트 팀에 ‘경험 메모리’ 대신 ‘스킬 라이브러리’를 달아주고 그걸 계속 최적화하면 어떻게 되는가. EMNLP 2026 Findings에 실린 MASkills 논문의 답은 이렇다. HotpotQA F1 69.2 → 76.3, LoCoMo 멀티홉 F1 12.04 → 17.22, GAIA 평균 20.4% → 23.3%.

9월 2일 arXiv에 올라온 논문입니다 — arXiv 2609.02094, 코드는 GitHub에 공개됐습니다.

핵심 요약 표

항목
HotpotQA F1MultiPersona 69.2 → MASkills 76.3
LoCoMo 멀티홉 F1베이스 12.04 → 17.22
GAIA 평균R1-Searcher 20.4% → MASkills 23.3%
최대 기여 모듈검증 롤백 (validation rollback)
옵티마이저 / 액터GPT-5.1 / GPT-4o-mini, Qwen2.5-7B

기준일: 2026-09-08 기준 arXiv v1 수치입니다.

스킬을 최적화 단위로 쓰는 이유

기존 자기반성 방식의 문제는 명확하다. 쌓아둔 메모리는 호출이 어렵고, 정제되지 않고, 스케일도 안 된다. MASkills는 다른 단위를 고른다언제, 어떻게, 무엇으로 행동할지 명세한 구조화된 절차 지식, 즉 스킬.

파이프라인 구조

MASkills 파이프라인

Figure 1. 스킬 공간 정책 최적화. (출처: arXiv 2609.02094 Figure 1)

액터들이 스킬을 실행해 트라젝토리를 만든다. 어느 스킬이 공헌했는지 언어 크레딧이 매겨지고 모멘텀로 평활화된다. 그리고 스킬 라이브러리가 다듬어진다 — refinement, induction, consolidation, pruning.

벤치마크별 결과

주요 결과

Table 1. 3개 벤치마크 주요 결과. (출처: arXiv 2609.02094 Table 1)

셋 다 이겼다. 특히 LoCoMo 멀티홉은 상대 개선 43%. 반면 GAIA L3(최상위 난이도)에서는 여전히 0%라는 점이 정직하다.

학습 곡선

Figure 2. 검증 기반 스킬 갱신 곡선. (출처: arXiv 2609.02094 Figure 2)

절제 실험 결과

검증 롤백을 빼면 LoCoMo-MH가 17.2 → 6.6으로 무너진다. LLM 비평 기반 자기수정은 되돌림 장치 없이는 붕괴한다 — 하네스 설계자가 아려야 할 문장이다. 스킬 크레딧 어사인먼트 제거도 GAIA에서 6.2%p 하락을 만든다.

구성LoCoMo-MHGAIA
MASkills (Full)17.223.3
w/o 스킬 크레딧 어사인먼트14.217.1
w/o 모멘텀 평활화16.421.9
w/o 검증 롤백6.613.5
w/o 통합/가지치기13.913.0

절제 실험 표

Table 2. 절제 실험. (출처: arXiv 2609.02094 Table 2)

스킬 전이 결과

스킬 품질과 전이

Figure 3. 스킬 품질 비교와 크로스태스크 전이. (출처: arXiv 2609.02094 Figure 3)

프롬프트로 한 번 뽑은 스킬은 노스킬과 별 차이가 없다. 계속 최적화된 스킬만 격차를 벌린다. 게다가 GAIA에서 배운 스킬을 HotpotQA에 그대로 옮겨도 CoT보다 높다. 추가 최적화 없는 제로샷 이식으로도 전이 효과가 확인됐다는 게 핵심 관찰이다.

토폴로지와 백본 범위

중앙집중·분산·계층 어느 구조에서나 경쟁력을 유지한다. 최적 토폴로지는 태스크 따라 다르다 — 탐색 다양성이 필요하면 분산, 전역 메모리 일관성이 필요하면 중앙집중. 액터가 GPT-4o-mini와 Qwen2.5-7B라는 점도 주목할 만하다. 프론티어 모델이 아닌 액터로도 스킬 최적화 이득이 살아난다.

백본 비교

Figure 4. 백본별 비교. (출처: arXiv 2609.02094 Figure 4)

더 실습해보고 싶은 분들께

자주 묻는 질문

MASkills는 어떻게 멀티에이전트를 최적화하나요?

각 에이전트의 자연어 스킬 라이브러리를 refinement/induction/consolidation/pruning으로 갱신합니다. 수정 후보는 검증 셋 통과 시에만 커밋됩니다.

대표 성능 수치는?

HotpotQA F1 76.3, LoCoMo 멀티홉 F1 17.22, GAIA 평균 23.3%입니다.

가장 중요한 구성요소는?

검증 롤백입니다. 제거 시 LoCoMo 멀티홉 F1이 17.2 → 6.6으로 붕괴합니다.

어떤 모델로 실험했나요?

옵티마이저 GPT-5.1, 액터 GPT-4o-mini와 Qwen2.5-7B입니다.

출처