결론 먼저
LLM 에이전트 팀에 ‘경험 메모리’ 대신 ‘스킬 라이브러리’를 달아주고 그걸 계속 최적화하면 어떻게 되는가. EMNLP 2026 Findings에 실린 MASkills 논문의 답은 이렇다. HotpotQA F1 69.2 → 76.3, LoCoMo 멀티홉 F1 12.04 → 17.22, GAIA 평균 20.4% → 23.3%.
9월 2일 arXiv에 올라온 논문입니다 — arXiv 2609.02094, 코드는 GitHub에 공개됐습니다.
핵심 요약 표
| 항목 | 값 |
|---|---|
| HotpotQA F1 | MultiPersona 69.2 → MASkills 76.3 |
| LoCoMo 멀티홉 F1 | 베이스 12.04 → 17.22 |
| GAIA 평균 | R1-Searcher 20.4% → MASkills 23.3% |
| 최대 기여 모듈 | 검증 롤백 (validation rollback) |
| 옵티마이저 / 액터 | GPT-5.1 / GPT-4o-mini, Qwen2.5-7B |
기준일: 2026-09-08 기준 arXiv v1 수치입니다.
스킬을 최적화 단위로 쓰는 이유
기존 자기반성 방식의 문제는 명확하다. 쌓아둔 메모리는 호출이 어렵고, 정제되지 않고, 스케일도 안 된다. MASkills는 다른 단위를 고른다 — 언제, 어떻게, 무엇으로 행동할지 명세한 구조화된 절차 지식, 즉 스킬.
파이프라인 구조

Figure 1. 스킬 공간 정책 최적화. (출처: arXiv 2609.02094 Figure 1)
액터들이 스킬을 실행해 트라젝토리를 만든다. 어느 스킬이 공헌했는지 언어 크레딧이 매겨지고 모멘텀로 평활화된다. 그리고 스킬 라이브러리가 다듬어진다 — refinement, induction, consolidation, pruning.
벤치마크별 결과

Table 1. 3개 벤치마크 주요 결과. (출처: arXiv 2609.02094 Table 1)
셋 다 이겼다. 특히 LoCoMo 멀티홉은 상대 개선 43%. 반면 GAIA L3(최상위 난이도)에서는 여전히 0%라는 점이 정직하다.

Figure 2. 검증 기반 스킬 갱신 곡선. (출처: arXiv 2609.02094 Figure 2)
절제 실험 결과
검증 롤백을 빼면 LoCoMo-MH가 17.2 → 6.6으로 무너진다. LLM 비평 기반 자기수정은 되돌림 장치 없이는 붕괴한다 — 하네스 설계자가 아려야 할 문장이다. 스킬 크레딧 어사인먼트 제거도 GAIA에서 6.2%p 하락을 만든다.
| 구성 | LoCoMo-MH | GAIA |
|---|---|---|
| MASkills (Full) | 17.2 | 23.3 |
| w/o 스킬 크레딧 어사인먼트 | 14.2 | 17.1 |
| w/o 모멘텀 평활화 | 16.4 | 21.9 |
| w/o 검증 롤백 | 6.6 | 13.5 |
| w/o 통합/가지치기 | 13.9 | 13.0 |

Table 2. 절제 실험. (출처: arXiv 2609.02094 Table 2)
스킬 전이 결과

Figure 3. 스킬 품질 비교와 크로스태스크 전이. (출처: arXiv 2609.02094 Figure 3)
프롬프트로 한 번 뽑은 스킬은 노스킬과 별 차이가 없다. 계속 최적화된 스킬만 격차를 벌린다. 게다가 GAIA에서 배운 스킬을 HotpotQA에 그대로 옮겨도 CoT보다 높다. 추가 최적화 없는 제로샷 이식으로도 전이 효과가 확인됐다는 게 핵심 관찰이다.
토폴로지와 백본 범위
중앙집중·분산·계층 어느 구조에서나 경쟁력을 유지한다. 최적 토폴로지는 태스크 따라 다르다 — 탐색 다양성이 필요하면 분산, 전역 메모리 일관성이 필요하면 중앙집중. 액터가 GPT-4o-mini와 Qwen2.5-7B라는 점도 주목할 만하다. 프론티어 모델이 아닌 액터로도 스킬 최적화 이득이 살아난다.

Figure 4. 백본별 비교. (출처: arXiv 2609.02094 Figure 4)
더 실습해보고 싶은 분들께
자주 묻는 질문
MASkills는 어떻게 멀티에이전트를 최적화하나요?
각 에이전트의 자연어 스킬 라이브러리를 refinement/induction/consolidation/pruning으로 갱신합니다. 수정 후보는 검증 셋 통과 시에만 커밋됩니다.
대표 성능 수치는?
HotpotQA F1 76.3, LoCoMo 멀티홉 F1 17.22, GAIA 평균 23.3%입니다.
가장 중요한 구성요소는?
검증 롤백입니다. 제거 시 LoCoMo 멀티홉 F1이 17.2 → 6.6으로 붕괴합니다.
어떤 모델로 실험했나요?
옵티마이저 GPT-5.1, 액터 GPT-4o-mini와 Qwen2.5-7B입니다.
출처
- arXiv 2609.02094 (EMNLP 2026 Findings) — PDF / HTML / DOI
- 코드: github.com/DaRL-GenAI/MASkills
- Figure 1–4, Table 1–2는 원문 caption crop.