논문: Agora: Enhancing LLM Agent Reasoning Via Auction-Based Task Allocation 저자: Kaiji Zhou, Ales Leonardis, Yue Feng (University of Birmingham) 공개일: 2026년 7월 10일
핵심 아이디어
복잡한 추론 작업을 한 개의 LLM이 모두 처리하는 것은 비효율적입니다. 각 단계마다 가장 적합한 전문 모델이 다를 수 있기 때문입니다. Agora는 이 문제를 경매 메커니즘(auction mechanism) 으로 해결합니다.
핵심 발상은 단순합니다: 추론 체인의 각 단계를 ‘거래 가능한 항목’ 으로 취급하고, 여러 에이전트가 입찰(bid) 하게 만드는 것입니다. 신뢰도가 보정된 입찰 시스템을 통해, 가장 자신만만한 에이전트가 아니라 실제로 가장 유능한 에이전트가 작업을 따냅니다.

Figure 1: Agora의 전체 파이프라인. Planner가 복잡한 쿼리를 작업 단위로 분해하고, 각 단위는 보정된 신뢰도 기반 경매를 통해 최적의 에이전트에게 할당됩니다.
작동 방식
Agora는 5단계 폐루프 파이프라인으로 구성됩니다:
1. Planning (계획)
LLM Planner가 입력 쿼리를 방향성 작업 그래프(directed task graph)로 분해합니다. 각 노드는 원자적 단계이며, 밀접하게 결합된 노드들은 ‘작업 단위(task unit)‘로 병합됩니다. 최대 4단계로 제한하여 cascading failure를 방지합니다.
2. Calibration (보정)
경매의 공정성은 에이전트의 자기 평가 신뢰도에 달려 있습니다. 하지만 LLM은 종종 환각적 확신(hallucinated certainty) 을 보입니다 — 틀린 답에 대해 높은 확신을 보고합니다.
Agora는 2단계 계층적 보정을 사용합니다:
- 정적 보정기(S): 다양한 벤치마크(수학, 코딩, 멀티모달)로 사전 학습된 그룹별 스케일링 + 히스토그램 빈ning. KD-tree 임베딩 클러스터링으로 unseen 태스크에도 일반화
- 동적 보정기(S′): 온라인 경사하강법으로 분포 변화에 실시간 적응. β와 α 파라미터를 지속 업데이트
3. Auction (경매)
각 작업 단위에 대해 에이전트들은 다음 공식으로 입찰가를 계산합니다:
- : 보정된 신뢰도
- : 오목한 멱변환 (고신뢰도 영역의 민감도 압축)
- : 비용 민감도 파라미터 (단일 노브로 비용-품질 제어)
- : 정규화된 비용 (토큰 가격 + 지연시간)
β 하나로 전체 시스템의 비용-품질 트레이드오프를 제어할 수 있다는 것이 Agora의 큰 장점입니다.
4. Execution (실행) & 5. Refinement (정제)
선정된 에이전트가 작업을 실행하고, 결과를 합성합니다. 선택적으로 피드백 루프가 동적 보정기를 업데이트합니다.
실험 결과
5개 벤치마크에서 검증했습니다:
| 벤치마크 | 주요 결과 |
|---|---|
| MuSiQue-Ans | EM 43.0 / F1 54.3 — 1NN Router(42.4/54.1) 및 모든 단일 모델 능가 |
| MMLU-Pro | 정확도 71.9% — 최고 단일 모델(68.1%) 대비 +3.8% |
| SciCode | Sub 44.4% — 최고 단일 모델과 동등 (분포 변화 한계) |
| SPIQA | L3 ≥0.8 정확도 56.9% — 최고 단일 모델(48.2%) 대비 +8.7% |
| MathVision | 55.3% — 보정 없이는 -4.0% 손실이 보정 후 +2.0% 개선 |

Figure 4: 비용 민감도 β가 MathVision에서 에이전트 할당에 미치는 영향. β가 증가하면 저비용 에이전트(Grok) 사용 비율이 21.5%에서 78.5%로 증가하며, 정확도는 55.26% → 51.06%로 점진적 감소.
보정의 핵심 역할
가장 흥미로운 발견은 경매 구조만으로는 부족하다는 것입니다. 보정 없는 경매는 오히려 성능이 저하됩니다:
| 설정 | MuSiQue F1 | MMLU-Pro | SPIQA (L3≥0.8) | MathVision |
|---|---|---|---|---|
| Vanilla | 44.1 | 68.1 | 48.2 | 53.3 |
| 경매 (보정 X) | 51.4 (+7.4) | 67.5 (-0.6) | 46.9 (-1.3) | 49.3 (-4.0) |
| 경매 (보정 O) | 54.3 (+10.2) | 71.9 (+2.9) | 56.9 (+8.7) | 55.3 (+2.0) |
보정이 없으면 과신하는 에이전트가 입찰에서 이겨 작업을 가져가고, 추론 체인이 붕괴합니다. Agora의 계층적 보정이 이 “Winner’s Curse”를 방지합니다.
기능적 상호보완성
SPIQA에서 가장 극적인 시너지가 나타납니다: Grok은 검색에 강하고(85.4% vs 67.3%), Qwen은 시각 추론에 강합니다(48.2% vs 43.4%). Agora는 이를 정확히 파악하여 검색 작업의 81.1%를 Grok에게, 어려운 추론 작업의 32%를 Qwen에게 할당합니다.
비용-품질 제어
β 파라미터 하나로 세 가지 운영 모드를 제공합니다:
- Quality-First (β=0.001): 정확도 최우선, 비용은 타이브레이커로만 사용
- Balanced (β=0.1): 성능과 비용의 균형
- Cost-Efficient (β=0.25): 비용 절감 최우선
같은 보정된 신뢰도 점수를 재사용하므로, 모드 전환에 재학습이 필요 없습니다.
의의와 한계
Agora는 메커니즘 디자인(mechanism design) 을 LLM 에이전트 조정에 적용한 사례입니다. 기존 Mixture-of-Experts가 토큰 수준의 라우팅이라면, Agora는 추론 단계(task-unit) 수준의 라우팅을 제공합니다. Plug-and-play 레이어로 기존 플래너나 에이전트 시스템 위에 얹을 수 있습니다.
한계도 명확합니다:
- 보정기의 도메인 일반화에 의존 (분포 변화 시 성능 저하)
- 계획 품질에 종속적
- 에이전트 간 기능적 상호보완성이 없으면 이득 제한
결론
Agora는 “추론 단계를 경매에 붙인다”는 단순한 아이디어를 강력한 보정 메커니즘과 결합하여, 다중 에이전트 추론에서 실질적인 성능 향상을 달성했습니다. β 하나로 비용-품질을 제어할 수 있다는 실용성과, 보정이 경매의 성패를 가른다는 통찰은 에이전트 오케스트레이션 연구에 중요한 방향성을 제시합니다.