Paper: SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration Authors: Junjie Gao, Zhengxian Wu, Jiaming Fan, Jin Zhang, Shihan Ma, Yao Yao, Weiran Qi, Chuyan Jin, Guiyu Ma, Xingzhong Xu, Kai Yang, Ji-Rong Wen, Zhicheng Dou (Renmin University of China & Ant Group) Code: github.com/antins-labs/SearchOS
핵심 문제: 검색 에이전트는 왜 실패하는가
LLM 기반 검색 에이전트는 반복적으로 검색·추론·증거 수집을 수행하며, 최종 답변을 생성한다. 하지만 작업이 길어질수록 근본적인 한계에 부딪힌다:
- 상태 추적 상실: 대화 이력이 길어지면 에이전트가 무엇을 이미 찾았고, 무엇이 아직 미해결인지 추적하지 못한다.
- 반복 루프: 검색이 실패했을 때 같은 쿼리를 반복하거나 막다른 길을 계속 탐색한다.
- 다중 에이전트 중복: 단순히 에이전트를 늘리면 병렬 워커가 동일한 작업을 중복하거나, 가장 느린 작업을 기다리며 유휴 상태가 발생한다.
근본 원인은 명확하다 — 계획, 증거, 실패 기록이 ‘대화 내용’이라는 휘발성 매체에만 존재한다는 점이다. SearchOS는 이를 시스템이 관리하는 명시적 상태로 외부화한다.

SearchOS의 4대 설계 축
1. 관계형 스키마 완성 (Relational Schema Completion)
SearchOS는 정보 탐색을 관계형 데이터베이스 스키마 완성 문제로 정식화한다. 사용자 요청이 들어오면 시스템은 엔티티 테이블을 구성하고, 각 속성을 채우며, 모든 값에 대해 출처 URL과 발췌문을 인용 매트릭스로 관리한다.
입력: "2024년 노벨물리학상 수상자들의 주요 연구 업적은?"
→ 스키마: {수상자 테이블, 업적 테이블(수상자 FK)}
→ 각 셀은 반드시 출처 증거와 연결
이 접근의 장점은 진행 상황이 측정 가능해진다는 점이다. 커버리지 맵을 통해 어떤 엔티티의 어떤 속성이 채워졌고, 무엇이 비어있는지 명확히 파악할 수 있다.
2. Search-Oriented Context Management (SOCM)
SearchOS의 핵심 혁신은 네 가지 외부 상태 구조를 도입한 것이다:

- Frontier Task (프론티어 태스크): 의존성을 고려한 작업 큐. 각 태스크는 우선순위, 상태, 의존성, 타겟 셀, 시도 횟수를 가진다. 중복 작업은 자동으로 거부된다.
- Evidence Graph (증거 그래프): 페이지 수준 요약이 아닌 원자 단위 증거 노드를 저장. 각 노드는 값, 출처, 발췌문, 스키마 바인딩, 신뢰도, 출처 등급을 기록한다. 노드 간 관계는 Support, Conflict, Refine 세 가지.
- Coverage Map (커버리지 맵): 스키마의 모든 셀에 대해 missing / filled / uncertain / unreachable 상태를 추적. 여러 증거가 있으면 출처 등급과 신뢰도로 최적값을 선택한다.
- Failure Memory (실패 메모리): 검색 실패 패턴을 공유 메모리에 저장. 한 에이전트가 시도한 막다른 경로를 다른 에이전트가 반복하지 않도록 한다.
SOCM의 중요한 설계 원칙은 **역할별 투영(role-specific projection)**이다. 오케스트레이터는 전역 커버리지를, 검색 에이전트는 할당된 셀만, 작성자는 요약만 본다. 각 에이전트는 최신 상태의 자신에게 필요한 부분만 수신한다.
3. 파이프라인 병렬 오케스트레이션
기존 다중 에이전트 시스템은 동기식 배치(batch)로 동작한다 — 모든 워커가 완료될 때까지 다음 라운드를 시작하지 않는다. 이는 가장 느린 워커가 전체 지연을 결정하는 “straggler problem”을 야기한다.
SearchOS는 GPU 파이프라인 병렬처럼 이벤트 기반 연속 디스패치를 적용한다:

- 한 에이전트가 작업을 완료하면 SOCM을 업데이트하고, 즉시 해결되지 않은 다음 스키마 갭을 할당받는다.
- 역할 간 의존성이 허용하는 한 서로 다른 역할이 동시에 진행된다.
- 이 방식은 GPU 트레이닝의 파이프라인 병렬(Huang et al., 2019)과 동일한 활용도 이점을 가져온다.
4. 검색 도구 미들웨어 하네스 (Search Tool Middleware Harness)
가장 독특한 설계 결정은 에이전트 프롬프트가 아닌 시스템 수준에서 실행을 제어한다는 점이다. 미들웨어는 세 가지 인터페이스에서 동작한다:
| 단계 | 컴포넌트 | 역할 |
|---|---|---|
| 추론 전 | Context Middleware | SOCM 상태를 역할별로 투영하여 주입 |
| 도구 실행 후 | Evidence Middleware | 관찰에서 증거를 추출·그라운딩하여 Evidence Graph에 커밋 |
| 상태 업데이트 후 | Sensor | 반복·정지·예산 초과를 감지하고 continue/correct/stop 액션 반환 |
이 설계의 핵심 통찰은 프롬프트 수준 안전장치는 이기종 post-trained 모델에서 신뢰할 수 없다는 것이다. 시스템 수준 인터셉션이 아니면 예산 초과, 반복 루프, 증거 누락을 일관되게 막을 수 없다.
계층적 스킬 시스템
SearchOS는 전략 스킬(strategy skills)과 접근 스킬(access skills)을 분리한다:
- 전략 스킬: 검색 쿼리를 어떻게 분해하고, 키워드를 어떻게 가중치 부여할지 등 “어떻게 검색할 것인가”에 대한 재사용 가능한 지식
- 접근 스킬: 특정 사이트(예: Wikipedia, GitHub)에서 정보를 어떻게 추출할지에 대한 사이트별 접근 절차
스킬은 성공/실패 궤적에서 정제되며, 세션 간에 재사용된다. 이는 매 세션마다 검색 패턴을 처음부터 발견하는 기존 방식과 대비된다.

실험 결과: WideSearch & GISA
SearchOS는 두 개의 장문 정보 탐색 벤치마크에서 평가되었다:
| 지표 | WideSearch | GISA |
|---|---|---|
| Item F1 | 80.3 (최고) | — |
| Set F1 | — | 76.5 (최고, 기존 최고 대비 +13.4pt) |
| 검색 호출 감소 | — | 스킬 사용 시 39.1% 감소 |
| 페이지 호출 감소 | — | 스킬 사용 시 42.7% 감소 |
| 세션 시간 감소 | — | 스킬 사용 시 36.6% 감소 |
핵심 발견:
- 품질과 효율성이 동시에 향상 — 스킬을 사용하면 탐색적 시행착오가 줄어들어 품질이 오르면서도 비용은 감소
- 파이프라인 병렬 스케줄링은 동기식 배치 대비 유휴 시간을 크게 줄임
- 실패 메모리가 없는 경우, 에이전트 그룹이 동일한 막다른 경로를 반복적으로 탐색하는 경향 확인


의의: 에이전트 실패를 “프롬프트 문제”에서 “시스템 문제”로
SearchOS의 가장 중요한 기여는 에이전트 신뢰성을 프롬프트 엔지니어링이 아닌 시스템 아키텍처로 접근한다는 점이다. 현재 많은 에이전트 시스템이 “더 나은 프롬프트”나 “더 강한 모델”로 실패를 해결하려 하지만, SearchOS는 다음을 보여준다:
- 상태 외부화: 대화 이력이 아닌 시스템이 상태를 관리할 때, 커버리지와 중복을 효과적으로 제어할 수 있다
- 미들웨어 제어: 모델-도구 경계에서의 인터셉션이 프롬프트 수준 안전장치보다 훨씬 신뢰할 수 있다
- 스킬 재사용: 검색 전략과 접근 패턴을 세션 간 축적하면 탐색 비용이 실질적으로 감소한다
이는 단순히 “또 다른 다중 에이전트 프레임워크”가 아니라, 에이전트 인프라를 데이터베이스 시스템처럼 설계하려는 시도로 읽을 수 있다. 관계형 스키마, 인용 매트릭스, 트랜잭션적 상태 업데이트 — 검색 에이전트의 신뢰성을 엔지니어링하는 새로운 패러다임이다.
한계: 현재 평가는 텍스트 기반 웹 검색에 한정되어 있으며, 멀티모달 확장과 더 다양한 도메인에서의 검증이 향후 과제로 남아있다. 또한 오케스트레이터의 스키마 설계 능력이 전체 성능에 큰 영향을 미치므로, 스키마 구축 자체의 견고성이 중요한 병목이 될 수 있다.