코난쌤 블로그

홈전체 글카테고리소개연락처개인정보처리방침

태그: Benchmark

4건의 항목

  • 2026년 7월 18일

    MCPEvol-Bench: AI 에이전트가 도구 변화에 얼마나 무력한가

    • LLM
    • Agent
    • MCP
    • Benchmark
    • Tool-Use
  • 2026년 7월 02일

    TUA-Bench: 터미널에서 만능 에이전트를 평가하다 — 120개 과제, 65.8%가 한계

    • LLM
    • AI-Agent
    • Benchmark
    • Terminal
    • CLI
    • Meta-AI
  • 2026년 6월 23일

    GateMem: 에이전트 메모리는 ‘기억력’이 아니라 거버넌스다

    • GateMem
    • MemoryAgent
    • AI-Agent
    • LLM
    • Benchmark
    • Privacy
  • 2026년 6월 06일

    딥 리서치 에이전트는 어디서 틀리는가? DRIFT: 스팬 수준 궤적 오류 국소화 프레임워크

    • AI-Agent
    • Deep-Research
    • Error-Localization
    • LLM
    • Benchmark
    • Auditing

Created with Quartz v4.5.2 © 2026

  • 소개
  • 연락처
  • 개인정보처리방침
  • 전체 글