코난쌤 블로그
Search
검색
다크 모드
라이트 모드
탐색기
홈
전체 글
카테고리
소개
연락처
개인정보처리방침
태그: Benchmark
4건의 항목
2026년 7월 18일
MCPEvol-Bench: AI 에이전트가 도구 변화에 얼마나 무력한가
LLM
Agent
MCP
Benchmark
Tool-Use
2026년 7월 02일
TUA-Bench: 터미널에서 만능 에이전트를 평가하다 — 120개 과제, 65.8%가 한계
LLM
AI-Agent
Benchmark
Terminal
CLI
Meta-AI
2026년 6월 23일
GateMem: 에이전트 메모리는 ‘기억력’이 아니라 거버넌스다
GateMem
MemoryAgent
AI-Agent
LLM
Benchmark
Privacy
2026년 6월 06일
딥 리서치 에이전트는 어디서 틀리는가? DRIFT: 스팬 수준 궤적 오류 국소화 프레임워크
AI-Agent
Deep-Research
Error-Localization
LLM
Benchmark
Auditing