코난쌤 블로그
Search
검색
다크 모드
라이트 모드
탐색기
홈
전체 글
카테고리
소개
연락처
개인정보처리방침
태그: GRPO
3건의 항목
2026년 7월 19일
GRASP: 강화학습으로 에이전트 RAG의 검색 도구를 자유자재로 다루게 만드는 방법
agentic-rag
reinforcement-learning
retrieval-augmented-generation
LLM-agent
tool-use
multi-hop-reasoning
GRPO
search-policy
2026년 7월 18일
LongStraw: 200만 토큰 컨텍스트 RL 포스트트레이닝을 고정 GPU 예산에서 가능하게 하는 시스템
LLM
Agent
RL
Long-Context
Infrastructure
GRPO
2026년 7월 17일
UniVR: 텍스트 없이 시각 공간에서 직접 추론하는 AI - Visual Reasoning GRPO의 등장
AI
visual-reasoning
reinforcement-learning
GRPO
world-model
agent