코난쌤 블로그
Search
검색
다크 모드
라이트 모드
탐색기
홈
전체 글
카테고리
소개
연락처
개인정보처리방침
태그: agentic-RL
6건의 항목
2026년 8월 14일
EFCA: 환경 피드백만으로 턴별 크레딧을 만드는 에이전트 RL
agent
reinforcement-learning
credit-assignment
LLM
agentic-RL
loop
2026년 8월 07일
AgentOPSD: Agentic RL을 위한 재귀적 자기증류 턴별 크레딧 할당
agent
reinforcement-learning
LLM
credit-assignment
self-distillation
GRPO
Bayesian
turn-level
agentic-RL
loop
2026년 8월 05일
PCSD: 에이전트 RL에서 교사 신호를 토큰별로 신뢰하는 방법
agent
reinforcement-learning
LLM
self-distillation
agentic-RL
credit-assignment
GRPO
loop
2026년 8월 04일
TAPO: 에이전트 RL에 전이 감독을 끼워넣는 가장 싼 방법
agent
reinforcement-learning
LLM
post-training
transition-supervision
policy-optimization
agentic-RL
loop
2026년 7월 31일
SkillRise: 에이전트가 경험에서 스킬을 뽑아 다음 태스크에 쓴다 — 단일 정책으로 cross-task 스킬 진화
agent
reinforcement-learning
skill-learning
LLM
agentic-RL
cross-task
2026년 7월 11일
GLM-5.2를 만든 비동기 강화학습 — SAO(Single-Rollout Asynchronous Optimization) 완전 해부
reinforcement-learning
LLM
agentic-RL
GLM
asynchronous-training
SAO