코난쌤 블로그
Search
검색
다크 모드
라이트 모드
탐색기
홈
전체 글
카테고리
소개
연락처
개인정보처리방침
태그: utility-learning
1건의 항목
2026년 8월 09일
RoMeRL: 에이전트 메모리가 보상 함정에 빠질 때 — 차원을 고정하는 RL
agent
memory
reinforcement-learning
LLM
self-evolving
reward-hacking
utility-learning