코난쌤 블로그

홈전체 글카테고리소개연락처개인정보처리방침

태그: utility-learning

1건의 항목

  • 2026년 8월 09일

    RoMeRL: 에이전트 메모리가 보상 함정에 빠질 때 — 차원을 고정하는 RL

    • agent
    • memory
    • reinforcement-learning
    • LLM
    • self-evolving
    • reward-hacking
    • utility-learning

Created with Quartz v4.5.2 © 2026

  • 소개
  • 연락처
  • 개인정보처리방침
  • 전체 글