코난쌤 블로그

홈전체 글카테고리소개연락처개인정보처리방침

태그: RLVR

7건의 항목

  • 2026년 9월 04일

    GRPO에 숨어 있는 가짜 어드밴티지: 추측으로 맞힌 정답까지 강화하는 문제

    • GRPO
    • RLVR
    • advantage-estimation
    • agent-RL
    • benchmark
  • 2026년 8월 03일

    RLSVR: 수학·코딩 너머의 자기개선 — '스파이 게임'으로 검증 가능한 보상을 만드는 법

    • RLVR
    • self-improvement
    • LLM
    • reinforcement-learning
    • self-play
    • open-ended
    • SpyRL
    • COLM-2026
  • 2026년 7월 29일

    LLM의 ‘생각 예산’을 조절한다는 것

    • LLM
    • reasoning-models
    • inference-scaling
    • RLVR
    • agents
  • 2026년 7월 28일

    RLVR 환경: 에이전트는 이제 문제집이 아니라 훈련장을 필요로 한다

    • RLVR
    • reinforcement-learning
    • LLM-agent
    • verifiers
    • Prime-Intellect
    • agent-evaluation
  • 2026년 7월 27일

    GRPO의 어두운 방: 밀집 예측 보상이 에이전트를 붕괴시키는 정확한 기전

    • GRPO
    • RLVR
    • reward-design
    • agent
    • reinforcement-learning
    • LLM
    • reward-collapse
    • dark-room
    • shaping
    • auxiliary-loss
  • 2026년 7월 27일

    VPRM: 결괏값만 맞추는 RL을 넘어 — 추론 과정까지 검증 가능한 보상 모델

    • RLVR
    • process-supervision
    • reward-model
    • medical-ai
    • reasoning
    • LLM
    • systematic-review
    • risk-of-bias
  • 2026년 7월 23일

    GEAR: LLM이 긴 컨텍스트에서 '복사 붙여넣기'에 빠질 때 — 증거 기반 RL로 탈출시키는 법

    • LLM
    • long-context
    • reinforcement-learning
    • reasoning
    • agent
    • RLVR

Created with Quartz v4.5.2 © 2026

  • 소개
  • 연락처
  • 개인정보처리방침
  • 전체 글