코난쌤 블로그

홈전체 글카테고리소개연락처개인정보처리방침

태그: GRPO

3건의 항목

  • 2026년 7월 19일

    GRASP: 강화학습으로 에이전트 RAG의 검색 도구를 자유자재로 다루게 만드는 방법

    • agentic-rag
    • reinforcement-learning
    • retrieval-augmented-generation
    • LLM-agent
    • tool-use
    • multi-hop-reasoning
    • GRPO
    • search-policy
  • 2026년 7월 18일

    LongStraw: 200만 토큰 컨텍스트 RL 포스트트레이닝을 고정 GPU 예산에서 가능하게 하는 시스템

    • LLM
    • Agent
    • RL
    • Long-Context
    • Infrastructure
    • GRPO
  • 2026년 7월 17일

    UniVR: 텍스트 없이 시각 공간에서 직접 추론하는 AI - Visual Reasoning GRPO의 등장

    • AI
    • visual-reasoning
    • reinforcement-learning
    • GRPO
    • world-model
    • agent

Created with Quartz v4.5.2 © 2026

  • 소개
  • 연락처
  • 개인정보처리방침
  • 전체 글