코난쌤 블로그
Search
검색
다크 모드
라이트 모드
탐색기
홈
전체 글
카테고리
소개
연락처
개인정보처리방침
태그: reasoning
8건의 항목
2026년 7월 27일
VPRM: 결괏값만 맞추는 RL을 넘어 — 추론 과정까지 검증 가능한 보상 모델
RLVR
process-supervision
reward-model
medical-ai
reasoning
LLM
systematic-review
risk-of-bias
2026년 7월 23일
GEAR: LLM이 긴 컨텍스트에서 '복사 붙여넣기'에 빠질 때 — 증거 기반 RL로 탈출시키는 법
LLM
long-context
reinforcement-learning
reasoning
agent
RLVR
2026년 7월 23일
Relay-Bench: GPT-5.5가 43%에 머문다 — 도메인 간 추론 체인이 드러내는 LLM의 진짜 한계
LLM
benchmark
reasoning
evaluation
agent
2026년 7월 21일
SOPHIA: LLM 추론 루프가 늪에 빠졌을 때 — 숨겨진 활성화 벡터로 탈출시키는 방법
LLM
reasoning
activation-steering
self-loop
inference
agent
interpretability
2026년 7월 17일
LLM 계획 능력은 하나가 아니다 — 조작적 추론과 구조적 열거의 비대칭적 스케일링
LLM
planning
IRT
agent
reasoning
benchmark
2026년 6월 04일
DarkForest: 에이전트끼리 덜 대화할수록 정답에 가까워진다
LLM
multi-agent
reasoning
paper-review
AI-benchmark
2026년 5월 28일
다크포레스트: 멀티에이전트 LLM에서 대화를 줄이고 정확도를 높이는 방법
ai
multi-agent
llm
reasoning
paper-review
2026년 4월 24일
DeepSeek-V4-Pro / Flash 공개 정리: 100만 토큰 컨텍스트와 벤치마크 결과
ai
deepseek
huggingface
llm
moe
long-context
reasoning
benchmark
open-source