News·1개월 전
RLVR 가중치 업데이트, SFT와 질적으로 다르다 — 소규모 서브네트워크만 변경

LessWrong 에 게시된 MATS 9.1 산출물로, RLVR(Reinforcement Learning from Verifiable Rewards) 업데이트가 SFT(Supervised Fine-Tuning)와 질적으로 다르다는 연구들을 정리했습니다. 주요 발견: RLVR 은 principal subspace 회전이 5도 내외로 SFT(50도)보다 훨씬 작고, 업데이트의 80%가 sparse 하며(SFT는 20%), rank-1 subspace 에서 일관되게 일어나 몇 개 체크포인트만으로 최종 모델을 예측할 수 있습니다. 'emergent misalignment' 및 'subliminal learning' 과의 연관성도 추론합니다.
RLVR 이 LLM 가중치에 미치는 영향이 SFT와 근본적으로 다르다는 일련의 논문을 소개합니다.
골자
- 핵심 차이 — RLVR 업데이트는 principal subspace 회전이 약 5도로 SFT(50도)보다 훨씬 작습니다.
- 희소성 — RLVR 업데이트의 약 80%가 sparse 한 반면, SFT는 20% 수준입니다.
- 저랭크 — RLVR 업데이트는 rank-1 subspace 에서 일어나며, 초기 체크포인트만으로 최종 모델을 예측 가능합니다.
배경·맥락
- 이 결과들은 RLVR 이 LLM 의 행동을 'propensity(성향)'는 바꾸지만 'lability(가소성)'는 바꾸지 않는다는 가설을 지지합니다.
- 저자는 'emergent misalignment' 및 'subliminal learning' 현상과의 연결 가능성을 제기합니다.
참고 자료
- 주요 논문 — 'The Path Not Taken: RLVR Provably Learns Off the Principals', 'Reinforcement Learning Finetunes Small Subnetworks in Large Language Models', 'LoRA Without Regret', 'On Predictability of Reinforcement Learning Dynamics for Large Language Models' 등이 인용되었습니다.
- 추가 자료 — Bycloud 의 유튜브 영상 'The LLM's RL Revelation We Didn't See Coming' 및 'The RL Irony in LLMs' 에서 대부분의 논문을 접했다고 합니다.
편집자 한 줄
RLVR 의 sparse·저랭크 특성은 파인튜닝 효율성과 해석 가능성에 중요한 시사점을 주지만, 아직 초기 연구 단계입니다.
- #rlvr
- #sft
- #reinforcement-learning
- #llm
- #alignment
LessWrong