← Back to feed
News·1개월 전

RLVR 가중치 업데이트, SFT와 질적으로 다르다 — 소규모 서브네트워크만 변경

RLVR 가중치 업데이트, SFT와 질적으로 다르다 — 소규모 서브네트워크만 변경

LessWrong 에 게시된 MATS 9.1 산출물로, RLVR(Reinforcement Learning from Verifiable Rewards) 업데이트가 SFT(Supervised Fine-Tuning)와 질적으로 다르다는 연구들을 정리했습니다. 주요 발견: RLVR 은 principal subspace 회전이 5도 내외로 SFT(50도)보다 훨씬 작고, 업데이트의 80%가 sparse 하며(SFT는 20%), rank-1 subspace 에서 일관되게 일어나 몇 개 체크포인트만으로 최종 모델을 예측할 수 있습니다. 'emergent misalignment' 및 'subliminal learning' 과의 연관성도 추론합니다.

RLVR 이 LLM 가중치에 미치는 영향이 SFT와 근본적으로 다르다는 일련의 논문을 소개합니다.

골자

  • 핵심 차이RLVR 업데이트는 principal subspace 회전이 약 5도로 SFT(50도)보다 훨씬 작습니다.
  • 희소성RLVR 업데이트의 약 80%가 sparse 한 반면, SFT는 20% 수준입니다.
  • 저랭크RLVR 업데이트는 rank-1 subspace 에서 일어나며, 초기 체크포인트만으로 최종 모델을 예측 가능합니다.

배경·맥락

  • 이 결과들은 RLVR 이 LLM 의 행동을 'propensity(성향)'는 바꾸지만 'lability(가소성)'는 바꾸지 않는다는 가설을 지지합니다.
  • 저자는 'emergent misalignment' 및 'subliminal learning' 현상과의 연결 가능성을 제기합니다.

참고 자료

  • 주요 논문'The Path Not Taken: RLVR Provably Learns Off the Principals', 'Reinforcement Learning Finetunes Small Subnetworks in Large Language Models', 'LoRA Without Regret', 'On Predictability of Reinforcement Learning Dynamics for Large Language Models' 등이 인용되었습니다.
  • 추가 자료Bycloud 의 유튜브 영상 'The LLM's RL Revelation We Didn't See Coming' 및 'The RL Irony in LLMs' 에서 대부분의 논문을 접했다고 합니다.

편집자 한 줄

RLVR 의 sparse·저랭크 특성은 파인튜닝 효율성과 해석 가능성에 중요한 시사점을 주지만, 아직 초기 연구 단계입니다.

  • #rlvr
  • #sft
  • #reinforcement-learning
  • #llm
  • #alignment
LessWrong
원문 보기 →

Comments

— 첫 댓글을 남겨보세요 —