← Back to feed
Papers·2개월 전

RLVR + Multi-Token Prediction 결합 재조명 — OCC 로 성능 저하 없이 공동 학습

RLVR + Multi-Token Prediction 결합 재조명 — OCC 로 성능 저하 없이 공동 학습

RLVR(Reinforcement Learning from Verifiable Rewards)과 Multi-Token Prediction(MTP)을 공동 학습하면 성능이 떨어지는 문제를 최적화 관점에서 분석, 원인을 분해하고 Optimal Coefficient Calibration(OCC)을 제안했습니다. OCC는 log-probability proxy로 최적 계수를 실시간 추적해 6개 수학 추론 벤치마크에서 Detach baseline과 동등 이상의 성능을 냅니다.

RLVR과 MTP를 함께 학습하면 성능이 떨어지는 현상을 최적화 관점에서 분석하고, OCC로 해결한 연구입니다.

핵심 결론

  • 벤치6개 경쟁 수준 수학 추론 벤치마크에서 Detach baseline과 동등 이상 성능.
  • 방식MTP gradient를 분리하지 않고 공동 학습하며, OCC가 성능 저하를 막습니다.

방법

  • 분해MTP의 RL objective에 대한 per-step 효과를 1차 상관항과 2차 섭동 패널티로 분해.
  • OCClog-probability proxy로 최적 계수를 온라인 추적, negligible cost로 적용.
  • Policy loss는 상관항이 감소하고 2차 패널티가 남아 성능 저하를 설명합니다.

한계·조건

  • 범위수학 추론 태스크에 국한, 다른 도메인 일반화는 추가 검증 필요.
  • 코드Hugging Face에 공개 — 재현 가능.

편집자 한 줄

MTP와 RLVR의 결합이 왜 실패하는지 명확히 분석한 점이 인상적입니다. OCC가 간단하면서도 효과적이네요.

  • #rlvr
  • #multi-token-prediction
  • #optimization
  • #occ
  • #reasoning
Zili Wang
원문 보기 →

Comments

— 첫 댓글을 남겨보세요 —