Papers·2개월 전
Alibaba, 정보 병목 이론으로 RL 탐색-활용 균형 잡는 IB-TPO — GRPO 대비 2.9~3.6% 향상

Alibaba 팀이 정보 병목(Information Bottleneck) 이론을 기반으로 LLM 온라인 RL의 탐색-활용 균형을 평가하는 IB-Score를 제안하고, 이를 최적화 목표로 삼은 IB-TPO 프레임워크를 공개했습니다. GRPO 대비 2.9~3.6% 성능 향상을 보였으며, 동일 토큰 예산에서 50% 더 많은 궤적을 샘플링할 수 있는 IB-guided tree sampling이 핵심입니다. 단, 벤치마크가 수학·추론 태스크에 집중되어 있어 일반화 가능성은 추가 검증이 필요합니다.
Alibaba 팀이 온라인 RL의 탐색-활용 불균형 문제를 정보 병합 이론으로 해결하는 IB-TPO를 제안했습니다.
핵심 결론
- 성능 — GRPO baseline 대비 2.9~3.6% 향상, 기타 SOTA 온라인 RL 방법들도 능가.
- 샘플링 효율 — 동일 토큰 예산에서 50% 더 많은 궤적을 생성하는 tree sampling 전략.
방법
- IB-Score — 정보 병합 이론으로 단계별 추론 다양성과 정답과의 상호 정보량 간 트레이드오프를 정량화.
- 기존 GRPO 등이 훈련 중 균형을 유지하지 못함을 IB-Score 분석으로 확인.
- IB-TPO — IB-Score를 세밀한 최적화 목표로 삼고, IB-guided tree sampling으로 샘플링 효율과 MC 추정을 동시에 개선.
한계·조건
- 벤치마크 — 수학·추론 태스크 위주로 평가되어, 일반 대화나 생성 태스크에서의 효과는 미검증.
- 코드 — GitHub 공개 (https://github.com/alibaba/EfficientRL).
편집자 한 줄
정보 병합 이론을 RL 최적화에 직접 연결한 점이 신선합니다. 다만 벤치마크 편중이 있어 다른 도메인에서도 통할지 지켜볼 만합니다.
- #reinforcement-learning
- #information-bottleneck
- #llm
- #alibaba
- #reasoning
alibaba-inc