Papers·2개월 전
NVIDIA, Thinking-Acting Gap 해소하는 AXPO — 8B 모델이 32B Base 추월

NVIDIA 팀이 VLM의 추론-도구사용 간 구조적 비대칭(Thinking-Acting Gap)을 해결하는 RL 알고리즘 AXPO를 제안했습니다. 기존 GRPO에서는 도구 사용 시도가 30%에 불과하고, 시도해도 그룹 내 전원 실패 비율이 40%에 달해 학습 신호가 약해지는 문제가 있었습니다. AXPO는 전원 실패한 도구 사용 하위그룹에서 thinking prefix를 고정하고 도구 호출과 이후 생성을 재샘플링하여, Qwen3-VL-Thinking 8B 모델에서 SFT+GRPO 대비 평균 Pass@1 +1.8pp, Pass@4 +1.8pp 향상을 달성했으며, 8B 모델이 32B Base의 Pass@4를 4배 적은 파라미터로 넘겼습니다.
NVIDIA가 VLM의 추론과 도구 사용 사이 간극을 메우는 RL 알고리즘 AXPO를 발표했습니다.
핵심 결론
- 벤치 — 9개 멀티모달 벤치마크 평균, Qwen3-VL-Thinking 8B에서 SFT+AXPO가 SFT+GRPO 대비 Pass@1 +1.8pp, Pass@4 +1.8pp.
- 스케일 — 8B SFT+AXPO가 32B Base의 Pass@4를 4배 적은 파라미터로 능가.
방법
- 문제 — Thinking-Acting Gap: 추론은 저변이 기본, 도구 사용은 고변이 보조 — GRPO 하에서 도구 사용 시도 30%, 전원 실패 40%.
- AXPO — 전원 실패한 도구 사용 하위그룹에서 thinking prefix를 고정하고 도구 호출과 이후 생성을 재샘플링, 불확실성 기반 prefix 선택.
한계·조건
- 환경 — Qwen3-VL-Thinking 계열(8B, 32B, 72B)에서 검증, 다른 아키텍처 일반화는 미확인.
- 코드 — 논문 내 상세 알고리즘 공개, 코드 공개 여부는 명시되지 않음.
편집자 한 줄
Thinking-Acting Gap이라는 진단 자체가 직관적이라, 다른 VLM 스택에도 적용해볼 만한 접근입니다.
- #vision-language
- #rl
- #tool-use
- #nvidia
- #qwen
NVIDIA