← Back to feed
Papers·2개월 전

NVIDIA, Thinking-Acting Gap 해소하는 AXPO — 8B 모델이 32B Base 추월

NVIDIA, Thinking-Acting Gap 해소하는 AXPO — 8B 모델이 32B Base 추월

NVIDIA 팀이 VLM의 추론-도구사용 간 구조적 비대칭(Thinking-Acting Gap)을 해결하는 RL 알고리즘 AXPO를 제안했습니다. 기존 GRPO에서는 도구 사용 시도가 30%에 불과하고, 시도해도 그룹 내 전원 실패 비율이 40%에 달해 학습 신호가 약해지는 문제가 있었습니다. AXPO는 전원 실패한 도구 사용 하위그룹에서 thinking prefix를 고정하고 도구 호출과 이후 생성을 재샘플링하여, Qwen3-VL-Thinking 8B 모델에서 SFT+GRPO 대비 평균 Pass@1 +1.8pp, Pass@4 +1.8pp 향상을 달성했으며, 8B 모델이 32B Base의 Pass@4를 4배 적은 파라미터로 넘겼습니다.

NVIDIA가 VLM의 추론과 도구 사용 사이 간극을 메우는 RL 알고리즘 AXPO를 발표했습니다.

핵심 결론

  • 벤치9개 멀티모달 벤치마크 평균, Qwen3-VL-Thinking 8B에서 SFT+AXPO가 SFT+GRPO 대비 Pass@1 +1.8pp, Pass@4 +1.8pp.
  • 스케일8B SFT+AXPO가 32B Base의 Pass@4를 4배 적은 파라미터로 능가.

방법

  • 문제Thinking-Acting Gap: 추론은 저변이 기본, 도구 사용은 고변이 보조 — GRPO 하에서 도구 사용 시도 30%, 전원 실패 40%.
  • AXPO전원 실패한 도구 사용 하위그룹에서 thinking prefix를 고정하고 도구 호출과 이후 생성을 재샘플링, 불확실성 기반 prefix 선택.

한계·조건

  • 환경Qwen3-VL-Thinking 계열(8B, 32B, 72B)에서 검증, 다른 아키텍처 일반화는 미확인.
  • 코드논문 내 상세 알고리즘 공개, 코드 공개 여부는 명시되지 않음.

편집자 한 줄

Thinking-Acting Gap이라는 진단 자체가 직관적이라, 다른 VLM 스택에도 적용해볼 만한 접근입니다.

  • #vision-language
  • #rl
  • #tool-use
  • #nvidia
  • #qwen
NVIDIA
원문 보기 →

Comments

— 첫 댓글을 남겨보세요 —