← Back to feed
Papers·1개월 전

PAIWorld: 다중 뷰 3D 일관성을 갖춘 로봇 월드 모델 — WorldArena 1위

PAIWorld: 다중 뷰 3D 일관성을 갖춘 로봇 월드 모델 — WorldArena 1위

PAIWorld는 확산 트랜스포머 기반 월드 모델에 기하학 인식 교차 뷰 어텐션, Geometric Rotary Position Encoding, Latent 3D-REPA를 도입해 다중 뷰 3D 일관성을 확보했습니다. 로봇 조작 벤치마크 WorldArena에서 1위, AgiBot-Challenge2026에서 2위를 기록했으며, 모델 기반 계획 및 다중 뷰 정책 학습에 활용 가능합니다. 단, 3D 파운데이션 모델의 증류가 필요해 추론 비용이 증가하는 점이 한계입니다.

기존 단일 뷰 월드 모델은 로봇 조작에 필요한 다중 뷰 3D 일관성이 부족합니다. PAIWorld는 명시적 기하 추론을 통해 이 문제를 해결합니다.

핵심 결론

  • 벤치마크WorldArena 리더보드 1위, AgiBot-Challenge2026 2위 — 다중 뷰 3D 일관성에서 SOTA 달성.
  • 적용모델 기반 계획, 월드 액션 모델, 다중 뷰 정책 후학습 등 하류 작업에서 유효.

방법

  • Geometry-Aware Cross-View Attention뷰 간 명시적 소통 경로를 만드는 어텐션 블록으로 객체 표류를 방지.
  • Geometric Rotary Position Encoding카메라 광선 방향과 외부 자세를 어텐션에 인코딩해 3D 기하 선행을 주입.
  • Latent 3D-REPA고정된 3D 파운데이션 모델에서 3D 인식 특징을 증류해 잠재 공간의 3D 일관성 확보.

한계·조건

  • 추론 비용3D 파운데이션 모델 증류로 인해 추가 연산이 필요, 실시간성에 제약 가능.
  • 데이터다중 뷰 데이터셋에 의존하며, 뷰 수가 많아질수록 성능이 포화될 가능성.
  • 코드Hugging Face 페이지에 abstract만 공개, 코드 및 모델 가중치는 미공개 상태.

편집자 한 줄

확산 트랜스포머에 기하학적 선행을 통합한 설계가 깔끔합니다. 다만 실제 로봇에 적용하려면 추론 속도 개선이 필요해 보입니다.

  • #world-model
  • #multi-view
  • #3d-consistency
  • #robotic-manipulation
  • #diffusion-transformer
Yuhang Huang
원문 보기 →

Comments

— 첫 댓글을 남겨보세요 —