Papers·1개월 전
PAIWorld: 다중 뷰 3D 일관성을 갖춘 로봇 월드 모델 — WorldArena 1위

PAIWorld는 확산 트랜스포머 기반 월드 모델에 기하학 인식 교차 뷰 어텐션, Geometric Rotary Position Encoding, Latent 3D-REPA를 도입해 다중 뷰 3D 일관성을 확보했습니다. 로봇 조작 벤치마크 WorldArena에서 1위, AgiBot-Challenge2026에서 2위를 기록했으며, 모델 기반 계획 및 다중 뷰 정책 학습에 활용 가능합니다. 단, 3D 파운데이션 모델의 증류가 필요해 추론 비용이 증가하는 점이 한계입니다.
기존 단일 뷰 월드 모델은 로봇 조작에 필요한 다중 뷰 3D 일관성이 부족합니다. PAIWorld는 명시적 기하 추론을 통해 이 문제를 해결합니다.
핵심 결론
- 벤치마크 — WorldArena 리더보드 1위, AgiBot-Challenge2026 2위 — 다중 뷰 3D 일관성에서 SOTA 달성.
- 적용 — 모델 기반 계획, 월드 액션 모델, 다중 뷰 정책 후학습 등 하류 작업에서 유효.
방법
- Geometry-Aware Cross-View Attention — 뷰 간 명시적 소통 경로를 만드는 어텐션 블록으로 객체 표류를 방지.
- Geometric Rotary Position Encoding — 카메라 광선 방향과 외부 자세를 어텐션에 인코딩해 3D 기하 선행을 주입.
- Latent 3D-REPA — 고정된 3D 파운데이션 모델에서 3D 인식 특징을 증류해 잠재 공간의 3D 일관성 확보.
한계·조건
- 추론 비용 — 3D 파운데이션 모델 증류로 인해 추가 연산이 필요, 실시간성에 제약 가능.
- 데이터 — 다중 뷰 데이터셋에 의존하며, 뷰 수가 많아질수록 성능이 포화될 가능성.
- 코드 — Hugging Face 페이지에 abstract만 공개, 코드 및 모델 가중치는 미공개 상태.
편집자 한 줄
확산 트랜스포머에 기하학적 선행을 통합한 설계가 깔끔합니다. 다만 실제 로봇에 적용하려면 추론 속도 개선이 필요해 보입니다.
- #world-model
- #multi-view
- #3d-consistency
- #robotic-manipulation
- #diffusion-transformer
Yuhang Huang