← Back to feed
Papers·2개월 전

NEO-ov: 외부 인코더 없이 픽셀-단어 대응을 end-to-end 학습하는 네이티브 VLM

NEO-ov: 외부 인코더 없이 픽셀-단어 대응을 end-to-end 학습하는 네이티브 VLM

NEO-ov는 기존 VLM의 모듈식 구조(이미지 인코더+언어 디코더+정렬)를 완전히 제거하고, 픽셀-단어 대응을 end-to-end로 학습하는 네이티브 파운데이션 모델입니다. 다중 프레임, 비디오, 공간 지능 과제에서 모듈식 모델과의 격차를 크게 줄였으며, 특히 세밀한 시각 인식에서 우수한 성능을 보였습니다. 코드와 모델은 공개되었으나, 학습에 대규모 자원이 필요할 것으로 보입니다.

NEO-ov는 외부 인코더나 어댑터 없이 픽셀-단어 대응을 end-to-end로 학습하는 네이티브 VLM으로, 다중 이미지·비디오 이해에서 모듈식 모델에 근접한 성능을 달성했습니다.

핵심 결론

  • 태스크다중 이미지, 비디오 이해, 공간 지능 벤치마크에서 모듈식 VLM과의 격차를 크게 좁힘.
  • 성능세밀한 시각 인식(예: 객체 위치, 프레임 간 변화)에서 모듈식 모델을 능가하는 경우도 있음.
  • 의의네이티브 'one-vision' 아키텍처가 확장 가능하고 경쟁력 있음을 입증.

방법

  • 아키텍처기존 VLM의 분리된 이미지 인코더·언어 디코더·정렬 단계를 하나의 통합 모델로 대체.
  • 학습크로스-프레임 및 픽셀-단어 대응을 end-to-end로 학습, 별도의 어댑터나 후처리 융합 불필요.
  • 데이터멀티프레임·비디오 데이터를 활용한 사전 학습 및 미세 조정 레시피를 상세히 공개.

한계·조건

  • 자원네이티브 모델 학습에는 대규모 컴퓨팅 자원이 필요할 것으로 예상되나, 구체적인 수치는 논문에 명시되지 않음.
  • 벤치주로 정적 이미지·비디오 벤치마크에서 평가되었으며, 실시간·스트리밍 환경에서의 성능은 추가 검증 필요.
  • 코드GitHub에 코드와 모델 가중치가 공개되어 재현 가능.

편집자 한 줄

네이티브 접근이 모듈식 대비 확장성과 성능에서 실질적 이점을 가질지, 후속 연구에서의 비교가 기대됩니다.

  • #vision-language
  • #native-vlm
  • #end-to-end
  • #spatiotemporal
Haiwen Diao
원문 보기 →

Comments

— 첫 댓글을 남겨보세요 —