← Back to feed
Papers·2개월 전

QUACK: 멀티모달 사회추론 게임에서 LLM 에이전트 발화의 접지(grounding) 감사 프레임워크

QUACK: 멀티모달 사회추론 게임에서 LLM 에이전트 발화의 접지(grounding) 감사 프레임워크

QUACK 은 사회추론 게임 환경에서 LLM 에이전트의 발화가 실제 행동·인식에 기반하는지 평가하는 오픈소스 프레임워크입니다. 게임 승률, 행동 궤적, 발화 일관성의 세 수준에서 평가하며, Statement Verification Pipeline으로 공간 환각·근거 없는 비난·기만 붕괴 등을 자동 탐지합니다. 최신 VLM 평가 결과, 가장 강력한 에이전트조차 확인 가능한 공간 주장의 15.1%를 환각했고, 비난의 절반 이상이 근거 없이 이루어졌습니다.

사회추론 게임은 LLM 에이전트의 추론·기만·협력·신념 모델링을 시험하는 인기 벤치마크이나, 대부분 텍스트 기반에 승률만 측정해 에이전트 발화의 접지 여부를 알기 어렵습니다.

핵심 결론

  • 평가 프레임워크QUACK 은 게임 승률, 행동 궤적, 발화 일관성의 세 수준에서 에이전트를 평가하며, 엔진 로그를 통해 각 에이전트의 실제 궤적을 재구성해 발화 주장과 대조합니다.
  • 실험 결과세 가지 최신 VLM을 동질 및 교차모델 적대 설정에서 평가한 결과, 가장 강력한 에이전트도 확인 가능한 공간 주장의 15.1%를 환각했고, 비난의 50% 이상이 근거 없는 것으로 나타났습니다.

방법

  • Statement Verification Pipeline엔진 로그에서 각 에이전트의 실제 궤적을 재구성하고, 모든 토론 발화의 주장을 이와 대조해 공간 환각·근거 없는 비난·기만 붕괴·언어-행동 불일치를 자동 플래깅합니다.
  • 멀티모달 환경텍스트뿐 아니라 시각 정보(게임 맵, 플레이어 위치)를 포함해 에이전트의 발화가 실제 시각적 인식에 기반하는지 평가합니다.

한계·조건

  • 환경QUACK 은 특정 사회추론 게임(예: Werewolf 유사)에 맞춰 설계되어 다른 게임 장르로의 일반화는 추가 작업이 필요합니다.
  • 코드전체 엔진, 평가 프레임워크, 툴킷, 로그를 GitHub에 공개했습니다.

편집자 한 줄

발화 접지 문제를 체계적으로 감사할 수 있는 프레임워크라는 점에서 의미가 크지만, 실험에 사용된 VLM이 구체적으로 무엇인지 명시되지 않아 재현성에 한계가 있습니다.

  • #social-deduction
  • #multimodal
  • #evaluation
  • #hallucination
  • #llm-agents
AAAAA Academia Attractions
원문 보기 →

Comments

— 첫 댓글을 남겨보세요 —