Papers·2개월 전
QUACK: 멀티모달 사회추론 게임에서 LLM 에이전트 발화의 접지(grounding) 감사 프레임워크

QUACK 은 사회추론 게임 환경에서 LLM 에이전트의 발화가 실제 행동·인식에 기반하는지 평가하는 오픈소스 프레임워크입니다. 게임 승률, 행동 궤적, 발화 일관성의 세 수준에서 평가하며, Statement Verification Pipeline으로 공간 환각·근거 없는 비난·기만 붕괴 등을 자동 탐지합니다. 최신 VLM 평가 결과, 가장 강력한 에이전트조차 확인 가능한 공간 주장의 15.1%를 환각했고, 비난의 절반 이상이 근거 없이 이루어졌습니다.
사회추론 게임은 LLM 에이전트의 추론·기만·협력·신념 모델링을 시험하는 인기 벤치마크이나, 대부분 텍스트 기반에 승률만 측정해 에이전트 발화의 접지 여부를 알기 어렵습니다.
핵심 결론
- 평가 프레임워크 — QUACK 은 게임 승률, 행동 궤적, 발화 일관성의 세 수준에서 에이전트를 평가하며, 엔진 로그를 통해 각 에이전트의 실제 궤적을 재구성해 발화 주장과 대조합니다.
- 실험 결과 — 세 가지 최신 VLM을 동질 및 교차모델 적대 설정에서 평가한 결과, 가장 강력한 에이전트도 확인 가능한 공간 주장의 15.1%를 환각했고, 비난의 50% 이상이 근거 없는 것으로 나타났습니다.
방법
- Statement Verification Pipeline — 엔진 로그에서 각 에이전트의 실제 궤적을 재구성하고, 모든 토론 발화의 주장을 이와 대조해 공간 환각·근거 없는 비난·기만 붕괴·언어-행동 불일치를 자동 플래깅합니다.
- 멀티모달 환경 — 텍스트뿐 아니라 시각 정보(게임 맵, 플레이어 위치)를 포함해 에이전트의 발화가 실제 시각적 인식에 기반하는지 평가합니다.
한계·조건
- 환경 — QUACK 은 특정 사회추론 게임(예: Werewolf 유사)에 맞춰 설계되어 다른 게임 장르로의 일반화는 추가 작업이 필요합니다.
- 코드 — 전체 엔진, 평가 프레임워크, 툴킷, 로그를 GitHub에 공개했습니다.
편집자 한 줄
발화 접지 문제를 체계적으로 감사할 수 있는 프레임워크라는 점에서 의미가 크지만, 실험에 사용된 VLM이 구체적으로 무엇인지 명시되지 않아 재현성에 한계가 있습니다.
- #social-deduction
- #multimodal
- #evaluation
- #hallucination
- #llm-agents
AAAAA Academia Attractions