Papers·2개월 전
VibeSearchBench — LLM 에이전트의 검색 품질 평가 격차를 드러낸 200개 태스크 벤치마크

기존 검색 벤치마크가 과도하게 명시된 쿼리·단일 턴·고정 스키마 평가에 의존해 실제 사용자 경험과 괴리가 있다는 문제를 지적하며, VibeSearchBench 를 제안했습니다. 200개 수작업 이중언어 태스크로 구성되며 사용자 페르소나·스키마 없는 지식 그래프·점진적 공개 시뮬레이터·그래프 매칭 평가 프레임워크를 도입한 점이 특징입니다. 7개 최신 모델을 ReAct 와 OpenClaw 로 평가한 결과 최고 F1 이 30.30에 그쳐, 장문 추론·의도 능동적 유도·구조화된 지식 구성의 근본적 개선이 필요함을 보여줍니다.
기존 검색 벤치마크가 실제 사용자 경험을 반영하지 못하는 평가-경험 격차를 해소하기 위해, 다중 턴 협업적 검색 패러다임 VibeSearch 와 그 벤치마크 VibeSearchBench 가 공개되었습니다.
핵심 결론
- 태스크 — 200개 수작업 이중언어(중·영) 태스크, 전문가용(VibeSearch-Pro)과 일상용(VibeSearch-Daily) 하위 집합으로 구성.
- 평가 — 점진적 공개 사용자 시뮬레이터 + 스키마 없는 지식 그래프 매칭 평가 프레임워크 사용.
- 결과 — 7개 최신 모델(ReAct, OpenClaw) 평가 결과 최고 F1 30.30 — 모든 모델이 충분하지 않음.
방법
- 패러다임 — VibeSearch: 사용자와 에이전트가 다중 턴 대화를 통해 모호한 의도를 협력적으로 구체화하는 검색 방식.
- 데이터 — 각 태스크는 사용자 페르소나 + 스키마 없는 정답 지식 그래프 쌍으로 구성.
- 평가 — 점진적 공개 사용자 시뮬레이터가 대화를 진행하고, 그래프 매칭으로 정답 구조와의 일치도를 측정.
한계·조건
- 범위 — 20개 도메인에 한정, 언어는 중국어와 영어만 포함.
- 리소스 — 수작업 큐레이션으로 데이터 규모가 크지 않으며, 확장성에 한계가 있을 수 있음.
- 재현성 — 벤치마크와 평가 코드는 공개 예정이지만 현재 시점에서는 abstract 수준만 확인 가능.
편집자 한 줄
기존 벤치마크가 간과한 '모호한 의도에서 출발하는 다중 턴 검색'을 정형화한 점은 의미 있지만, 200개 태스크로 일반화를 논하기엔 다소 작은 규모입니다.
- #llm-agents
- #search-benchmark
- #evaluation
- #vibesearch
rednote-hilab