← Back to feed
Papers·2개월 전

VibeSearchBench — LLM 에이전트의 검색 품질 평가 격차를 드러낸 200개 태스크 벤치마크

VibeSearchBench — LLM 에이전트의 검색 품질 평가 격차를 드러낸 200개 태스크 벤치마크

기존 검색 벤치마크가 과도하게 명시된 쿼리·단일 턴·고정 스키마 평가에 의존해 실제 사용자 경험과 괴리가 있다는 문제를 지적하며, VibeSearchBench 를 제안했습니다. 200개 수작업 이중언어 태스크로 구성되며 사용자 페르소나·스키마 없는 지식 그래프·점진적 공개 시뮬레이터·그래프 매칭 평가 프레임워크를 도입한 점이 특징입니다. 7개 최신 모델을 ReAct 와 OpenClaw 로 평가한 결과 최고 F1 이 30.30에 그쳐, 장문 추론·의도 능동적 유도·구조화된 지식 구성의 근본적 개선이 필요함을 보여줍니다.

기존 검색 벤치마크가 실제 사용자 경험을 반영하지 못하는 평가-경험 격차를 해소하기 위해, 다중 턴 협업적 검색 패러다임 VibeSearch 와 그 벤치마크 VibeSearchBench 가 공개되었습니다.

핵심 결론

  • 태스크200개 수작업 이중언어(중·영) 태스크, 전문가용(VibeSearch-Pro)과 일상용(VibeSearch-Daily) 하위 집합으로 구성.
  • 평가점진적 공개 사용자 시뮬레이터 + 스키마 없는 지식 그래프 매칭 평가 프레임워크 사용.
  • 결과7개 최신 모델(ReAct, OpenClaw) 평가 결과 최고 F1 30.30 — 모든 모델이 충분하지 않음.

방법

  • 패러다임VibeSearch: 사용자와 에이전트가 다중 턴 대화를 통해 모호한 의도를 협력적으로 구체화하는 검색 방식.
  • 데이터각 태스크는 사용자 페르소나 + 스키마 없는 정답 지식 그래프 쌍으로 구성.
  • 평가점진적 공개 사용자 시뮬레이터가 대화를 진행하고, 그래프 매칭으로 정답 구조와의 일치도를 측정.

한계·조건

  • 범위20개 도메인에 한정, 언어는 중국어와 영어만 포함.
  • 리소스수작업 큐레이션으로 데이터 규모가 크지 않으며, 확장성에 한계가 있을 수 있음.
  • 재현성벤치마크와 평가 코드는 공개 예정이지만 현재 시점에서는 abstract 수준만 확인 가능.

편집자 한 줄

기존 벤치마크가 간과한 '모호한 의도에서 출발하는 다중 턴 검색'을 정형화한 점은 의미 있지만, 200개 태스크로 일반화를 논하기엔 다소 작은 규모입니다.

  • #llm-agents
  • #search-benchmark
  • #evaluation
  • #vibesearch
rednote-hilab
원문 보기 →

Comments

— 첫 댓글을 남겨보세요 —