← Back to feed
Papers·2개월 전

IBM, 에이전트 행동을 자동 평가하는 Agentic CLEAR 공개 — 3단계 피드백으로 오류 탐지 정확도 향상

IBM, 에이전트 행동을 자동 평가하는 Agentic CLEAR 공개 — 3단계 피드백으로 오류 탐지 정확도 향상

IBM Research가 에이전트 시스템의 행동을 시스템·트레이스·노드 세 가지 세분화 수준에서 자동으로 평가하는 프레임워크 Agentic CLEAR를 공개했습니다. 관측성 계층 위에서 동작하며, 정적 오류 분류 대신 데이터 기반 동적 피드백을 생성합니다. 네 가지 벤치마크, 일곱 가지 에이전트 설정에서 수만 번의 LLM 호출 실험 결과, 인간 주석 오류와 높은 일치를 보였고 태스크 성공률 예측도 가능했습니다.

IBM Research가 에이전트 행동을 자동으로 평가하는 프레임워크 Agentic CLEAR를 발표했습니다.

핵심 결론

  • 벤치네 가지 벤치마크, 일곱 가지 에이전트 설정에서 수만 번 LLM 호출 실험.
  • 성능인간 주석 오류와 높은 일치를 보였으며, 태스크 성공률 예측도 가능했습니다.

방법

  • 세 가지 수준시스템(전체 통계), 트레이스(에이전트 실행 경로), 노드(개별 행동) 단위로 텍스트 피드백을 생성합니다.
  • 동적 평가정적 오류 분류 대신 데이터 기반으로 동적 피드백을 생성해 새로운 도메인에도 적응 가능합니다.
  • UI관측성 계층 위에서 동작하며 직관적인 UI를 제공해 접근성이 높습니다.

한계·조건

  • 환경실험은 특정 LLM과 에이전트 프레임워크에 의존적일 수 있습니다. 코드 공개 여부는 아직 확인되지 않았습니다.
  • 범위벤치마크는 주로 텍스트 기반 에이전트 환경에 한정되어 있습니다.

편집자 한 줄

에이전트 평가가 점점 중요해지는 시점에서, 정적 분류를 벗어난 동적 피드백 접근은 실용적으로 보입니다. 다만 코드 공개와 다양한 환경에서의 추가 검증이 필요해 보이네요.

  • #agentic-systems
  • #evaluation
  • #ibm-research
  • #llm
IBM Research
원문 보기 →

Comments

— 첫 댓글을 남겨보세요 —