Papers·2개월 전
IBM, 에이전트 행동을 자동 평가하는 Agentic CLEAR 공개 — 3단계 피드백으로 오류 탐지 정확도 향상

IBM Research가 에이전트 시스템의 행동을 시스템·트레이스·노드 세 가지 세분화 수준에서 자동으로 평가하는 프레임워크 Agentic CLEAR를 공개했습니다. 관측성 계층 위에서 동작하며, 정적 오류 분류 대신 데이터 기반 동적 피드백을 생성합니다. 네 가지 벤치마크, 일곱 가지 에이전트 설정에서 수만 번의 LLM 호출 실험 결과, 인간 주석 오류와 높은 일치를 보였고 태스크 성공률 예측도 가능했습니다.
IBM Research가 에이전트 행동을 자동으로 평가하는 프레임워크 Agentic CLEAR를 발표했습니다.
핵심 결론
- 벤치 — 네 가지 벤치마크, 일곱 가지 에이전트 설정에서 수만 번 LLM 호출 실험.
- 성능 — 인간 주석 오류와 높은 일치를 보였으며, 태스크 성공률 예측도 가능했습니다.
방법
- 세 가지 수준 — 시스템(전체 통계), 트레이스(에이전트 실행 경로), 노드(개별 행동) 단위로 텍스트 피드백을 생성합니다.
- 동적 평가 — 정적 오류 분류 대신 데이터 기반으로 동적 피드백을 생성해 새로운 도메인에도 적응 가능합니다.
- UI — 관측성 계층 위에서 동작하며 직관적인 UI를 제공해 접근성이 높습니다.
한계·조건
- 환경 — 실험은 특정 LLM과 에이전트 프레임워크에 의존적일 수 있습니다. 코드 공개 여부는 아직 확인되지 않았습니다.
- 범위 — 벤치마크는 주로 텍스트 기반 에이전트 환경에 한정되어 있습니다.
편집자 한 줄
에이전트 평가가 점점 중요해지는 시점에서, 정적 분류를 벗어난 동적 피드백 접근은 실용적으로 보입니다. 다만 코드 공개와 다양한 환경에서의 추가 검증이 필요해 보이네요.
- #agentic-systems
- #evaluation
- #ibm-research
- #llm
IBM Research