← Back to feed
Papers·2개월 전

Activation oracle 의 불확실성 정량화 — bootstrap mode frequency 가 가장 잘 보정됨 (ECE 5.7%)

Activation oracle 의 불확실성 정량화 — bootstrap mode frequency 가 가장 잘 보정됨 (ECE 5.7%)

AI Safety & Interpretability Lab 연구진이 activation oracle 의 자연어 출력에 대한 불확실성 정량화(UQ) 방법 6가지를 비교했습니다. 6,000 샘플 실험에서 bootstrap mode frequency 가 가장 잘 보정된 방법으로 나타났습니다 (Qwen3-8B 기준 ECE 5.7% vs. answer-word log-probability 25.5%). 코드와 패치된 트레이너는 GitHub에 공개되었습니다.

Activation oracle 의 자연어 출력에 대한 불확실성 정량화 방법을 체계적으로 비교한 연구입니다.

핵심 결론

  • 최고 방법Bootstrap mode frequency 가 가장 잘 보정된 confidence 추정 방법 (ECE 5.7%).
  • 벤치마크Qwen3-8B 와 Qwen3.6-27B 에서 각각 6,000 샘플로 평가.
  • 비교Answer-word log-probability 는 ECE 25.5% 로 크게 과신하는 경향.

방법

  • 실험 설계6가지 UQ 방법 (bootstrap mode frequency, log-prob, temperature scaling 등) 을 verbalizer 와 context prompt 를 바꿔가며 평가.
  • 측정Expected Calibration Error (ECE) 로 보정 정도를 측정.
  • Log-prob baseline 은 빠른 triage 용으로는 쓸 만하지만 보정이 나쁘다는 점을 확인했습니다.

한계·조건

  • 모델 범위Qwen3 계열 두 모델에 한정 — 다른 아키텍처에서도 일반화될지는 추가 실험이 필요.
  • 샘플 수Oracle 당 6,000 샘플로 제한적이며, 더 다양한 프롬프트에서의 검증이 필요합니다.
  • 코드GitHub (https://github.com/federicotorrielli/probabilistic_activation_oracles) 에 공개.

편집자 한 줄

Activation oracle 의 실용화를 위해 UQ 가 중요한 축인데, bootstrap mode frequency 가 간단하면서도 효과적이라는 점이 인상적입니다.

  • #activation-oracle
  • #uncertainty-quantification
  • #interpretability
  • #aisafety
AI Safety & Interpretability Lab
원문 보기 →

Comments

— 첫 댓글을 남겨보세요 —