Papers·2개월 전
Activation oracle 의 불확실성 정량화 — bootstrap mode frequency 가 가장 잘 보정됨 (ECE 5.7%)

AI Safety & Interpretability Lab 연구진이 activation oracle 의 자연어 출력에 대한 불확실성 정량화(UQ) 방법 6가지를 비교했습니다. 6,000 샘플 실험에서 bootstrap mode frequency 가 가장 잘 보정된 방법으로 나타났습니다 (Qwen3-8B 기준 ECE 5.7% vs. answer-word log-probability 25.5%). 코드와 패치된 트레이너는 GitHub에 공개되었습니다.
Activation oracle 의 자연어 출력에 대한 불확실성 정량화 방법을 체계적으로 비교한 연구입니다.
핵심 결론
- 최고 방법 — Bootstrap mode frequency 가 가장 잘 보정된 confidence 추정 방법 (ECE 5.7%).
- 벤치마크 — Qwen3-8B 와 Qwen3.6-27B 에서 각각 6,000 샘플로 평가.
- 비교 — Answer-word log-probability 는 ECE 25.5% 로 크게 과신하는 경향.
방법
- 실험 설계 — 6가지 UQ 방법 (bootstrap mode frequency, log-prob, temperature scaling 등) 을 verbalizer 와 context prompt 를 바꿔가며 평가.
- 측정 — Expected Calibration Error (ECE) 로 보정 정도를 측정.
- Log-prob baseline 은 빠른 triage 용으로는 쓸 만하지만 보정이 나쁘다는 점을 확인했습니다.
한계·조건
- 모델 범위 — Qwen3 계열 두 모델에 한정 — 다른 아키텍처에서도 일반화될지는 추가 실험이 필요.
- 샘플 수 — Oracle 당 6,000 샘플로 제한적이며, 더 다양한 프롬프트에서의 검증이 필요합니다.
- 코드 — GitHub (https://github.com/federicotorrielli/probabilistic_activation_oracles) 에 공개.
편집자 한 줄
Activation oracle 의 실용화를 위해 UQ 가 중요한 축인데, bootstrap mode frequency 가 간단하면서도 효과적이라는 점이 인상적입니다.
- #activation-oracle
- #uncertainty-quantification
- #interpretability
- #aisafety
AI Safety & Interpretability Lab