Papers·1개월 전
Oxford, LLM 의료 판단이 오정보에 얼마나 취약한지 측정한 MedMisBench — 정확도 71.1%→38.0%

Oxford 팀이 LLM이 오정보가 포함된 의료 질문에서 정답을 유지하는 능력(epistemic resilience)을 측정하는 MedMisBench를 공개했습니다. 11개 모델 구성에서 원본 정확도 71.1%가 오정보 주입 시 38.0%로 떨어졌으며, 특히 권위적 허위 주장(69.5% 성공률)과 예외 독식 주장(64.1%)이 가장 효과적이었습니다. 7개국 14명 임상 패널은 검토 사례의 38.2%에서 심각한 잠재적 피해 가능성을 지적했습니다.
Oxford 팀이 LLM이 오정보에 얼마나 취약한지 측정하는 MedMisBench를 공개했습니다.
핵심 결론
- 벤치 — MedMisBench는 10,932개 의료 질문 항목과 48,889개 오정보-선택지 쌍으로 구성.
- 성능 하락 — 11개 모델 구성에서 원본 정확도 71.1% 대비 오정보 주입 시 38.0%로 하락, 공격 성공률 51.5%.
- 임상 평가 — 7개국 14명 임상 패널이 검토한 사례 중 38.2%에서 심각한 잠재적 피해 가능성 식별.
방법
- 오정보 유형 — 권위적 허위 주장(69.5% 성공), 예외 독식 주장(64.1%), 일반 오정보(48.1%) 순으로 효과적.
- 구성 — 의료 추론, 에이전트 능력, 환자 여정 평가 등 세 가지 하위 벤치로 구성.
- 기존 벤치마크가 모델의 지식만 측정한 반면, MedMisBench는 오정보 하에서 판단 유지 능력을 평가합니다.
한계·조건
- 범위 — 영어 의료 질문에 한정되며, 실제 임상 환경의 복잡성을 완전히 반영하지는 않습니다.
- 코드 — 데이터셋은 Hugging Face에 공개되었으나, 모델 평가 코드는 추후 공개 예정.
편집자 한 줄
의료 AI 안전성 평가에서 '모델이 아는 것'과 '모델이 속지 않는 것'이 별개라는 점을 실증한 유용한 벤치마크네요.
- #llm
- #medical
- #adversarial
- #benchmark
- #oxford
University of Oxford