Papers·2개월 전
ZeroUnlearn — 모델 편집으로 민감 정보를 정밀하게 지우는 비학습 프레임워크

Xiamen 대학 팀이 모델 편집 기반의 few-shot 비학습 프레임워크 ZeroUnlearn을 제안했습니다. 민감 입력을 중립 상태로 재매핑하고 표현 직교성을 닫힌 형태 파라미터 업데이트로 강제해, 기존 방법 대비 효율적이면서도 일반 성능 유지를 달성했습니다. 단 multi-sample 시 gradient 기반 변형이 필요해 추가 계산이 든다는 점이 한계입니다.
Xiamen 대학 연구진이 모델 편집을 통해 민감 정보를 정밀하게 지우는 비학습 프레임워크 ZeroUnlearn을 공개했습니다.
핵심 결론
- 태스크 — LLM 비학습(unlearning) — 민감 입력이 유해한 출력을 유도하지 않도록 함.
- 성능 — 기존 기준선 대비 비학습 완전도와 일반 성능 유지 모두에서 우위, 구체적 수치는 논문 참조.
- 코드 — GitHub 공개 — https://github.com/XMUDeepLIT/ZeroUnlearn
방법
- 재구성 — 비학습을 지식 재매핑 문제로 재구성 — 민감 입력을 중립 목표 상태로 덮어씀.
- 직교성 — 닫힌 형태의 곱셈 파라미터 업데이트로 표현 직교성을 강제, 기존 지식 보존.
- 확장 — 다중 샘플 비학습을 위해 gradient 기반 변형도 제공.
한계·조건
- 계산 — 닫힌 형태 업데이트는 단일 샘플에 효율적이나, 다중 샘플 시 gradient 기반 변형이 필요해 추가 비용 발생.
- 범위 — 실험은 특정 모델과 데이터셋에 국한 — 일반화 가능성은 추가 검증 필요.
편집자 한 줄
모델 편집을 비학습에 접목한 발상은 신선하지만, 다중 샘플 시의 확장성과 실제 민감 정보 제거의 완전성은 더 살펴볼 점입니다.
- #machine-unlearning
- #model-editing
- #privacy
- #xiamen-university
Yujie Lin