← Back to feed
Papers·2개월 전

ZeroUnlearn — 모델 편집으로 민감 정보를 정밀하게 지우는 비학습 프레임워크

ZeroUnlearn — 모델 편집으로 민감 정보를 정밀하게 지우는 비학습 프레임워크

Xiamen 대학 팀이 모델 편집 기반의 few-shot 비학습 프레임워크 ZeroUnlearn을 제안했습니다. 민감 입력을 중립 상태로 재매핑하고 표현 직교성을 닫힌 형태 파라미터 업데이트로 강제해, 기존 방법 대비 효율적이면서도 일반 성능 유지를 달성했습니다. 단 multi-sample 시 gradient 기반 변형이 필요해 추가 계산이 든다는 점이 한계입니다.

Xiamen 대학 연구진이 모델 편집을 통해 민감 정보를 정밀하게 지우는 비학습 프레임워크 ZeroUnlearn을 공개했습니다.

핵심 결론

  • 태스크LLM 비학습(unlearning) — 민감 입력이 유해한 출력을 유도하지 않도록 함.
  • 성능기존 기준선 대비 비학습 완전도와 일반 성능 유지 모두에서 우위, 구체적 수치는 논문 참조.
  • 코드GitHub 공개 — https://github.com/XMUDeepLIT/ZeroUnlearn

방법

  • 재구성비학습을 지식 재매핑 문제로 재구성 — 민감 입력을 중립 목표 상태로 덮어씀.
  • 직교성닫힌 형태의 곱셈 파라미터 업데이트로 표현 직교성을 강제, 기존 지식 보존.
  • 확장다중 샘플 비학습을 위해 gradient 기반 변형도 제공.

한계·조건

  • 계산닫힌 형태 업데이트는 단일 샘플에 효율적이나, 다중 샘플 시 gradient 기반 변형이 필요해 추가 비용 발생.
  • 범위실험은 특정 모델과 데이터셋에 국한 — 일반화 가능성은 추가 검증 필요.

편집자 한 줄

모델 편집을 비학습에 접목한 발상은 신선하지만, 다중 샘플 시의 확장성과 실제 민감 정보 제거의 완전성은 더 살펴볼 점입니다.

  • #machine-unlearning
  • #model-editing
  • #privacy
  • #xiamen-university
Yujie Lin
원문 보기 →

Comments

— 첫 댓글을 남겨보세요 —