← Back to feed
News·1개월 전

Olmo 모델 훈련 중 유해성 방향 분석 — 하위 범주는 공유 구조 유지

Olmo 모델 훈련 중 유해성 방향 분석 — 하위 범주는 공유 구조 유지

MARS 4.0 프로그램의 연구진이 Olmo 모델의 훈련 과정에서 유해성 하위 범주(폭력, 혐오 등)의 표현 방향을 분석했습니다. 하위 범주들은 단일 방향으로 수렴하지 않고 공유된 기하학적 공간을 유지하며, 훈련 동기화가 전역 표현 변화에 의해 주도됨을 발견했습니다. 또한 사전 훈련 후반 체크포인트의 방향이 지시 모델을 약하게 조종할 수 있지만, 사후 훈련 체크포인트가 훨씬 효과적이었습니다.

Olmo 모델 훈련 과정에서 유해성 하위 범주의 활성화 방향이 어떻게 변화하는지 추적한 탐색적 연구입니다.

골자

  • 연구 대상Olmo 모델의 사전 훈련 및 사후 훈련 체크포인트에서 유해성 하위 범주(폭력, 혐오 등)의 선형 활성화 방향을 추출.
  • 주요 발견하위 범주들은 단일 방향으로 수렴하지 않지만, 공유된 기하학적 구조를 가짐.
  • 훈련 동기화하위 범주 간 훈련 역학이 고도로 동기화되어 있으며, 이는 개념별 학습보다 전역 표현 변화에 기인.
  • 조종 효과사전 훈련 후반 체크포인트의 방향은 지시 모델을 약하게 조종하나, 사후 훈련 체크포인트는 훨씬 효과적.

배경·맥락

  • 기존 연구는 단일 유해성 개념에 초점을 맞췄으나, 이 연구는 하위 범주 간 관계와 훈련 동적을 분석.
  • 방법론선형 활성성 방향 추출, 기하학적 관계 측정, AUROC 평가(분포 내/외), 조종 벡터 검증 사용.
  • OOD 중요성분포 내 AUROC는 표면적 어휘·구조적 단서로 인해 오해의 소지가 있어, 신중한 OOD 평가가 필요.

자금 용처·향후

  • 이 연구는 탐색적 보고서로, 향후 활성화 방향 분석 연구의 기초 자료로 활용될 예정.
  • 한계단일 모델(Olmo)에 국한되며, 다양한 모델 아키텍처로의 일반화가 필요.

편집자 한 줄

사전 훈련과 사후 훈련 간 조종 효과 차이는 정렬 연구에서 중요한 실용적 시사점을 제공합니다.

  • #olmo
  • #harmfulness
  • #activation-steering
  • #interpretability
  • #safety
LessWrong
원문 보기 →

Comments

— 첫 댓글을 남겨보세요 —