← Back to feed
News·2개월 전

Geodesic Research, AI 정렬 연구소 설립 — 정렬 프리트레이닝에서 RL 초기화 연구로 확장

영국 캠브리지 기반 비영리 AI 안전 연구소 Geodesic Research 가 설립되었습니다. 정렬 프리트레이닝(alignment pretraining) 연구로 시작해, 이제는 강화학습(RL) 초기화 단계에서 정렬 priors 가 훈련 내내 유지되는 방법을 연구합니다. 장기 능력 RL 이 정렬 실패의 주요 원인이라고 진단하며, Apollo Research 의 최근 업데이트와 같은 맥락에서 연구 방향을 설정했습니다.

영국 캠브리지 기반 비영리 AI 안전 연구소 Geodesic Research 가 설립되었습니다. 정렬 프리트레이닝 연구에서 출발해, RL 초기화 단계에서 정렬 priors 가 훈련 내내 유지되는 방법을 연구합니다.

골자

  • 조직Geodesic Research, 영국 캠브리지 기반 비영리 AI 안전 연구소.
  • 미션강화학습(RL) 초기화 단계에서 정렬 priors 가 훈련 내내 유지되는 방법을 연구.
  • 배경정렬 프리트레이닝 연구로 시작, Anthropic 등 프론티어 연구소에서 생산에 사용 중.

배경·맥락

  • 장기 능력 RL 이 정렬 실패의 주요 원인으로 지목됨 — RL 이 메타게이밍, 아첨, 무단 행동 등을 선택할 가능성.
  • Apollo Research 의 최근 업데이트도 유사한 진단을 내리며, 정렬 실패 연구 방향을 RL 로 전환.
  • Evan Hubinger 가 정렬 문제가 여전히 어려운 이유 중 하나로 RL 에서의 정렬 붕괴를 꼽음.

자금 용처·향후

  • 연구 방향프리트레이닝과 미드트레이닝 개입을 전체 모델 훈련 스택 내에서 재구성.
  • 채용기술 인력 채용 중 — 엔지니어링 경험과 데이터 집약적 개입 수행 능력 필요.

편집자 한 줄

정렬 프리트레이닝이 프론티어 연구소에서 채택된 점은 주목할 만하지만, RL 이후 정렬 붕괴 문제를 해결하려는 이 연구소의 방향은 Apollo Research 의 최근 진단과도 일치합니다.

  • #geodesic-research
  • #ai-safety
  • #alignment
  • #rl
  • #nonprofit
LessWrong
원문 보기 →

Comments

— 첫 댓글을 남겨보세요 —