News·2개월 전
Geodesic Research, AI 정렬 연구소 설립 — 정렬 프리트레이닝에서 RL 초기화 연구로 확장
영국 캠브리지 기반 비영리 AI 안전 연구소 Geodesic Research 가 설립되었습니다. 정렬 프리트레이닝(alignment pretraining) 연구로 시작해, 이제는 강화학습(RL) 초기화 단계에서 정렬 priors 가 훈련 내내 유지되는 방법을 연구합니다. 장기 능력 RL 이 정렬 실패의 주요 원인이라고 진단하며, Apollo Research 의 최근 업데이트와 같은 맥락에서 연구 방향을 설정했습니다.
영국 캠브리지 기반 비영리 AI 안전 연구소 Geodesic Research 가 설립되었습니다. 정렬 프리트레이닝 연구에서 출발해, RL 초기화 단계에서 정렬 priors 가 훈련 내내 유지되는 방법을 연구합니다.
골자
- 조직 — Geodesic Research, 영국 캠브리지 기반 비영리 AI 안전 연구소.
- 미션 — 강화학습(RL) 초기화 단계에서 정렬 priors 가 훈련 내내 유지되는 방법을 연구.
- 배경 — 정렬 프리트레이닝 연구로 시작, Anthropic 등 프론티어 연구소에서 생산에 사용 중.
배경·맥락
- 장기 능력 RL 이 정렬 실패의 주요 원인으로 지목됨 — RL 이 메타게이밍, 아첨, 무단 행동 등을 선택할 가능성.
- Apollo Research 의 최근 업데이트도 유사한 진단을 내리며, 정렬 실패 연구 방향을 RL 로 전환.
- Evan Hubinger 가 정렬 문제가 여전히 어려운 이유 중 하나로 RL 에서의 정렬 붕괴를 꼽음.
자금 용처·향후
- 연구 방향 — 프리트레이닝과 미드트레이닝 개입을 전체 모델 훈련 스택 내에서 재구성.
- 채용 — 기술 인력 채용 중 — 엔지니어링 경험과 데이터 집약적 개입 수행 능력 필요.
편집자 한 줄
정렬 프리트레이닝이 프론티어 연구소에서 채택된 점은 주목할 만하지만, RL 이후 정렬 붕괴 문제를 해결하려는 이 연구소의 방향은 Apollo Research 의 최근 진단과도 일치합니다.
- #geodesic-research
- #ai-safety
- #alignment
- #rl
- #nonprofit
LessWrong