← Back to feed
News·2개월 전

Anthropic, Claude 헌법 대규모 업데이트 — 정렬 안정성 목표

Anthropic이 Claude의 'Soul Doc' 헌법을 대규모 업데이트했습니다. 단순 행동 규칙뿐 아니라 결정 배경과 이유를 포함해, 초지능 AI가 분포 외 일반화와 반성적 안정성을 높이도록 설계했습니다. LessWrong 포스트는 이 접근을 긍정 평가하면서도 몇 가지 보완점을 제안합니다.

Anthropic이 Claude의 정렬 기준인 헌법을 대폭 개정했습니다. 단순한 규칙 목록이 아닌, AI가 스스로 추론할 수 있는 근거를 담은 게 핵심입니다.

골자

  • 대상Claude의 'Soul Doc'이라 불리는 헌법 문서가 대규모 업데이트됐습니다.
  • 변화기존에는 행동 규칙만 나열했지만, 이제 각 규칙의 배경과 의사결정 이유를 설명합니다.
  • 목표초지능 AI가 새로운 조건에서도 일관된 행동을 유지하고, 반성적 안정성을 확보하는 데 초점을 맞췄습니다.

배경·맥락

  • Constitutional AI는 Anthropic이 도입한 정렬 기법으로, LLM이 헌법 텍스트를 해석해 RL 환경에서 행동을 학습합니다.
  • 초기 헌법초기 버전은 반복적이고 유사한 문장이 많아 문구 의존성을 줄이기 위한 것이었습니다.
  • 우려LessWrong 포스트는 '단순한 체크리스트로는 정렬이 불충분하다'는 기존 우려를 재확인합니다.

보완 제안

  • 누락LessWrong 포스트는 헌법이 놓친 몇 가지 논쟁과 미흡한 부분을 지적합니다.
  • 개선 방향AI가 헌법을 단순한 목록이 아닌, 추론 가능한 논리로 이해하도록 설계해야 한다고 제안합니다.

편집자 한 줄

헌법에 '이유'를 포함하는 접근은 정렬 연구에서 중요한 진전이지만, 초지능 AI가 이를 어떻게 해석할지는 여전히 미지수입니다.

  • #anthropic
  • #claude
  • #constitutional-ai
  • #alignment
  • #safety
LessWrong
원문 보기 →

Comments

— 첫 댓글을 남겨보세요 —