Papers·2개월 전
하버드 AutoScientists — 분산형 에이전트 팀이 생물의학·언어모델 최적화에서 SOTA 갱신

하버드 연구팀이 여러 AI 에이전트가 실험 상태를 공유하며 자율적으로 팀을 구성하고 가설을 검증하는 AutoScientists 를 제안했습니다. BioML-Bench 24개 태스크에서 평균 74.4% 퍼센타일로 기존 최고 에이전트 대비 +8.33% 향상, GPT 훈련 최적화에서는 목표 bits-per-byte 도달 속도가 Autoresearch 대비 1.9배 빨랐습니다. 단, 모든 벤치마크가 컴퓨테이셔널 실험에 국한되어 물리 실험에는 적용이 어렵다는 한계가 있습니다.
하버드 연구팀이 분산형 AI 에이전트 팀 AutoScientists 를 통해 생물의학·언어모델 최적화·단백질 적합성 예측에서 기존 단일 에이전트 접근을 크게 개선했습니다.
핵심 결론
- BioML-Bench — 24개 태스크 평균 퍼센타일 74.4%로 기존 최고 에이전트 대비 +8.33%p 향상.
- GPT 훈련 최적화 — 목표 validation bits-per-byte 도달 속도 Autoresearch 대비 1.9배, 단일 에이전트가 0개인 상황에서 7개 개선 발견.
- ProteinGym — ACE2-Spike 결합 예측에서 Spearman 상관계수 +12.5% 개선, 전체 217개 assay 평균 +6.5%.
방법
- 분산형 구조 — 에이전트들이 공유 실험 상태를 기반으로 자율적으로 팀을 구성하고, 가설을 제안한 후 실험 전에 비판하며, 성공/실패를 공유해 중복 탐색을 줄입니다.
- 중앙 계획자 없이 에이전트들이 동적으로 역할을 분담하며, 실험 증거에 따라 적응하는 점이 핵심입니다.
한계·조건
- 범위 — 모든 실험이 컴퓨테이셔널 환경에서만 검증되어, 습식 실험 등 물리적 실험에는 적용이 불확실합니다.
- 비용 — 다중 에이전트 통신 오버헤드가 존재하며, 대규모 실험에서는 추가적인 리소스가 필요할 수 있습니다.
- 재현성 — 코드와 설정이 공개되지 않아 재현성 확인이 아직 어렵습니다.
편집자 한 줄
분산형 에이전트 협업이 장기 과학 실험에서 유의미한 성과를 냈다는 점이 인상적입니다. 다만 실제 연구 현장에 적용되려면 물리 실험과의 통합이 과제로 남아 있습니다.
- #ai-agents
- #scientific-discovery
- #harvard
- #biomedical
- #language-model-optimization
Harvard University