← Back to feed
Papers·1개월 전

게임 이론으로 분석한 disaggregated inference — Dynamo 기반 PoA-hat 3.1x 개선

게임 이론으로 분석한 disaggregated inference — Dynamo 기반 PoA-hat 3.1x 개선

NVIDIA Dynamo 아키텍처를 게임 이론으로 분석해, prefill/decode 자원 경쟁, KV cache 캐싱, 요청 라우팅을 세 가지 게임으로 모델링했습니다. 3노드 B200 클러스터에서 Llama-3.1-70B 1P/5D 토폴로지의 포화 구간에서 PoA-hat을 66.4에서 21.5로 3.1x 낮췄고, TTFT P99는 7.6x 개선했습니다. 단, 13% throughput 감소가 따릅니다.

Disaggregated inference 아키텍처를 게임 이론 틀로 분석해, 포화 구간에서 라우팅을 적응형으로 제어하는 컨트롤러를 제안한 논문입니다.

핵심 결론

  • 분석 대상NVIDIA Dynamo 기반 disaggregated inference — prefill/decode 풀이 GPU 예산을 공유하는 구조.
  • 최대 개선Llama-3.1-70B 1P/5D 토폴로지 포화 구간에서 PoA-hat 3.1x 감소 (66.4 → 21.5), TTFT P99 7.6x 개선.
  • 비용Throughput 13% 감소 — 개선과 트레이드오프가 있는 점이 단서입니다.

방법

  • 게임 모델세 가지 게임으로 분해: (1) prefill vs decode 자원 게임, (2) 계층형 KV cache의 이기적 캐싱 게임, (3) 긍정적 외부효과를 가진 혼잡 게임.
  • 적응형 제어포화 전환을 실시간 감지해 라우팅 파라미터를 조정 — 캐시 선호에서 부하 균형으로 전환.
  • 실험 환경3노드 NVIDIA B200 클러스터, Nemotron-4-340B (TP=8) 및 Llama-3.1-70B (TP=4) 사용.

한계·조건

  • 분석 범위Prefill/decode 자원 게임은 이론적 분석에 그치고, 캐싱 및 라우팅 게임만 실증 검증.
  • 벤치마크두 모델에서 동일한 세 구간 PoA-hat 구조를 확인했지만, 더 다양한 모델/스케일에서의 일반화는 추가 검증 필요.
  • 코드 공개논문에서 코드 공개 여부는 명시되지 않았습니다.

편집자 한 줄

게임 이론을 inference 시스템에 적용한 점이 신선하지만, throughput 손실이 있는 만큼 실제 배포 시 운영 목표에 따라 선택이 갈릴 만합니다.

  • #disaggregated-inference
  • #game-theory
  • #nvidia-dynamo
  • #llama
  • #kv-cache
Athos Georgiou
원문 보기 →

Comments

— 첫 댓글을 남겨보세요 —