Papers·1개월 전
게임 이론으로 분석한 disaggregated inference — Dynamo 기반 PoA-hat 3.1x 개선

NVIDIA Dynamo 아키텍처를 게임 이론으로 분석해, prefill/decode 자원 경쟁, KV cache 캐싱, 요청 라우팅을 세 가지 게임으로 모델링했습니다. 3노드 B200 클러스터에서 Llama-3.1-70B 1P/5D 토폴로지의 포화 구간에서 PoA-hat을 66.4에서 21.5로 3.1x 낮췄고, TTFT P99는 7.6x 개선했습니다. 단, 13% throughput 감소가 따릅니다.
Disaggregated inference 아키텍처를 게임 이론 틀로 분석해, 포화 구간에서 라우팅을 적응형으로 제어하는 컨트롤러를 제안한 논문입니다.
핵심 결론
- 분석 대상 — NVIDIA Dynamo 기반 disaggregated inference — prefill/decode 풀이 GPU 예산을 공유하는 구조.
- 최대 개선 — Llama-3.1-70B 1P/5D 토폴로지 포화 구간에서 PoA-hat 3.1x 감소 (66.4 → 21.5), TTFT P99 7.6x 개선.
- 비용 — Throughput 13% 감소 — 개선과 트레이드오프가 있는 점이 단서입니다.
방법
- 게임 모델 — 세 가지 게임으로 분해: (1) prefill vs decode 자원 게임, (2) 계층형 KV cache의 이기적 캐싱 게임, (3) 긍정적 외부효과를 가진 혼잡 게임.
- 적응형 제어 — 포화 전환을 실시간 감지해 라우팅 파라미터를 조정 — 캐시 선호에서 부하 균형으로 전환.
- 실험 환경 — 3노드 NVIDIA B200 클러스터, Nemotron-4-340B (TP=8) 및 Llama-3.1-70B (TP=4) 사용.
한계·조건
- 분석 범위 — Prefill/decode 자원 게임은 이론적 분석에 그치고, 캐싱 및 라우팅 게임만 실증 검증.
- 벤치마크 — 두 모델에서 동일한 세 구간 PoA-hat 구조를 확인했지만, 더 다양한 모델/스케일에서의 일반화는 추가 검증 필요.
- 코드 공개 — 논문에서 코드 공개 여부는 명시되지 않았습니다.
편집자 한 줄
게임 이론을 inference 시스템에 적용한 점이 신선하지만, throughput 손실이 있는 만큼 실제 배포 시 운영 목표에 따라 선택이 갈릴 만합니다.
- #disaggregated-inference
- #game-theory
- #nvidia-dynamo
- #llama
- #kv-cache
Athos Georgiou