지연 시간 감소를 위한 VM 엔진과 스케줄링 및 라우팅 정렬
원본 영상 5:40추론 엔진과 라우팅 계층 간의 조정을 최적화하는 것은 특히 지연 시간이 주요 스케줄링 매트릭스가 될 때 매우 중요합니다. 지연 시간을 보조적이거나 나중에 고려하는 지표로 여기던 것에서 벗어나 접두사 라우팅 조정의 필요성을 강조합니다. 이러한 조정은 효율적인 스케줄링과 대규모 언어 모델 추론이 최소한의 지연으로 작동하도록 보장하는 데 필수적입니다.
Red Hat의 Yuchen Fama와 Ashish Kamra는 쿠버네티스에서 대규모 언어 모델 추론을 최적화하기 위한 고급 전략을 자세히 설명하며, 특히 지연 시간, 처리량 및 비용 효율성에 중점을 둡니다.
이 채널 새 영상도 이렇게 정리해 드릴까요?
추론 엔진과 라우팅 계층 간의 조정을 최적화하는 것은 특히 지연 시간이 주요 스케줄링 매트릭스가 될 때 매우 중요합니다. 지연 시간을 보조적이거나 나중에 고려하는 지표로 여기던 것에서 벗어나 접두사 라우팅 조정의 필요성을 강조합니다. 이러한 조정은 효율적인 스케줄링과 대규모 언어 모델 추론이 최소한의 지연으로 작동하도록 보장하는 데 필수적입니다.
관련된 막대한 경제적 이해관계 때문에 KV 캐시 처리량을 별도로 측정하는 것이 필수적입니다. 예를 들어, Anthropic API 가격 책정은 캐시된 토큰과 캐시되지 않은 토큰 간에 10배의 비용 차이를 명확하게 보여줍니다. 이 상당한 차이는 KV 캐시의 효율적인 관리 및 추적이 대규모 언어 모델 서비스에 의존하는 비즈니스 모델의 재정적 생존 가능성에 직접적인 영향을 미친다는 것을 의미합니다.
LLMD 라우터는 유연한 EP(엔드포인트 피커) 플러그인을 사용하여 KV 캐시 지역성 및 로드 기준을 충족하는 최적의 파드에 요청을 라우팅합니다. 이 EP 플러그인은 파드를 적극적으로 탐색하여 실행 중이거나 대기 중인 요청, KV 캐시 가용성 등 현재 상태를 평가합니다. 라우팅 로직은 가장 낮은 로드와 가장 높은 캐시 적중 확률을 가진 파드를 우선하여 효율적인 리소스 활용 및 지연 시간 단축을 보장합니다.
현재 노력은 NVMe SSD 및 파일 시스템 XF를 사용하여 오프로딩 계층을 포함한 보다 정교한 KV 캐시 관리 구현에 중점을 둡니다. 이는 또한 저장 효율성을 높이기 위해 Mooncake와 같은 KV 중심 저장소를 통합하는 것을 포함합니다. 또한 우선 순위 기반 제거 및 세션 고정과 같은 더 스마트한 세션 인식 제거 정책이 캐시 활용 및 성능을 최적화하기 위해 구현되고 있습니다. 이러한 기술은 핫, 웜, 콜드 캐시 계층을 효과적으로 관리하는 것을 목표로 합니다.
KV 캐시 인식 라우팅의 실용적인 예는 성능 이점을 보여줍니다. 첫 번째 요청이 전송되면 KV 캐시를 채우고 처리하는 데 약 3초가 걸립니다. 그러나 후속 요청이 동일한 시스템 프롬프트를 재사용하여 KV 캐시에 적중하면 처리 시간이 약 1초로 크게 줄어듭니다. 반대로 시스템 프롬프트를 변경하면 3초 지연이 발생하며, 이는 다른 파드 주소에서 캐시 적중이 발생하지 않았음을 나타내어 캐시 재사용으로 인한 효율성 향상을 강조합니다.
접두사 라우팅 및 KV 캐시 라우팅이 TTFT(Time To First Token) 문제를 효과적으로 해결하고 전체 처리량을 개선하는 반면, 에이전트 워크로드는 더 많은 것을 요구합니다. 이러한 복잡한 작업의 경우 주요 관심사는 TTFT를 넘어 토큰 간 지연 시간을 최적화하는 것으로 바뀝니다. 이는 토큰 생성 간의 복잡한 타이밍 요구 사항을 관리하기 위해 프리필/디코드 분리와 같은 특수 솔루션이 필요합니다.
LLMD는 고성능 쿠버네티스 네이티브 분산 LLM 추론 프레임워크이며, 현재 비쿠버네티스 환경과도 호환되며 CNCF 산하에서 호스팅됩니다. 이는 에이전트 시대를 위해 특별히 설계된 통합 제어 평면을 제공하여 복잡한 추론 워크로드를 용이하게 합니다. 이 아키텍처는 리더-워커 세트와 같은 워크로드 API를 활용하여 다중 노드 모델 실행을 오케스트레이션합니다. 또한 지능형 자동 스케일러는 실시간 트래픽을 지속적으로 모니터링하여 다양한 요구에 맞춰 파드를 독립적으로 확장할 수 있도록 합니다.
기존의 집계된 서빙에서는 단일 파드가 TTFT(Time To First Token) 및 토큰 간 지연 시간을 모두 최적화할 책임이 있습니다. 그러나 Prefill/Decode(P/D) 분리는 프리필 및 디코드 단계를 독립적으로 확장할 수 있도록 하여 이를 근본적으로 변경합니다. 이 분리는 각 단계에 특수 리소스를 할당하여 성능 병목 현상을 해결하여 보다 효율적이고 반응적인 LLM 추론으로 이어집니다.
동일한 GPU에 프리필 및 디코드 작업을 함께 배치하면 단계 간섭이라는 문제가 발생하여 성능을 크게 저하시킵니다. 프리필 작업은 계산 집약적이며 대규모 배치 병렬 처리의 이점을 얻는 반면, 디코드 작업은 메모리 대역폭을 많이 사용하고 지연 시간에 매우 민감합니다. 이러한 별개의 작업이 동일한 GPU를 공유하면 서로 간섭하여 성능 저하 및 예측할 수 없는 실행 지터가 발생합니다. 이러한 충돌은 각 단계를 독립적으로 최적화하기 위한 특수 처리의 필요성을 강조합니다.
프리필/디코드(P/D) 분리 워크플로우에서 들어오는 요청은 먼저 게이트웨이 라우터에 도달합니다. 이 라우터는 엔드포인트 피커를 사용하여 클러스터 상태를 동적으로 평가하고 P/D 분리를 활용하도록 요청을 스케줄링하여 최적의 프리필 및 디코드 워커를 선택합니다. 프리필 워커는 초기 KV 캐시를 구성하는 역할을 하며, 디코드 워커는 네트워크 패브릭을 통해 필요한 KV 캐시 데이터를 나중에 가져옵니다. 이 조정된 프로세스는 각 단계에 대한 효율적인 작업 분배 및 특수 처리를 보장합니다.
실험 결과는 P/D 분리가 표준 집계 배포에 비해 상당한 성능 향상을 보여줍니다. 집계 배포에서 P99 토큰 간 지연 시간(ITL)은 900밀리초 부근에서 변동하며 눈에 띄는 변화가 있습니다. 반대로 P/D 배포는 약 100밀리초의 P99 ITL을 달성하여 거의 9배의 개선을 나타냅니다. 또한 P/D 결과는 훨씬 더 부드럽고 안정적인 성능을 보여주며 더 큰 일관성과 신뢰성을 나타냅니다.
프리필/디코드(P/D) 분리는 특히 동시성 환경의 중간 지점에서 빛을 발합니다. 표준 쿠버네티스 스케줄링이 기준선 역할을 하는 반면, KV 캐시 인식 라우팅만으로도 표준 집계보다 성능 향상을 제공합니다. 그러나 P/D 분리는 이러한 중간 범위의 동시성 내에서 가장 큰 이점을 보여주며 다른 방법과 비교하여 우수한 효율성과 지연 시간 단축을 제공합니다.
P/D 분리는 본질적으로 보편적인 솔루션이 아닌 단계 분리 절충점이며, 모든 시나리오에 대한 만병통치약은 아닙니다. 특히 높은 입력 대 출력 비율을 가진 긴 컨텍스트를 관리하는 데 가장 적합하며, 별개의 단계가 개별 최적화의 이점을 얻습니다. 이 접근 방식은 이점을 완전히 활용하기 위해 복잡한 모델 병렬 처리가 가능한 대규모 모델이 필요합니다. 또한 P/D 분리는 토큰 생성 간의 지연 시간을 최소화하는 것이 중요한 엄격한 토큰 간 지연 시간(ITL) 요구 사항이 있는 사용 사례에 이상적입니다.
특히 KV 캐시 전송을 위한 분산 서빙은 RDMA 또는 RoCE와 같은 고급 고속 네트워크 패브릭을 필요로 합니다. 이러한 강력한 네트워크 인프라 없이는 분산의 이점을 완전히 실현할 수 없으며, 집계된 서빙이 더 적합한 옵션일 수 있습니다. 분산 서빙 채택 결정은 컨텍스트 길이, 모델 크기 및 동시성과 같은 요소의 영향을 받으며, 이는 전문화된 네트워크 솔루션 구현의 타당성과 효율성을 종합적으로 결정합니다.
복잡한 LLM 서빙 플랫폼을 설계하려면 고도로 다차원적인 공간 내에서 수많은 설계 요소를 균형 있게 조정해야 합니다. 스케줄러는 요청을 최적으로 라우팅하기 위해 SLO(Service Level Objective) 목표, QEP(Quality of Experience Parameters), KV 캐시 지역성 지표, Prefill/Decode(P/D) 비율 및 네트워크 토폴로지를 지속적으로 평가해야 합니다. 트래픽 패턴이 진화함에 따라 동적 P/D 속도 일치가 중요하며, 효율성을 유지하기 위해 지속적인 조정이 필요합니다. P/D 풀의 독립적인 확장은 리소스 최적화에도 필수적이며, 프리필 및 디코드 단계가 특정 요구 사항에 따라 프로비저닝될 수 있도록 보장합니다. 또한 플랫폼 아키텍트는 파이프라인, 텐서 및 데이터 병렬 처리와 같은 기술을 포함하여 다양한 워크로드 및 모델 복잡성에 적응하기 위해 모델 병렬 처리 전략을 지속적으로 조정해야 합니다. 이러한 복잡한 요소들의 상호 작용은 LLM 서빙에서 고성능 및 비용 효율성을 달성하기 위한 유연하고 적응적인 아키텍처 설계가 필요합니다.
H200 클러스터의 GLM 5.2와 관련된 사례 연구에서, 에이전트 워크로드를 최적화하기 위해 모듈형 병렬 처리 접근 방식이 구현되었습니다. 이러한 워크로드는 LLMD에서 흔히 '와일드 경로'라고 불리는 무거운 프리필 단계가 특징입니다. 이 설계는 다양한 병렬 처리 전략을 통합하여 프리필 경로의 독립적인 확장을 허용했습니다. 특히 프리필 풀은 집약적인 프리필 요구 사항을 처리하기 위해 높은 처리량에 최적화된 최대 3개의 워커로 구성되었습니다. 디코드 단계의 경우 낮은 지연 시간에 특별히 최적화된 하나의 전용 워커가 활용되었습니다. 이 모듈형 아키텍처는 디코드 워커를 재구성할 필요 없이 처리량 확장을 가능하게 하여 유연성과 효율성을 제공합니다. 또한 실험 결과 BF16 KV 캐시가 긴 프리필 작업에서 FP8보다 빠르게 수행되어 이러한 복잡한 에이전트 시나리오에서 전반적인 성능 향상에 기여했습니다.
프리필 대 출력 비율이 45:1로 높은 에이전트 워크로드 데이터셋의 경우 프리필이 종종 주요 제약 조건으로 작용합니다. 두 개의 프리필 워커와 하나의 디코드 워커(2P, 1D)로 구성된 구성을 사용하여 TTFT(Time To First Token)가 4배 가속화되고 처리된 요청이 60% 증가하는 등 상당한 성능 향상이 관찰되었습니다. 앞으로는 LLMD 프레임워크 내에서 세션 그래프 오케스트레이션을 강화하고 상태 재사용을 개선하는 데 중점을 둘 것입니다. LLMD의 현재 오픈소스 개발에는 Google, IBM, NVIDIA와 같은 주요 생태계 파트너가 참여하여 빠르게 진화하는 이 분야에서 협력적인 혁신을 촉진하고 있습니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
이 채널 새 영상도 이렇게 정리해 드릴까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 24편 올렸어요.
숏츠는 빼고 보내 드려요. 메일이 필요 없어지면 언제든 구독을 끄실 수 있어요.
The Death of Developer Advocates: How AI Agents Are Reshaping DevRelAI Engineer1일 전 게시 · 18:16 · 조회 88 · 1일 전 생성
Cloudflare Leverages AI Agents to Double GTM Team EfficiencyAI Engineer1일 전 게시 · 19:15 · 조회 12 · 1일 전 생성
Exa Co-founder Jeffrey Wang Advocates for AI-Driven Go-to-Market StrategiesAI Engineer1일 전 게시 · 18:49 · 조회 67 · 1일 전 생성