현대 AI 워크로드에 대한 지연 시간의 영향 증가
높은 지연 시간, 특히 작은 메시지의 경우, 강력한 GPU 장치가 동기화를 기다리는 데 상당한 시간을 소비하므로 GPU 리소스의 상당한 낭비로 이어집니다. John Ousterhout은 라이브 청중 투표를 통해 지연 시간으로 인한 이러한 업계 전반의 어려움을 확인했으며, 이는 AI 개발 전반에 걸쳐 만연한 문제를 나타냅니다.
스탠포드의 HOMA 프로토콜은 네트워크 전송에 대한 새로운 접근 방식을 제공하여 현재 AI 워크로드에 만연한 중요한 지연 및 혼잡 문제를 해결합니다.
높은 지연 시간, 특히 작은 메시지의 경우, 강력한 GPU 장치가 동기화를 기다리는 데 상당한 시간을 소비하므로 GPU 리소스의 상당한 낭비로 이어집니다. John Ousterhout은 라이브 청중 투표를 통해 지연 시간으로 인한 이러한 업계 전반의 어려움을 확인했으며, 이는 AI 개발 전반에 걸쳐 만연한 문제를 나타냅니다.
여러 노드가 단일 대상으로 동시에 데이터를 전송하는 인캐스트는 네트워크 혼잡의 주요 원인으로 식별됩니다. 이 현상으로 인해 작은 메시지가 스위치 큐 내의 더 긴 메시지 뒤에 갇히게 됩니다. 결과적인 버퍼 소진은 패킷 손실을 초래하고 비용이 많이 드는 재전송 주기를 필요로 하여 네트워크 비효율성을 악화시킵니다.
역사적으로 TCP 및 RDMA를 포함한 네트워크 프로토콜은 혼잡 관리를 송신자에게 위임했습니다. 이전 방법은 패킷 손실을 감지하여 혼잡을 추론하고 송신자가 전송 속도를 늦추도록 했습니다. 보다 현대적인 접근 방식은 스위치가 패킷을 표시하여 송신자에게 네트워크 압력을 알리는 피드백 메커니즘으로 명시적 혼잡 알림(ECN)을 사용합니다.
랙 상단 스위치는 인그레스 포트의 큐 길이가 미리 정의된 임계값에 도달했음을 감지하면 모든 후속 패킷에 ECN 태그를 표시하기 시작합니다. 이러한 표시된 패킷이 수신기에 도착하면 수신기는 이 ECN 표시를 추출하고 후속 확인 전송 중에 원래 송신자에게 알립니다.
반응형 혼잡 제어 메커니즘은 정보 부족으로 인해 심각한 불안정성에 직면합니다. 송신자는 단일 비트의 혼잡 데이터만 수신합니다. 속도 조정을 위해 여러 왕복이 필요한 이 제어 지연은 여러 송신자가 동일한 대상으로 동시에 조정을 시도하면서 더욱 복잡해집니다. 이러한 네트워크 변동성으로 인해 전송 속도의 안정적인 수렴을 달성하는 것이 거의 불가능합니다.
이 채널, 다음 영상도 놓치지 마세요
새 영상이 올라오면 지금처럼 읽기 좋은 아티클로 정리해 이메일로 보내 드려요.
언제든 구독을 끌 수 있어요.
이러한 비효율성은 네트워크 내에서 상당한 큐 구축으로 이어지며, 이는 20년 이상 연구에서 인식되어 온 문제입니다. 혼잡은 지연이 이미 발생한 후에만 감지되므로 사전 관리가 어렵습니다.
TCP 및 RDMA 프로토콜은 개별 메시지 간의 본질적인 차등이 없는 연속적인 바이트 스트림 모델에서 작동합니다. 이 설계는 송신자가 짧은 메시지를 효과적으로 우선순위화하는 것을 방지합니다. 결과적으로 헤드 오브 라인 차단이 발생하여 작고 시간에 민감한 메시지가 크고 덜 긴급한 데이터 흐름 뒤에 갇히게 되어 고성능 컴퓨팅 환경에서 상당한 비효율성을 초래합니다.
핵심 초점은 현대 AI 클러스터의 중요한 요구 사항인 크고 작은 메시지의 다양한 혼합을 효과적으로 관리하는 것입니다.
HOMA는 Benam Montazeri의 박사 학위 논문에서 시작되었으며 Linux 커널 모듈로 구현되었습니다. Ousterhout은 현재 커널에 업스트림하는 과정을 진행 중이며, GitHub에서 다운로드하고 실험할 수 있도록 쉽게 사용할 수 있습니다.
HOMA의 아키텍처는 스트림 기반이 아닌 메시지 기반이며, 기본 단위는 RPC(원격 프로시저 호출)입니다. 이 설계를 통해 HOMA는 메시지 길이 정보를 전송 계층까지 전달할 수 있습니다. 메시지 길이를 알면 HOMA는 첫 번째 패킷 수신 시 데이터 볼륨을 예측하고 SRPT(최단 남은 처리 시간 우선) 스케줄링을 사용하여 짧은 메시지를 효과적으로 우선순위화할 수 있습니다.
HOMA의 주요 차이점은 혼잡 제어에 대한 수신자 중심 접근 방식입니다. 혼잡은 주로 수신자의 다운링크에서 발생하며, 수신자에게 들어오는 데이터 볼륨에 대한 완전하고 우수한 정보를 제공합니다. 이 포괄적인 지식을 통해 HOMA는 송신자 중심 방법보다 혼잡 이벤트에 더 빠르고 정확하게 응답하여 네트워크 흐름을 보다 효과적으로 최적화할 수 있습니다.
HOMA는 크레딧 기반 부여 시스템을 사용하며, 여기서 송신자는 메시지를 초기 '예약되지 않은' 패킷과 후속 '예약된' 패킷으로 분할합니다. 수신자는 부여 패킷을 전송하여 이 예약된 데이터의 전송을 트리거합니다. 이 메커니즘을 통해 수신자는 부여를 전략적으로 지연시켜 혼잡이 발생하기 전에 방지하고, 짧은 메시지를 자연스럽게 우선순위화하여 SRPT 논리를 효과적으로 구현할 수 있습니다.
HOMA는 일반적으로 8개의 여러 이그레스 큐를 특징으로 하는 현대 데이터 센터 스위치를 활용하여 트래픽 우선순위를 동적으로 지정합니다. 패킷 헤더를 기반으로 메시지를 이러한 큐에 할당하여 짧은 메시지가 더 높은 우선순위 큐로 푸시되도록 합니다. 이 기능은 짧고 시간에 민감한 메시지가 더 긴 데이터 흐름을 선점할 수 있도록 하여 기존 프로토콜을 괴롭히는 헤드 오브 라인 차단을 효과적으로 줄입니다.
50바이트에서 1메가바이트까지의 메시지 크기를 벤치마킹한 결과 HOMA가 TCP보다 우수한 성능을 보이는 것으로 나타났습니다. 짧은 메시지의 경우 HOMA는 TCP보다 P99 꼬리 지연 시간이 13배 더 빠르며 중요한 지연을 크게 줄입니다. 놀랍게도 HOMA는 긴 메시지의 성능도 향상시켜 TCP보다 거의 두 배 빠른 속도를 제공합니다. 이는 HOMA의 '완료 실행' 접근 방식이 우선순위에 관계없이 짧은 메시지가 긴 메시지에 의해 지연되는 경우가 많은 TCP의 공정한 스케줄링을 능가한다는 것을 보여줍니다.
Ousterhout은 AI 클러스터에서 짧은 메시지의 중요성이 커지고 있음을 강조하고 엔지니어들에게 짧은 메시지 지연 시간이 시스템의 병목 현상인지 평가하도록 권장합니다. 그는 HOMA의 개발 및 채택에 현재 경력을 바치고 있으며, 성공적인 구현을 보장하기 위해 협력, 디버깅 및 기술 지원을 위해 관심 있는 당사자에게 연락하도록 초대합니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
AI Engineer의 다음 영상도 받아볼까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 28편 올렸어요.
숏츠는 빼고 보내 드려요. 메일이 필요 없어지면 언제든 구독을 끄실 수 있어요.