AI 데이터 센터 아키텍처의 전문화
요구 사항의 차이는 뚜렷합니다. 예를 들어, 스토리지 랙은 AI에 사용되는 고밀도 컴퓨팅 랙보다 훨씬 적은 전력과 네트워킹을 필요로 합니다.
이러한 아키텍처적 변화는 비효율성을 최소화하며, AI 시대에는 지속 불가능한 초기 데이터 센터 설계에서 흔했던 유연성을 위해 과도하게 구축하는 관행에서 벗어납니다.
Amin Vahdat은 맞춤형 칩부터 지속 가능한 전력 솔루션까지 Google의 특화된 AI 인프라 전략을 설명합니다.
요구 사항의 차이는 뚜렷합니다. 예를 들어, 스토리지 랙은 AI에 사용되는 고밀도 컴퓨팅 랙보다 훨씬 적은 전력과 네트워킹을 필요로 합니다.
이러한 아키텍처적 변화는 비효율성을 최소화하며, AI 시대에는 지속 불가능한 초기 데이터 센터 설계에서 흔했던 유연성을 위해 과도하게 구축하는 관행에서 벗어납니다.
AI 인프라에서 초당 부동 소수점 연산(flops)과 같은 이론적 지표는 실제 워크로드 성능을 정확하게 반영하지 못합니다.
대신 Google은 잠재적 실패를 고려한 후 작업을 완료하는 데 걸리는 유효 시간을 측정하는 '굿풋(goodput)'을 우선시합니다.
100,000개 이상의 가속기로 구성된 대규모 시스템은 지속적인 실패율에 직면하므로, 안정성과 빠른 복구가 전체 효율성에 중요합니다.
따라서 AI 컴퓨팅 클러스터의 진정한 효율성은 최고 이론적 벤치마크가 아닌, 내재된 시스템 불안정성에도 불구하고 일관된 성능을 제공하는 능력으로 정의됩니다.
현대 AI 칩은 단일 모놀리식 유닛이 아니라 여러 칩렛, 고대역폭 메모리(HBM), 공동 패키징된 광학 장치로 구성된 복잡한 어셈블리인 경우가 많습니다.
Vahdat은 수십만 개의 이러한 구성 요소로 클러스터를 관리하는 것이 끊임없는 실패로 이어진다고 언급하며, 원격 측정 문제를 건초 더미에서 바늘을 계속 찾는 것에 비유했습니다.
대규모 AI 워크로드의 높은 동기화 특성은 단일 지점 실패가 전체 시스템을 중단시킬 수 있음을 의미하며, 강력한 복구 메커니즘의 필요성을 강조합니다.
AI 인프라의 목표는 6개월마다 유효 서비스 용량을 두 배로 늘리는 것이며, 용량은 단순히 원시 flops가 아니라 토큰을 생성하는 능력으로 측정됩니다.
Google의 전략은 이러한 이득의 상당 부분, 어쩌면 더 많은 부분이 하드웨어 발전뿐만 아니라 소프트웨어 최적화에서 나올 것임을 강조합니다.
이를 달성하려면 모델, 런타임 시스템, 하드웨어 아키텍처 전반에 걸친 개선의 조합이 필요하며, AI 개발의 상호 의존적 특성을 강조합니다.
Google이 별도의 8i(추론) 및 8t(훈련) 칩을 개발하기로 결정한 것은 상당한 시장 성장 전망에 기반한 것이며, 워크로드별 전문화를 향한 전략적 움직임을 반영합니다.
전문화는 효율성을 높이지만, 본질적으로 유연성을 감소시키므로 상당한 워크로드가 새로운 칩 개발 프로그램과 관련된 상당한 고정 비용을 정당화할 만큼 충분히 지속 가능해야 합니다.
설계는 부분적 중복을 통합하여 예측 위험을 완화하며, 추론 및 훈련 칩 모두 서로의 워크로드를 어느 정도 처리할 수 있도록 합니다.
이러한 접근 방식은 특정 워크로드가 단명하더라도 특화된 하드웨어가 유용성을 유지하여 투자를 실행 가능하게 만듭니다.
현대 AI 모델은 근본적으로 행렬 곱셈 및 소프트맥스 연산과 같은 선형 대수 기본 요소에 의존합니다.
하드웨어 설계자들은 일반적인 트랜스포머 아키텍처뿐만 아니라 개별 모델의 특정 형태, 레이어 수 및 차원에 맞춰 칩을 점점 더 최적화하고 있습니다.
이러한 추세는 컴퓨팅 자원을 특정 AI 모델의 고유한 요구 사항에 직접 맞춰 훨씬 더 큰 하드웨어 전문화로 나아가고 있음을 의미합니다.
이러한 긴밀한 상호 작용은 모델 수준 최적화가 충분한 이점을 보여줄 경우 진행 중인 칩 아키텍처를 수정할 수 있도록 하여, 하드웨어가 진화하는 AI 요구 사항을 직접 지원하도록 보장합니다.
회사는 개념부터 생산까지 다년간의 5~6단계 파이프라인을 사용하지만, 연구원들은 상당한 성능 개선이 확인되면 '테이프아웃' 단계를 종종 연기하여 최적의 설계에 대한 약속을 강조합니다.
이러한 통합 접근 방식은 Google AI 인프라의 효율성과 효과를 극대화하는 것을 목표로 합니다.
이는 AI 기반 하드웨어 개발을 향한 중요한 단계이며, 현재 AI 모델이 미래 AI 혁신을 지원하는 인프라에 기여하는 공생 관계를 형성합니다.
Amin Vahdat은 TPU 아키텍처의 근본적인 안정성을 인용하며 미래 AI 워크로드 예측이 가능하다고 주장합니다.
Google의 Tensor Processing Unit의 핵심 원칙은 TPU v1 이후로 거의 일관되게 유지되어 견고한 설계 기반을 보여줍니다.
행렬 곱셈 장치, 벡터 연산을 위한 희소 코어, 원격 로드/저장 기능과 같은 핵심 기본 요소는 여러 세대의 모델과 알고리즘을 성공적으로 지원했습니다.
이러한 일관된 아키텍처 기반은 Google이 미래 AI 인프라 요구 사항을 예측하고 계획할 수 있도록 어느 정도의 예측 가능성을 제공합니다.
데이터 센터에서 CPU 랙을 GPU 및 TPU 랙과 함께 통합하는 것은 각 구성 요소의 밀도 및 네트워크 요구 사항이 크게 다르기 때문에 완전한 전문화를 방해합니다.
이러한 랙을 다른 건물로 분리하면 더 큰 전문화가 가능하지만, 네트워크 복잡성, 지연 시간 및 비용이 증가합니다.
건물 간 네트워킹은 중요한 문제가 되며, 지연 시간이 수백 마이크로초에 달할 수 있어 분산 AI 워크로드의 성능에 영향을 미칩니다.
이러한 절충점은 AI 컴퓨팅을 위한 최적의 성능과 효율성을 달성하기 위해 건물 설계 및 네트워킹 인프라에서 어려운 선택을 강요합니다.
Amin Vahdat은 전력을 AI 인프라 개발이 직면한 가장 근본적이고 구속력 있는 제약으로 지목합니다.
업계는 미래 수요를 충족하기 위해 기가와트 규모의 에너지가 필요할 것으로 예상하면서 장기 계획 문제에 씨름하고 있습니다.
원자력 에너지는 이러한 전력 제약을 해결할 잠재적인 미래 솔루션으로 간주되지만, 확장성과 배포 일정은 불확실합니다.
이 핵심 과제를 해결하려면 AI의 기하급수적인 성장을 유지하기 위해 에너지 생성 및 관리에 상당한 혁신과 투자가 필요합니다.
대규모 AI 인프라의 경우 1+1 모델로 중복 전력 용량을 구축하는 것은 엄청나게 비쌉니다.
Google의 전략은 전력망과 협력하여 주거용 수요가 최고조에 달하는 기간 동안 회사가 여분의 전력을 다시 공급할 수 있도록 하는 것입니다.
훨씬 더 큰 기반에서 통계적 다중화를 활용하는 이 접근 방식은 자원 활용을 최적화하여 Google, 유틸리티 그리드 및 지역 주민 모두에게 상호 이점을 창출합니다.
추론 작업은 대륙 간 사용자에게 로컬 용량과 낮은 지연 시간을 보장하기 위해 지리적 분산이 필수적입니다.
결과적으로 추론을 처리하는 서비스 클러스터는 훈련 클러스터에 비해 저장, 컴퓨팅 및 네트워킹 자원의 다른 균형을 필요로 하는 경우가 많습니다.
Google의 칩 감가상각 수명은 약 6년이지만, 이러한 오래된 장치는 컴퓨팅 워크로드에 완전히 참여하고 있습니다.
이는 최신 칩보다 효율성은 떨어지더라도 레거시 하드웨어조차도 전체 컴퓨팅 용량에 크게 기여한다는 것을 보여줍니다.
Google의 하드웨어 엔지니어들은 소프트웨어 엔지니어만큼이나 자주 AI 도구를 사용하여 생산성을 크게 높이고 있습니다.
AI의 통합은 설계 시작부터 테이프아웃까지 필요한 시간을 단축하고, 하드웨어 시작 시간을 줄이고 있습니다.
AI는 또한 복잡한 데이터 센터 설계 및 계획 프로세스를 간소화하여 인프라 개발 전반의 효율성을 최적화하는 데 사용되고 있습니다.
Vahdat은 AI가 이러한 중요한 엔지니어링 기능에서 인간의 판단을 대체하는 것이 아니라 보강하는 보조 역할을 한다고 설명했습니다.
Amin Vahdat은 2036년까지 더욱 긴밀하게 통합된 랙 규모 슈퍼컴퓨팅 장치로의 상당한 변화를 예측합니다.
미래의 랙은 중앙에서 제조되며 멀티 메가와트 모듈형 구성 요소로 기능하여 배포를 '플러그 앤 플레이' 설치 프로세스로 단순화할 것으로 예상됩니다.
이러한 통합은 랙 내 광섬유 연결 사용의 상당한 감소로 이어질 가능성이 높으며, 더 효율적인 내부 통신 메커니즘으로 대체될 것입니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
Sequoia Capital의 다음 글도 받아볼까요?
Sequoia Capital에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.