엔비디아, 게임 하드웨어에서 AI 독점으로의 전환
원본 영상 0:00원래 컴퓨터 게임용 3D 그래픽을 구현하는 칩 생산으로 알려진 엔비디아는 세계에서 가장 가치 있는 회사 중 하나로 변모했습니다. 이 회사는 현재 매일 사용되는 인공지능 도구의 압도적인 대부분에 컴퓨팅 파워를 제공하고 있습니다.
이러한 변화는 엔비디아를 지능형 컴퓨팅 분야에서 거의 독점적인 위치에 올려놓았으며, 이는 주로 CUDA 플랫폼과 전략적 사업 계약 덕분입니다.
오픈AI, 애플, 화웨이가 맞춤형 칩을 개발하며 엔비디아의 AI 하드웨어 독점력을 위협하고 시장 역학의 변화를 촉진하고 있습니다.
이 채널 새 영상도 이렇게 정리해 드릴까요?
원래 컴퓨터 게임용 3D 그래픽을 구현하는 칩 생산으로 알려진 엔비디아는 세계에서 가장 가치 있는 회사 중 하나로 변모했습니다. 이 회사는 현재 매일 사용되는 인공지능 도구의 압도적인 대부분에 컴퓨팅 파워를 제공하고 있습니다.
이러한 변화는 엔비디아를 지능형 컴퓨팅 분야에서 거의 독점적인 위치에 올려놓았으며, 이는 주로 CUDA 플랫폼과 전략적 사업 계약 덕분입니다.
오픈AI 및 앤스로픽과 같은 주요 기술 기업들은 엔비디아에 대한 의존성으로 인해 특히 필수 AI 하드웨어의 잠재적 가격 인상과 관련하여 상당한 위험에 직면해 있습니다. 이러한 의존성은 정부 이니셔티브에도 확장되며, 미국 정부의 광범위한 데이터 센터 계획은 엔비디아의 정책 또는 공급 변화에 취약합니다.
결과적으로, 기업들은 엔비디아의 현재 시장 지배력과 제한적인 조건에 대한 의존도를 줄이고 더 큰 자율성과 비용 통제를 목표로 하는 전략을 적극적으로 탐색하고 투자하고 있습니다.
오픈AI는 내부 처리 역량을 강화하기 위한 전략적 움직임으로 자체 맞춤형 칩 개발을 시작했습니다. 이 자체 칩 개발의 주요 목표는 AI 모델에 대한 더 빠르고 비용 효율적인 추론 및 훈련을 달성하는 것입니다.
이러한 노력은 외부 하드웨어 공급업체에 대한 회사의 의존도를 줄이고 운영 효율성을 최적화하는 것을 목표로 합니다.
GPU는 몇 개의 크고 강력한 프로세싱 코어 대신 수백만 개의 작은 프로세싱 코어를 특징으로 하는 아키텍처 때문에 인공지능 작업에 독특하게 적합합니다. 이러한 설계는 AI 모델을 구성하는 방대한 가중치 및 매개변수 배열을 탐색하는 데 매우 효율적이며, 이는 응답 생성에 필수적입니다.
GPU의 병렬 처리 기능은 단일 대형 프로세서에 비해 대규모 행렬 변환을 더 효율적으로 처리할 수 있도록 합니다.
충분한 메모리 용량은 AI 작업 중에 처리되는 광범위한 모델 가중치를 저장하는 데 중요하며, 하드웨어 설계에 상당한 도전 과제를 제기합니다. 엔비디아는 메모리 통합 및 용량과 관련된 설계 난관에 지속적으로 직면하며, 이는 전반적인 성능에 영향을 미칩니다.
효과적인 GPU 성능은 실리콘 처리 능력과 고대역폭 메모리(HBM)의 균형 잡힌 통합에 크게 의존합니다.
초기 소매 가격이 2,000달러였던 엔비디아 RTX 5090 그래픽 카드는 현재 엄청난 수요로 인해 시장에서 약 4,500달러에 꾸준히 판매되고 있습니다. 엔비디아는 또한 12,000달러에서 16,000달러 사이의 가격으로 판매되는 RTX Pro 6000이라는 별도의 고사양 제품을 제공합니다.
이러한 가격 책정 전략은 수요와 특수 애플리케이션 요구 사항에 따라 시장을 세분화하려는 엔비디아의 접근 방식을 반영합니다.
RTX Pro 6000은 5090보다 6~10배 비싸지만, 종종 유사하거나 심지어 더 느린 원시 처리 속도를 제공합니다. 이러한 상당한 가격 차이는 주로 Pro 6000 모델에 96GB GDDR7 메모리가 포함되어 있기 때문입니다.
대조적으로, 5090은 32GB의 비오류 수정 GDDR7만 장착되어 있으며, 이는 원시 칩 속도뿐만 아니라 메모리 용량 및 유형이 비용과 특수 애플리케이션 적합성의 중요한 결정 요인임을 강조합니다.
대규모 AI 모델을 위해 소비자 GPU를 스케일링하려고 하면 상당한 통신 병목 현상이 발생하여 프로세스가 매우 비효율적입니다. 이 문제는 식당에 냉장고가 더 필요하지만 1마일 떨어진 곳에 두어야 하는 것과 유사하여 상당한 지연 시간과 운영 지연을 초래합니다.
여러 소비자 GPU에 모델을 분할하면 복잡한 데이터 오케스트레이션 문제가 발생하고 고속 인터커넥트 부족으로 인해 상당한 오버헤드가 발생합니다.
소비자 하드웨어는 일반적으로 대규모 AI 모델의 원활한 작동에 필수적인 칩 간 효율적인 메모리 공유를 위한 필요한 고속 대역폭이 부족합니다.
4,000달러에 판매되는 엔비디아의 DGX Spark는 128GB LPDDR5 통합 메모리를 제공하며, 일반 컴퓨팅보다는 특정 요구 사항을 목표로 합니다. 이 장치는 제한된 Linux ARM 환경에서 작동하므로 광범위한 컴퓨팅 작업 및 일반 소프트웨어 애플리케이션에 대한 유용성이 제한됩니다.
엔비디아의 고사양 GPU에서 발견되는 24,000개 이상의 코어보다 훨씬 적은 6,000개의 CUDA 코어만 제공하여 원시 컴퓨팅 성능이 덜 중요한 메모리 집약적 워크로드를 위한 특수 솔루션으로 자리 잡고 있습니다.
엔비디아 DGX Spark는 초고속 데이터 전송을 용이하게 하도록 설계된 초당 200기가비트 네트워크 인터페이스 카드를 장착하고 있습니다. 이 카드는 SFP 연결을 지원하여 사용자가 여러 DGX Spark 장치를 함께 연결할 수 있도록 합니다.
이러한 연결성은 개별 장치 간의 비교적 빠른 데이터 교환을 가능하게 하여 분산된 워크로드에 대한 집단 처리 역량을 향상시킵니다.
나중에 GLM53 Flash로 식별된 익명의 모델은 매일 100조 개의 무료 토큰을 제공하여 인상적인 성능을 보여주었습니다. 놀랍게도 이 전체 작업은 스택에 엔비디아 하드웨어 없이 화웨이에서 제조한 칩을 사용하여 수행되었습니다.
이러한 성과는 엔비디아 외 하드웨어 솔루션이 상당한 AI 추론 트래픽을 처리할 수 있는 능력을 강조합니다.
성공적인 배포는 고성능 AI 부문에서 대체 칩 제조업체의 실행 가능성이 증가하고 있음을 강조합니다.
오픈AI는 엔비디아 하드웨어에 대한 높은 의존도를 줄이기 위한 광범위한 전략의 일환으로 독점 Jalapeno 칩을 내부적으로 적극적으로 테스트하고 있습니다. 이 이니셔티브는 공급망을 다변화하고 하드웨어 성능 및 비용에 대한 통제를 강화하는 것을 목표로 합니다.
또한 오픈AI는 Cerebras와 협력하여 더 빠른 추론 칩을 탐색하고 활용하여 비엔비디아 솔루션으로의 전환을 더욱 공고히 하고 있습니다.
애플은 M5 Max 및 M5 Ultra 칩 도입으로 Mac Studio 라인업을 크게 업그레이드하여 까다로운 전문가 워크로드에 대한 기능을 향상시켰습니다. M5 Ultra는 36개의 CPU 코어와 80개의 GPU 코어를 포함하는 강력한 구성을 특징으로 하여 상당한 처리 능력을 제공합니다.
512GB의 통합 메모리를 지원하여 높은 대역폭과 낮은 지연 시간을 제공하며, AI 및 머신러닝 작업을 가속화하기 위해 특별히 설계된 32코어 뉴럴 엔진을 통합합니다.
10,000달러의 MSRP로 애플의 M5 Ultra가 탑재된 Mac Studio는 엔비디아의 어떤 유사한 옵션보다 훨씬 많은 RAM을 제공합니다. 엔비디아 5090은 높은 GPU 컴퓨팅을 제공하지만 32GB RAM으로 제한되어 메모리 집약적인 AI 모델에는 유용성이 제한됩니다.
RTX Pro 시리즈는 3배의 RAM을 제공하지만 훨씬 더 높은 가격으로 제공되어 많은 사용자가 접근하기 어렵습니다.
또 다른 대안인 엔비디아의 DGX Spark는 느린 LPDDR5 통합 메모리를 사용하여 고성능 AI 애플리케이션의 병목 현상이 될 수 있습니다.
애플의 M5 Ultra 도입으로 엔비디아의 DGX Spark는 많은 잠재적 사용자에게 사실상 쓸모없게 되었습니다. M5 Ultra는 훨씬 낮은 비용으로 우수한 성능을 제공하여 더 매력적인 가치 제안을 합니다.
이러한 움직임은 애플의 전용 AI 하드웨어 부문에 대한 첫 주요 진출을 알리며 새로운 경쟁 환경을 시사합니다.
새로운 칩은 216GB의 고대역폭 메모리(HBM)를 자랑하며 700와트의 전력만을 요구하여 놀라운 에너지 효율성을 보여줍니다. FP4 작업에서 13.4페타플롭스의 성능을 달성하여 높은 컴퓨팅 역량을 나타냅니다.
이러한 사양은 칩이 RAM 용량과 대역폭 면에서 H100과 H200을 모두 능가하여 AI 가속기의 새로운 표준을 설정함을 시사합니다.
Jalapeno 칩은 성능 곡선의 어떤 부분에 대한 특정 튜닝 없이도 거의 모든 시나리오에서 엔비디아의 Blackwell에 비해 우수한 와트당 성능을 보여주고 있습니다. 이는 데이터 센터 운영에 매우 중요한 전기 효율성에서 상당한 이점을 나타냅니다.
이 칩은 낮은 지연 시간 및 높은 처리량 애플리케이션 모두에서 탁월하여 다양한 AI 워크로드에 다용도로 활용될 수 있습니다. 또한 Jalapeno는 HBM4 메모리를 사용하여 광범위한 시장 채택보다 앞서 나가며 최첨단 메모리 대역폭을 제공합니다.
오픈AI는 현재 예산이나 물리적 바닥 공간보다는 데이터 센터 전력 제약으로 인해 상당한 한계에 직면해 있습니다. 이로 인해 '메가와트당 토큰'이라는 측정 항목이 가장 중요해지며, 이는 운영의 효율성과 확장성에 직접적인 영향을 미칩니다.
전력 효율성은 AI 기업의 장기적인 수익 및 운영 지속 가능성을 결정하는 주요 요인이 되고 있습니다.
엔비디아의 CEO 젠슨 황(Jensen Huang)도 전력 효율성을 업계의 핵심 미래 측정 항목으로 인정하며 그 중요성이 커지고 있음을 강조했습니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
이 채널 새 영상도 이렇게 정리해 드릴까요?
Theo - t3․gg에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 6편 올렸어요.
숏츠는 빼고 보내 드려요. 메일이 필요 없어지면 언제든 구독을 끄실 수 있어요.