Nebius Token Factory, 프로덕션용 오픈 LLM 엔지니어링
Nebius는 물리적 데이터 센터와 베어 메탈 용량을 관리하여 추론 성능을 최적화하는 풀 스택 AI 클라우드 인프라 제공업체로 운영됩니다.
이 회사의 미션은 Token Factory를 통해 추론을 최적화하는 데 중점을 두며, 이는 NASDAQ 상장과 Nvidia와의 강력한 파트너십을 통해 LLM 생산을 강화하는 전략으로 뒷받침됩니다.
Nebius Token Factory는 대규모 언어 모델을 위한 폐쇄형 API와 자체 호스팅 간의 격차를 해소하기 위해 풀 스택 AI 플랫폼을 도입합니다.
Nebius는 물리적 데이터 센터와 베어 메탈 용량을 관리하여 추론 성능을 최적화하는 풀 스택 AI 클라우드 인프라 제공업체로 운영됩니다.
이 회사의 미션은 Token Factory를 통해 추론을 최적화하는 데 중점을 두며, 이는 NASDAQ 상장과 Nvidia와의 강력한 파트너십을 통해 LLM 생산을 강화하는 전략으로 뒷받침됩니다.
Nvidia로부터 20억 달러의 자본 투입을 통해 Nebius의 AI 인프라 확장이 촉진되며, 이 회사는 2030년까지 5기가와트의 Nvidia 시스템을 목표로 합니다.
AI 팀은 종종 딜레마에 직면합니다. 폐쇄형 API는 사용 편의성을 제공하지만 빠르게 성능 한계에 도달하고 선형적인 비용 증가와 함께 블랙박스 운영을 나타냅니다.
반대로, 자체 호스팅은 완전한 제어 기능을 제공하지만 상당한 엔지니어링 오버헤드와 배포를 위한 긴 리드 타임을 요구합니다.
Token Factory는 자체 호스팅의 성능 이점과 서비스의 단순성 및 관리형 측면을 결합하여 제어와 사용 편의성 사이의 균형을 제공함으로써 이 격차를 해소하는 것을 목표로 합니다.
Nebius는 추론, 데이터 및 사후 훈련을 단일 통합 루프 내에서 연결하는 풀 스택 AI 플랫폼을 개발했습니다.
이 플랫폼의 추론 계층은 전용 엔드포인트와 도구를 사용하여 60개 이상의 모델을 지원하며, 데이터 랩은 분석을 위해 생산 로그를 캡처하고, 사후 훈련 계층은 실제 데이터를 기반으로 미세 조정 및 최적화를 가능하게 합니다.
Nebius는 사후 훈련을 위한 합성 데이터셋 사용을 지원하여 LoRA 또는 전체 미세 조정과 같은 방법을 통해 모델을 특정 행동 기대치에 맞게 조정할 수 있도록 합니다.
이 플랫폼은 또한 모델 증류, 맞춤형 추측 디코딩, 사용자 선호도에 따른 온디맨드 양자화 및 보정을 제공합니다.
추론 데이터 수집에서 생산까지 직접적인 흐름을 제공함으로써 Nebius는 팀이 일반적으로 서로 다른 도구를 수동으로 연결할 때 직면하는 마찰을 제거합니다.
Nebius는 추론 데이터 수집에서 훈련, 그리고 다시 생산까지 직접적이고 연속적인 흐름을 가능하게 함으로써 이를 해결하며, 이는 프로덕션급 AI 시스템을 운영하는 데 중요합니다.
Nebius는 엔진 최적화, 수직 하드웨어 제어 및 엔터프라이즈 수준 규정 준수를 우선시하여 프로덕션급 배포를 보장합니다.
최적화는 오픈 소스 모델에 대한 엔진 수준 대기 시간, 처리량 및 비용의 적극적인 튜닝을 포함합니다.
인프라는 우수한 제어를 위한 수직 하드웨어 스택 소유권을 포함하며, 엔터프라이즈 준비 상태는 생산 배포를 위한 보안, 규정 준수 및 안정성을 다룹니다.
팀은 초기 모델 배포에서 실제 시나리오에서 확장하는 데 어려움을 겪는 경우가 많습니다.
Nebius는 훌륭한 AI 제품을 구축하는 팀과 데모만 출시하는 팀을 구별하기 위해 실행, 관찰, 데이터 캡처 및 업데이트 재배포의 전체 주기를 강조합니다.
Artificial Analysis 벤치마크는 독점 모델과 오픈 모델이 이제 동등한 지능을 제공하여 독점 옵션을 계속 추구할 필요성을 줄였다고 Sujee Maniyam은 언급했습니다.
벤치마크에서 파란색으로 표시된 오픈 모델은 이제 검은색으로 표시된 독점 모델과 동등한 지능을 제공하며, 종종 더 낮은 비용으로 공급업체 종속 및 토큰 경제 비용을 줄입니다.
Nebius는 하드웨어 수준 튜닝에서 자동화된 GPU 선택에 이르는 다층 전략의 일환으로 NVIDIA와의 협력을 통해 최적화된 커널과 NVFP4 지원을 통합합니다.
서비스 수준에서 오픈 소스 엔진의 내부 포크는 특정 모델 성능에 맞게 조정됩니다.
추론 관리는 GPU 및 엔진 선택을 자동화하여 고객을 위한 API 사용을 간소화합니다.
기존 로드 밸런싱은 다양한 입력/출력 크기와 단편화된 캐시로 인해 LLM에 비효율적이며, 대규모 GPU 클러스터에서 낮은 추론 성능을 초래합니다.
Nebius는 저장된 캐시 위치를 추적하는 캐시 인식 라우터를 사용하여 일관성을 개선하고 관련 캐시 데이터가 있는 GPU로 요청을 전달합니다.
이 접근 방식은 처음부터 토큰을 생성하는 대신 기존 캐시 데이터를 활용하여 추론 속도를 최대화합니다.
주니어-시니어 아키텍처 패턴은 더 작은 모델이 더 큰 모델이 확인할 내용을 초안으로 작성하게 하여 대규모 언어 모델의 느리고 순차적인 토큰 생성을 해결합니다.
이 기술은 더 작고 빠른 '주니어' 모델을 사용하여 대부분의 토큰을 생성한 다음, 더 큰 '시니어' 모델이 이를 확인하고 초안이 정확하지 않은 경우에만 토큰을 재생성합니다.
추측 디코딩을 통해 소형 모델과 대형 모델을 혼합하면 대형 모델에만 의존하는 것보다 훨씬 더 나은 성능을 제공합니다.
Nebius Token Factory 플랫폼은 초안 모델 훈련을 자동화하며, 맞춤형 생산 데이터에 이러한 모델을 훈련하면 일반 데이터에서 볼 수 있는 30%를 넘어선 성능 향상을 얻을 수 있습니다.
동일한 토큰을 캐싱하여 재생성을 방지하면 5~10배의 속도 향상이 가능하며, 시스템 수준 메모리 오프로딩은 관련 소비 증가를 관리합니다.
높은 메모리 소비를 관리하기 위해 시스템은 자동으로 캐시를 GPU 메모리에서 일반 메모리로 오프로드합니다.
이 프로세스는 수동 사용자 개입 없이 발생하여 효율성과 사용 편의성을 보장합니다.
연산 집약적인 프리필 단계와 메모리 집약적인 디코딩 단계를 분리함으로써 Token Factory는 KV 캐시를 공유하여 하드웨어 리소스 경쟁을 완화하면서 작업을 별도의 GPU 세트에 분배할 수 있습니다.
Token Factory는 이러한 단계를 다른 GPU 세트로 분리하여 한 세트가 프리필을 처리하고 다른 세트가 디코딩을 처리하도록 하며, 효율성 향상을 위해 KV 캐시를 공유합니다.
양자화는 모델 효율성을 높이기 위해 수치 정밀도를 줄이지만, 과도한 양자화는 모델 품질을 저하시킬 수 있습니다.
이 플랫폼은 양자화의 최적의 '스위트 스팟'을 결정하기 위해 광범위한 실험을 수행하여 성능 저하 없이 효율성을 극대화합니다.
이 플랫폼은 최적의 양자화 수준을 찾기 위해 광범위한 실험을 수행하여 상당한 성능 손실 없이 모델을 효율적으로 실행할 수 있도록 합니다.
캐시 인식 라우팅은 특히 GPU 클러스터 전체에서 캐시 데이터를 관리할 때 성능을 최대화하는 데 중요합니다.
프리필 및 디코딩 단계 분리 또한 1조 개 매개변수와 같은 대규모 모델에 필수적이며, 이러한 최적화 대부분은 API 기반 서비스 뒤에서 원활하게 작동합니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
AI Engineer의 다음 글도 받아볼까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 30편 올렸어요.