모델 개발에 영향을 미치는 스케일링 법칙과 데이터 장벽
AI 모델의 현재 스케일링 법칙은 컴퓨팅 및 데이터 리소스를 기하급수적으로 늘려도 성능은 선형적으로만 향상되어 상당한 어려움을 제시함을 보여줍니다.
웹에서 사용 가능한 기존 텍스트 데이터는 제한적이어서 최첨단 모델을 훈련하기에 불충분하며, 데이터 획득에 대한 새로운 접근 방식이 필요합니다.
DatologyAI의 Bogdan Gaza는 합성 데이터가 AI 훈련의 '데이터 장벽'을 어떻게 해결하는지 상세히 설명하고, AWS HyperPod에서 통합 Kubernetes 파이프라인의 개요를 제시합니다.
AI 모델의 현재 스케일링 법칙은 컴퓨팅 및 데이터 리소스를 기하급수적으로 늘려도 성능은 선형적으로만 향상되어 상당한 어려움을 제시함을 보여줍니다.
웹에서 사용 가능한 기존 텍스트 데이터는 제한적이어서 최첨단 모델을 훈련하기에 불충분하며, 데이터 획득에 대한 새로운 접근 방식이 필요합니다.
웹, 수학 및 코드 도메인을 아우르며, 팀은 최근 총 약 12조 개의 토큰에 달하는 합성 데이터 실행을 완료했습니다.
이 광범위한 데이터 생성 프로젝트는 웹, 수학, 코드 등 다양한 도메인을 포함하며, 광범위한 AI 훈련 요구 사항을 해결합니다.
이 회사는 독점 레시피를 통해 고품질 데이터 포인트를 식별하고 처리하여 모델 훈련을 향상시킴으로써 스타트업과 대기업 모두를 지원합니다.
DatologyAI의 BeyondWeb 합성 데이터 레시피는 기존 고품질 데이터의 재구성 및 재구성을 활용합니다.
합성 데이터는 토큰 사용량을 상당히 줄여, 동일한 결과를 얻기 위해 Neotron Synth 및 Cosmopedia와 같은 데이터셋에 비해 2.7배에서 5.3배의 효율성 향상을 보여줍니다.
예를 들어, BeyondWeb으로 훈련된 3B 모델은 기존 데이터 소스를 사용하는 8B 모델과 동일한 성능을 달성하여 상당한 리소스 절약을 보여줍니다.
이 방법은 고객 데이터셋 내에서 최고 수준의 데이터 포인트를 식별한 다음, 전문화된 파이프라인을 통해 변환하여 모델이 원래 훈련 분포를 단순히 복제하는 것을 방지합니다.
기존 콘텐츠를 재구성하는 것은 데이터의 본질적인 품질을 유지하면서 다양성을 높이는 데 도움이 됩니다.
이러한 작업은 합성 데이터 출력을 생성하기 위해 GPU 풀에 배포된 다양한 모델을 활용합니다.
이러한 GPU 작업에서 일관된 처리량을 보장하는 것은 실질적인 도전 과제입니다.
이러한 파편화된 설정은 느린 워크플로, 잦은 오류, 귀중한 GPU 리소스의 활용 부족을 초래하여 회사의 운영 속도를 제한했습니다.
전략적 목표는 훈련과 합성 데이터 생성을 단일의 응집력 있는 Kubernetes 기반 인프라로 통합하여 GPU 효율성을 극대화하고 운영을 간소화하는 것이었습니다.
현재 아키텍처는 단일 Kubernetes 클러스터 내의 오케스트레이션 계층을 특징으로 하며, 데이터 처리에 Spark를, 분산 작업 실행에 Ray를 사용합니다.
S3는 AWS, GCP 및 온프레미스 설정과 같은 다양한 클라우드 환경에서 호환성을 보장하는 기본 스토리지 계층 역할을 합니다.
AWS의 H100 클러스터는 이제 HyperPod의 EKS를 통해 관리되며, 이로써 이기종 클러스터 간의 수동 데이터 백필 필요성을 제거하여 운영을 간소화합니다.
내부 작업 스케줄러는 이제 모든 훈련, 평가 및 데이터 생성 작업을 하나의 통합 워크플로 내에서 오케스트레이션하여 효율성을 높입니다.
대규모 언어 모델의 사전 훈련에 적합한 고품질 웹 텍스트는 약 30조 개의 토큰으로 추정되며, 이는 유한한 자원입니다.
DatologyAI는 FineWeb 및 Dolma와 같은 기존 고품질 데이터셋을 합성 생성 프로세스의 기본 입력으로 집계하여 이러한 부족을 해결합니다.
이러한 대규모에서의 엔지니어링 과제에는 S3 메타데이터 관리, GPU 오류 처리, 클러스터 간 스케줄링 최적화, 추론 성능 미세 조정이 포함됩니다.
DatologyAI는 호출당 1,000개 요청 제한에 도달하기 위해 요청을 일괄 처리하여, 11일 걸리던 수조 개의 토큰에 대한 메타데이터 처리 시간을 2시간으로 성공적으로 단축했습니다.
개별 S3 요청은 자주 스로틀링을 유발하여 GPU를 유휴 상태로 만들고 전체 처리 속도를 심각하게 저하시켰습니다.
처음에 수조 개의 토큰에 대한 메타데이터 페치는 비현실적인 9~11일이 소요될 것으로 예상되어 결정적인 병목 현상을 강조했습니다.
DatologyAI는 S3에 대한 요청을 일괄 처리하고 API의 호출당 최대 1,000개 요청을 묶는 기능을 활용하여 이를 완화했으며, 이는 성능을 극적으로 향상시켰습니다.
이 최적화를 통해 메타데이터 처리 시간이 예상 11일에서 단 2시간으로 단축되어 데이터 준비 속도가 크게 빨라졌습니다.
8시간 파티션 작업과 같은 긴 계산 작업 중 시스템 중단은 상당한 작업 손실을 초래하고 처음부터 다시 실행해야 합니다.
DatologyAI는 이러한 불안정성을 해결하기 위해 파티션 크기 조정과 빈번한 체크포인팅이라는 이중 전략을 구현하여 작업이 최근 진행 지점부터 재개될 수 있도록 했습니다.
효과적인 체크포인팅에는 멱등성이 필요하며, 재시도된 작업이 이전 시도에서 부분적으로 완료된 출력을 데이터 손상 없이 안전하게 덮어쓸 수 있도록 합니다.
여러 클러스터에서 GPU 및 CPU 리소스 요구 사항을 동시에 관리하는 것은 DatologyAI 운영에 있어 복잡한 빈 패킹 문제였습니다.
초기에는 작업에 충분한 GPU 용량이 있었지만 사용 가능한 풀에 필요한 CPU 리소스가 부족할 때 문제가 발생했습니다.
팀은 CPU 사용량이 많은 Spark와 Ray 헤드 및 워커를 위한 전용 리소스 풀을 설정하여 이를 해결했으며, 이를 통해 보다 세분화된 제어가 가능해졌습니다.
원자적 스케줄링은 이제 Ray 작업에 대해 CPU 및 GPU 요구 사항이 동시에 충족되도록 보장하여 원활하고 예측 가능한 확장을 가능하게 합니다.
vLLM 및 SGlang 매개변수에 대한 체계적인 벤치마킹 및 튜닝은 합성 데이터 생성에서 추론 효율성을 최적화하는 데 매우 중요했습니다.
vLLM 내의 특정 플래그를 조정함으로써 DatologyAI는 처리량에서 40%의 상당한 이득을 얻었습니다.
팀은 배치 추론에 중점을 두며, 배치 크기를 세심하게 관리하고 추측 디코딩 기술을 사용하여 성능을 향상시킵니다.
하이퍼파라미터에 대한 체계적인 그리드 검색은 지속적으로 성능을 향상시켜 반복 최적화의 가치를 반영합니다.
최근 대규모 작업은 약 7조 개의 웹 토큰과 수학 및 코드를 위한 5조 개의 토큰을 생성하여 다양한 고객의 요구를 충족했습니다.
팀은 웹, 다국어, 수학, 코드 및 법률 데이터를 포함한 여러 도메인에서 합성 데이터 레시피를 개선하기 위한 연구를 계속하고 있습니다.
향후 노력에는 이러한 다양한 데이터 유형별로 데이터 생성 차이에 대한 자세한 비교가 포함될 것입니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
AI Engineer의 다음 글도 받아볼까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 30편 올렸어요.