Auto Research로 모델 속도 3배 개선
이 프레임워크는 에이전트가 목표를 달성할 때까지 제안과 검증을 반복하는 'while 루프' 구조를 따른다.
Auto Research는 안드레 카파시가 만든 프레임워크로, 에이전트가 특정 목표를 달성할 때까지 스스로 해결책을 제안하고 벤치마킹하며 검증하는 반복적인 'while 루프' 방식으로 작동한다.
Morph는 GPU 커널 최적화와 베어 메탈 하드웨어 조정을 통해 AI 모델의 추론 속도를 3배 빠르게 만들었습니다.
이 프레임워크는 에이전트가 목표를 달성할 때까지 제안과 검증을 반복하는 'while 루프' 구조를 따른다.
Auto Research는 안드레 카파시가 만든 프레임워크로, 에이전트가 특정 목표를 달성할 때까지 스스로 해결책을 제안하고 벤치마킹하며 검증하는 반복적인 'while 루프' 방식으로 작동한다.
GPU 커널은 엔비디아 환경의 저수준 연산자로, 행렬 곱셈이나 전문가 연산 등에 사용되며, 정확성과 속도 검증이 매우 쉽다는 점에서 자동 연구 프레임워크와 결합하기에 유리하다.
이 프레임워크는 블록 크기나 매개변수 최적화에 능하지만, 고수준의 파이프라인 설계에는 여전히 인간의 아이디어가 필요하다는 점을 인지해야 한다.
주요 병목 현상은 연산 병목, 메모리 병목, 또는 너무 많은 커널 실행으로 인한 과도한 오버헤드 등 세 가지 유형으로 나눌 수 있다.
엔비디아의 Nsight 프로파일러를 사용하여 비효율적인 구간을 식별할 수 있으며, 딥 시크 어텐션(DeepSeek Attention) 사례처럼 효율적인 데이터 로드 방식을 인간이 판단하여 지시하면 에이전트가 상세 수치를 최적화한다.
NVLink가 없는 저렴한 GPU를 사용하기 위해 전용 자동 연구 프레임워크와 커스텀 하네스 제작이 필요하며, 성능 극대화를 위해서는 에이전트가 B200, H200 등 하드웨어별 워프(warp), TMEM, TMA와 같은 세부 사양 정보를 정확히 파악하도록 해야 한다.
하드웨어 기능은 세대마다 다르므로 에이전트가 항상 최신 하드웨어 컨텍스트를 유지하고, 성능을 극대화하기 위해 에이전트가 하드웨어 사양을 정확히 파악해야 한다.
DeepSeek Flash의 '압축 희소 어텐션'이나 '계층적 압축 어텐션'과 같은 고유 아키텍처 정보는 에이전트가 정확한 커널을 생성하는 데 핵심적인 요소다. 정보를 제대로 설정하지 않으면 어텐션 메커니즘이 왜곡되어 무용지물인 커널이 만들어질 수 있다.
이러한 설정을 제대로 하지 않으면 모델이 실제 어텐션 메커니즘을 100% 환각 처리하여 쓸모없는 커널만 생성할 수 있으므로 에이전트가 모델 자체에 대한 정보를 반드시 파악하고 있어야 한다.
최첨단 작업일수록 에이전트가 수행하지 말아야 할 제약 조건을 명확히 정의하는 것이 무엇보다 중요하다.
CUDA 그래프 비활성화나 작은 컨텍스트 윈도우 테스트 등과 같은 잘못된 최적화 사례를 방지하기 위해 '무엇을 하지 말아야 할지'를 명확히 정의하는 제약 조건을 설정하는 것이 매우 중요하다.
직접 만든 커널이 모든 상황에서 우월하지 않으며, 특정 범위 이후에는 FlashInfer나 Cutlass 같은 라이브러리에서 제공하는 기본 커널을 사용하는 것이 더 효율적일 수 있다.
DeepSeek의 Sparse MLA나 MoE를 위한 NVFP4와 같은 커널이 결합될수록 효과는 커지며, GPU의 이론적 최대 활용도(MFU)에 도달할 때까지 기능 추가가 가능하다.
베어 메탈 환경에서는 BIOS 조정, 오버클럭, PCIe 릴랙싱 등 물리적인 튜닝을 통해 연구용 프레임워크 위에서 매우 변칙적인 작업도 수행할 수 있다.
이러한 베어 메탈 최적화를 거치면 클라우드 제공 업체의 가상화 환경보다 약 25% 더 나은 성능을 얻을 수 있으며, 커널 최적화와 하드웨어 해킹 기술을 결합하여 총 3배의 속도 향상에 도달했다.
자막에서 근거가 되는 대목을 찾아 답합니다.
AI Engineer의 다음 글도 받아볼까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 89편 올렸어요.