AI 분야에서 미니맥스의 위상 상승
원본 영상 1:38미니맥스는 딥시크(DeepSeek), 문샷(Moonshot, Kimi), GLM과 같은 주요 기업들과 함께 중국 최고의 AI 스타트업 중 하나로 점점 더 인정받고 있습니다. 이 회사는 AI 혁신에서 선두 자리를 차지하기 위해 경쟁하는 팀들과 함께 치열한 경쟁 환경의 일부로 부각되고 있습니다. 이러한 강력한 경쟁 환경은 미니맥스가 최첨단 모델과 기술을 지속적으로 개발하도록 촉진합니다.
미니맥스의 M3 모델은 100만 토큰 컨텍스트 창과 멀티모달, 코딩 및 에이전트 기능을 결합하여 기존 AI 애플리케이션의 한계를 해결합니다.
이 채널 새 영상도 이렇게 정리해 드릴까요?
미니맥스는 딥시크(DeepSeek), 문샷(Moonshot, Kimi), GLM과 같은 주요 기업들과 함께 중국 최고의 AI 스타트업 중 하나로 점점 더 인정받고 있습니다. 이 회사는 AI 혁신에서 선두 자리를 차지하기 위해 경쟁하는 팀들과 함께 치열한 경쟁 환경의 일부로 부각되고 있습니다. 이러한 강력한 경쟁 환경은 미니맥스가 최첨단 모델과 기술을 지속적으로 개발하도록 촉진합니다.
미니맥스는 6월에 M3 모델을 출시했으며, 이 모델은 상당한 파라미터 수와 효율적인 설계가 특징입니다. 올리브 송(Olive Song)은 이 모델이 총 4천억 개의 파라미터와 2백억 개의 활성화된 파라미터를 가지고 있다고 자세히 설명했습니다. 이 구성은 기능적인 100만 토큰 컨텍스트 창을 가능하게 하여 광범위한 데이터 입력을 처리하는 데 적합합니다.
M3 모델은 미니맥스 희소 주의(MSA)라는 새로운 아키텍처를 통해 기능적인 100만 토큰 컨텍스트 창을 달성합니다. 이 혁신적인 설계는 향상된 컨텍스트 처리를 용이하게 할 뿐만 아니라 멀티모달 기능을 가능하게 하여 모델이 텍스트, 비디오 및 이미지를 이해할 수 있도록 합니다. 올리브 송은 이 통합된 접근 방식이 고급 코딩 및 복잡한 에이전트 워크플로우를 지원하여 종종 코드에만 초점을 맞추는 일반적인 오픈 소스 모델의 한계를 넘어선다고 강조했습니다.
새로운 MSA(MiniMax Sparse Attention) 아키텍처를 통해 이 세 가지를 통합했습니다. 미래 AI 애플리케이션에서 매우 중요할 것이라는 것을 알고 있기 때문입니다.
미니맥스의 장기 컨텍스트 모델 개발은 M1과 같은 초기 버전으로 시작되었으며, 이는 검색 작업에서 최대 천만 토큰을 처리할 수 있었습니다. 올리브 송은 이러한 초기 모델이 주로 긴 책을 분석하는 것과 같은 정적 작업에 사용되었다고 회상했습니다. 그러나 팀은 곧 단순한 검색이 복잡한 에이전트 작업에 불충분하다는 것을 깨달았고, 도구 응답 및 다중 라운드 사용자 상호 작용을 효과적으로 관리하기 위해 더 긴 컨텍스트 창이 필요하다고 생각했습니다.
MSA 아키텍처는 방대한 컨텍스트를 처리하면서 효율성을 유지하기 위해 정교한 두 가지 브랜치 시스템을 사용합니다. 올리브 송은 이 설계가 확장 가능하고 단순하며, 높은 수준에서 가장 관련성 높은 정보를 식별하는 인덱스 브랜치를 특징으로 한다고 설명했습니다. 그 후, 희소 주의 브랜치는 선택된 블록에 대해 특별히 계산을 수행하여 불필요한 계산 오버헤드 없이 정확한 작업 실행을 보장합니다.
미니맥스 M3의 설계 철학은 컨텍스트 길이와 모델 크기 모두에서 미래 성장을 수용하기 위한 확장 가능한 아키텍처를 강조합니다. 올리브 송은 지속적인 확장을 용이하게 할 '우아한 아키텍처'를 만들기 위한 신중한 노력을 강조했습니다. 이러한 선견지명은 M3 모델이 장기적으로 증가하는 요구와 더 복잡한 애플리케이션에 적응할 수 있도록 보장합니다.
미니맥스의 주의 메커니즘 개발은 주의가 어떻게 작동하고 어떻게 더 효율적으로 만들 수 있는지에 대한 근본적인 재평가를 포함했습니다. 토마스 울프(Thomas Wolf)는 N-제곱 및 선형 주의에서 플래시 주의와 같은 더 현대적인 기술로의 역사적 변화를 언급했습니다. 팀은 GPT-2의 1,024 토큰에서 현재의 100만 토큰으로 컨텍스트 한계의 기하급수적인 성장을 처리하기 위해 주의를 더 효율적으로 만드는 데 중점을 두었으며, 그는 이를 "미친"이라고 묘사했습니다.
놀랍게도 M3 모델의 핵심 구성 요소인 미니맥스의 희소 주의 아키텍처는 인턴이 설계했습니다. 올리브 송은 이러한 독특한 기여를 언급하며, 이러한 일이 많은 연구실에서는 드물다고 지적했습니다. 미니맥스의 개방적인 문화는 인턴들이 데이터에 대한 상당한 접근 권한과 핵심 모델에 기여할 기회를 제공하며, 연공서열에 관계없이 작업에 민감한 애플리케이션에 대한 효율성을 우선시하는 환경을 조성합니다.
미니맥스는 모든 직원이 모델 개선에 기여하도록 장려하는 상향식 프로젝트 조직 방식을 채택하고 있습니다. 올리브 송은 회사가 견고한 기반과 인프라를 보장하여 누구든지 모델을 실험하고 개선할 영역을 식별할 수 있도록 한다고 설명했습니다. 모델 출시 후, 직원들은 식별된 약점을 해결하기 위한 프로젝트를 자유롭게 제안할 수 있으며, 종종 교차 기능 팀을 구성하여 솔루션을 반복합니다. 이러한 협업 프로젝트는 몇 주에서 몇 달까지 지속될 수 있으며, 성공적인 개선 사항은 궁극적으로 최종 교육에 통합되어 미니맥스의 내부 혁신 및 지속적인 개발에 대한 약속을 보여줍니다.
미니맥스는 텍스트 사전 훈련 후 추가하는 대신 초기 훈련 단계부터 비전 이해를 통합하는 '네이티브 멀티모달리티' 접근 방식을 사용합니다. 올리브 송은 많은 연구실에서 일반적으로 텍스트 사전 훈련 후 비전 어댑터를 추가하는데, 이는 텍스트 성능에 부정적인 영향을 미칠 수 있음을 발견했다고 설명했습니다. 처음부터 비전과 텍스트를 함께 훈련함으로써 미니맥스는 단계별 훈련과 관련된 일반적인 수렴 문제를 피하고, 보다 깊이 통합되고 강력한 멀티모달 기능을 보장합니다.
AI 모델 개발의 일반적인 접근 방식인 단계별 훈련은 확장을 시도할 때 상당한 어려움을 나타냅니다. 올리브 송은 단계별 훈련의 '레시피'가 매우 민감하여 아키텍처, 데이터 혼합 및 학습률에 따라 달라진다고 강조했습니다. 이로 인해 결과를 제어하고 더 작은 모델의 실험적 결론을 더 큰 모델로 효과적으로 확장하기가 어려워 종종 예측할 수 없는 결과로 이어집니다.
미니맥스는 모델의 미래 확장을 위한 야심찬 계획을 가지고 있으며, 1조 파라미터 목표를 넘어서는 것을 목표로 합니다. 올리브 송은 현재 모델이 총 4,280억 개의 파라미터와 230억 개의 활성 파라미터를 가지고 있다고 확인했습니다. 그녀는 많은 복잡한 작업에 최적의 성능을 위해 더 많은 파라미터 수가 필요하다는 믿음에 따라 1조를 넘어설 것이라고 확신했습니다.
설립 초기부터 미니맥스는 범용 인공지능(AGI)과 멀티모달리티에 중점을 둔 근본적인 비전에 따라 운영되었습니다. 올리브 송은 회사의 CEO가 ChatGPT의 공개 출시 이전부터 모든 모달리티를 이해하고 출력할 수 있는 모델을 구상했다고 밝혔습니다. AGI에 대한 이러한 장기적인 목표는 그들의 개발을 주도하며, 애플리케이션은 사용자가 모델의 진화하는 기능을 직접 경험할 수 있는 중요한 통로 역할을 합니다.
미니맥스는 모델을 오픈 소스하는 데 강한 의지를 가지고 있으며, 커뮤니티 협력을 개발에 필수적이라고 봅니다. 올리브 송은 자신과 모델 연구팀 모두 오픈 소스 작업을 계획하고 있다고 강조했습니다. 그들은 오픈 소스 커뮤니티의 피드백을 매우 중요하게 생각하며, 기여와 풀 리퀘스트가 미래 버전에 직접적인 영향을 미치고 모델 개선에 도움이 된다고 언급했습니다.
미니맥스는 새로운 모델의 멀티모달 기능에 대한 피드백을 적극적으로 찾고 우선 순위를 정하고 있습니다. 올리브 송은 특히 이번이 이러한 기능을 처음 결합하는 것이기 때문에 사용자들이 겪는 모든 문제에 특히 관심이 있다고 말했습니다. 그녀는 팀이 미래에 멀티모달리티에 대해 더욱 야심찬 계획을 가지고 있으며, 사용자 요구와 의견을 바탕으로 '사고 노력'과 같은 새로운 기능을 고려하고 있다고 밝혔습니다.
올리브 송에 따르면, 멀티모달리티는 광범위한 새로운 기능과 에이전트 애플리케이션을 잠금 해제할 것으로 예상됩니다. 그녀는 모델이 파워포인트 프레젠테이션이나 보고서와 같은 비정형 데이터를 읽고, 매우 긴 비디오를 이해하는 능력과 같은 예시를 제시했습니다. 이 기능은 에이전트가 복잡한 시각 및 텍스트 정보를 기반으로 후속 도구 사용을 트리거할 수 있게 해주며, 그녀는 이 분야가 현재 탐색되지 않았지만 미래 에이전트 워크플로우에 매우 큰 영향을 미칠 것이라고 설명했습니다.
미니맥스는 자체 연구 하네스를 활용하여 내부 워크플로우의 상당 부분을 자동화합니다. 올리브 송은 M3와 같은 모델이 커널을 최적화하고 데이터를 생성하는 데 사용되어 새로운 버전의 반복 속도를 가속화한다고 설명했습니다. 이러한 자동화는 빠른 개발 주기의 핵심 요소이며, 최전선 모델들 사이에서 효율성 향상을 위해 커널 작업을 최적화하는 추세를 반영합니다.
올리브 송은 멀티 에이전트 시스템과 모델 라우팅의 출현이 특히 흥미롭다고 생각하며, 많은 AI 애플리케이션이 이러한 접근 방식을 채택하고 있다고 언급했습니다. 이러한 시스템은 여러 모델의 기능을 연결하여 더 복잡한 작업을 가능하게 하며, 기능적 깊이를 향상시킵니다. 멀티 에이전트 아키텍처는 또한 다양한 모델의 특정 강점과 약점을 명확히 하여 다양한 애플리케이션에 대한 배포를 최적화하는 데 도움이 됩니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
이 채널 새 영상도 이렇게 정리해 드릴까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 6편 올렸어요.
숏츠는 빼고 보내 드려요. 메일이 필요 없어지면 언제든 구독을 끄실 수 있어요.