물리적 AI 구축 목표, '구체화된 기반 모델' 개념 제시
아르멘 아가자냔은 가상 현실 모델(VLM), 가상 현실 학습 모델(VLA), 세계 모델 등 기존의 다양한 명칭을 넘어 '구체화된 기반 모델'이라는 개념을 도입했다.
이는 물리적 세계를 실시간으로 인지하고 이해하며 상호작용하는 물리적 AI 구축을 목표로 하며, 기기, 로봇, 센서 등에 지능을 적용하여 디지털과 물리적 세계를 연결하고자 한다.
퍼셉트론 AI, 기존 모델의 한계를 극복하고 물리적 세계와 상호작용하는 새로운 AI 모델 제시
This article
Save the whole article and keep a private note with it.
아르멘 아가자냔은 가상 현실 모델(VLM), 가상 현실 학습 모델(VLA), 세계 모델 등 기존의 다양한 명칭을 넘어 '구체화된 기반 모델'이라는 개념을 도입했다.
이는 물리적 세계를 실시간으로 인지하고 이해하며 상호작용하는 물리적 AI 구축을 목표로 하며, 기기, 로봇, 센서 등에 지능을 적용하여 디지털과 물리적 세계를 연결하고자 한다.
기존의 ER 모델이나 VLA는 VLM 기반으로 개발되어 성능에 일정한 한계를 보였다.
아가자냔은 체화된 기반 모델을 표준적인 지각과 추론, 최종 제어까지 단일 구조로 통합하는 틀로 정의하며 다중 양식 추론의 효율성을 지향한다.
모델에 입력되는 데이터 중 학습에 활용되는 신호는 극히 일부에 불과하다는 문제가 제기되었다.
1시간 분량의 영상 기준 백만 개 토큰이 입력되더라도 손실 계산에 사용되는 토큰은 전체의 약 0.2% 수준에 그친다.
기존의 인위적인 레이블 지정이나 대본 추출 방식은 잘못된 훈련 신호를 주입하는 결과를 낳았으며, 모든 픽셀을 예측하는 방식은 배경과 중요한 물리적 현상을 동일하게 다뤄 비효율적이다.
퍼셉트론은 모델이 미래에 중요해질 지각을 자동으로 예측하는 방법을 모색하고 있다.
로봇 그리퍼 예시에서처럼 하드 코딩된 방식이 아닌, 모델이 의미론적으로 스스로 유용한 지각을 학습하는 방법을 탐색한다.
이러한 희소성 문제 해결을 위해 퍼셉트론은 자체적인 기술적 접근법을 확보하고 있다.
항상 켜져 있는 카메라에서 발생하는 연속적인 영상 데이터는 비디오 희소성 문제를 유발한다.
텍스트는 상대적으로 밀도가 높고 비디오는 희소하므로, 이러한 불균형을 인위적으로 해결하기보다 텍스트와 비디오 토큰을 동일하게 취급하지 않는 아키텍처적 돌파구가 필요하다는 인식이 크다.
공간 및 토큰 압축 방식을 도입해 처리 효율성을 높이는 과정이 필수적이다.
퍼셉트론 AI는 모델의 연산 효율을 높이는 데이터 희소 혼합 모델(Data Sparse Mixture of Experts)에 대한 논문을 발표했다.
이 모델은 모델 내에 라우터를 두어 어떤 토큰을 입력해야 하고 어떤 토큰을 건너뛰어야 하는지 예측할 수 있게 한다.
기존의 평균화 방식이 최대 10배 압축이 가능했지만 임시방편에 불과했던 것과 달리, 이 모델은 데이터의 중요도를 스스로 학습하며 중요한 정보에 집중하여 필요한 연산만 수행하도록 설계되었다.
퍼셉트론 AI는 최초의 체화된 기반 모델을 출시하며 Gemini 3.1 Pro와 비교하여 최첨단 기술력을 선보였다.
이 모델은 Gemini의 체화 추론보다 성능이 뛰어나며 가격은 약 15배 저렴하다.
1페타바이트 규모의 텍스트, 이미지, 비디오, 궤적 데이터를 활용하여 학습되었으며, 데스크톱 조작 및 게임 플레이 궤적 등 다양한 데이터가 활용되었다.
기존의 컴퓨터 비전(CV) 작업을 에이전트형 작업으로 재구성하여 모델이 능동적으로 판단하고 수행할 수 있게 했다.
이를 통해 객체 탐지를 에이전트형 작업으로 재구성했으며, 이는 모델이 코드 작성, 확대, 명암 조절 등을 직접 판단하여 수행하는 방식을 의미한다.
기존 객체 탐지 방식보다 어려운 조건의 탐지에 최적화되어 있으며, 다양한 감각 양식을 이해하는 구조를 통해 능동적인 처리가 가능하다.
Get this channel’s next video as an article by email.
로봇 공학, 즉 에이전트 시스템에서 체화된 추론 모델(오케스트레이터)과 촉각 정책 모델 간의 분리 현상이 나타나고 있다.
이는 전체 VLA 시스템을 사용하는 방식과 오케스트레이터 모델을 이용하여 작업을 분할하는 방식의 스펙트럼이 존재함을 보여준다.
저렴하고 빠른 모델로 로봇 데이터를 주석 처리하고, 복잡한 작업을 하위 단계로 나누어 제어 정책에 적용하는 것이 핵심이다.
체화된 기반 모델을 위한 새로운 스케일링 법칙이 발견되어 주목받는다.
이 모델은 제어 기반 훈련, 궤적 훈련, 지각 훈련, 체화된 추론 훈련을 동시에 수행하는 다목적 훈련이 가능하다.
특히 비싼 원격 조작 데이터를 범용 비디오 데이터로 대체할 수 있는 가능성이 제시되어 학습 최적화에 기여할 것으로 보인다.
순수 VLA(비디오 기반 학습)나 순수 정책만으로 학습할 경우 확장 손실이 발생한다는 점이 지적됐다.
체화된 기반 모델 학습 시 더 큰 효율성이 확인되었으며, 비디오 사전 학습 데이터가 10배 증가하면 원격 조작 데이터는 10배 적게 사용해도 동일한 효과를 얻을 수 있다는 가능성을 제시했다.
체화된 기반 모델은 단일 모델 내에서 네이티브하게 실행되는 제어 토큰을 출력한다.
이는 기존의 순수 VLA(가상 논리 에이전트)로는 처리하기 어려웠던 매우 복잡한 작업도 수행하는 것을 가능하게 한다.
예를 들어, 책 제목을 읽고 종류를 파악하여 적절한 분류함에 배치하는 것과 같은 다단계 지각-제어 작업을 기존 엔드 투 엔드 모델보다 효과적으로 해결한다.
높은 FPS 비디오 처리 시 맥락 관리와 키 프레임/델타 프레임 구분이 핵심적인 요소로 작용한다.
인터넷 크롤링 데이터는 좌우 구분이 명확하지 않아 학습이 어려운 문제를 야기한다.
데이터 분포를 초기에 설계해 모델의 공간적 이해도를 높이면 제미나이 수준의 추론 능력도 단기간에 확보할 수 있다.
로봇 팔 카메라 차단이나 강한 햇빛 등 온라인 증강 기법을 훈련에 활용하여 이러한 유형의 오류에 훨씬 더 견고하게 대응한다.
이는 단순한 배경 변화에도 실패하는 기존 정책 모델의 한계를 극복하는 중요한 진전으로 평가된다.
Answers come from the transcript, with the exact spot cited.
Want the next video from AI Engineer too?
When AI Engineer publishes, we'll write it up like the one you just read and email it to you.
AI Engineer published 23 in the last 7 days.
From Scratch to SOTA: Training a 3B State-Space Vision Model — Krishna Prasad Srinivasan, SarvamAI Engineer1 hour ago · 21:09 · 2 views · Created 1 hour ago
You’re Not Thinking Big Enough: Rebuilding Food Systems with AI Agents — Cody Menefee, FirecrawlAI Engineer2 hours ago · 18:25 · 31 views · Created 2 hours ago
The Best Models Still Reason Like Toddlers — Andrew Dai, ElorianAI Engineer3 hours ago · 18:16 · 60 views · Created 2 hours ago