AI 모델 시각적 추론, 인간과 상당한 격차 보여
엘로리안의 앤드류 다이 CEO는 패턴 매칭에 몰두한 AI가 체스판 예시에서처럼 추측으로 인한 오류를 반복한다고 밝혔다.
현행 AI 모델은 사물의 위치나 물리적 맥락을 파악하는 공간적 기반이 부족해 카탄 게임이나 로봇 팔 작동 영상에서 잦은 오류를 보인다. 시각 AI의 진정한 혁신은 기하학적 정렬과 객체 영속성을 갖춘, 물리적 근거와 인과 논리에 기반한 사고 모델에서 시작될 것이다.
현행 AI 모델이 패턴 인식에 의존하며, 인간의 시각적 추론 능력에 크게 못 미치는 것으로 나타났다.
이 아티클
아티클 전체를 저장하고 메모를 남길 수 있어요.
엘로리안의 앤드류 다이 CEO는 패턴 매칭에 몰두한 AI가 체스판 예시에서처럼 추측으로 인한 오류를 반복한다고 밝혔다.
현행 AI 모델은 사물의 위치나 물리적 맥락을 파악하는 공간적 기반이 부족해 카탄 게임이나 로봇 팔 작동 영상에서 잦은 오류를 보인다. 시각 AI의 진정한 혁신은 기하학적 정렬과 객체 영속성을 갖춘, 물리적 근거와 인과 논리에 기반한 사고 모델에서 시작될 것이다.
모델이 공간적 토대를 갖추지 못해 사물의 정밀한 위치나 물리적 상황을 파악하는 데 한계를 보인다는 것이 그의 설명이다.
그는 카탄 게임 속 말의 개수를 파악하지 못하거나 로봇 팔이 가스레인지를 조작하는 맥락을 놓치는 현상을 공간 인지 및 맥락 기억 상실증이라 지적했다.
모델들은 추측이나 패턴 매칭에는 탁월하지만, 공간적인 기반이 부족하고, 세부적인 질문에는 제대로 대응하지 못합니다.
다니엘 카네만의 시스템 2 사고를 인용해 정교한 분석이 필요한 작업만이 진정한 추론의 영역이라 정의했다.
다니엘 카네만의 시스템 2 사고를 인용한 다이 CEO는 체스판 말 세기와 같은 단순 패턴 인식과 정교한 분석이 필요한 추론 영역을 구분했다.
엘로리안의 분석에 따르면, 기존 시각적 벤치마크인 ARC-AGI 데이터셋은 32x32에서 64x64 픽셀 수준의 초저해상도 이미지 위주로 구성되어 있다.
MMU 평가 문제들 역시 정지 이미지나 패턴 인식만으로 해결 가능한 경우가 많아, 실제 복잡한 시각적 추론 능력을 제대로 평가하지 못하는 한계를 보인다.
그는 기하학적 정렬이나 객체 영속성 등 인간이 중요하게 여기는 요소를 다룰 새로운 시각적 추론 벤치마크가 시급하다고 강조했다.
이미지 생성 모델은 물리적 법칙 대신 영화나 게임 데이터를 모방한다. 이로 인해 폭발이나 붕괴 같은 물리적 현상을 구현할 때 현실감이 떨어진다.
시각 AI 분야에서는 사고 능력이 부재한 상태다. 실제 물리적 근거와 인과 논리를 갖춘 모델로 나아가야 한다.
구글 렌즈, SAM-3, YOLO, Mask R-CNN 등 현재 시각 모델들은 강력하지만 근본적으로 수동적인 인식에 머무르고 있다.
다이 CEO는 복잡한 질문을 해결하지 못하는 현 모델의 한계를 언급하며 공간적·시간적 지능을 갖춘 시각적 사고 모델로의 혁신을 제언했다.
이 채널의 새 영상도 아티클로 메일 받으세요.
엘로리안은 시각적 추론에 특화된 멀티모달 데이터를 수집 및 생성하며 모델 개발을 시작한다.
이후 평가, 에이전트, SFT(Supervised Fine-Tuning), 강화학습을 활용한 합성 데이터 플라이휠을 구축하고, 트랜스포머 아키텍처 개선 및 시각적 사고 연쇄 추론 기능을 구현하여 텍스트 기반 사고 연쇄를 넘어 시각 공간 내 다단계 추론이 가능하도록 한다.
엘로리안의 공동 창립자이자 CEO인 앤드류 다이는 지난 12년 동안 구글 브레인과 딥마인드에서 근무하며 초기 사전 학습 및 미세 조정 논문, GPT, GLAM, PaLM 2, Gemini 프로젝트를 주도한 인물이다.
또 다른 공동 창립자인 인피는 애플의 MM1 멀티모달 모델 연구 이력을 보유하고 있으며, 더스틴 트란을 비롯해 XAI, 애플 등 글로벌 기업 출신의 인재들이 팀에 합류하여 시각 AI 분야의 전문성을 강화하고 있다.
기존 비전 모델은 정적 이미지 학습에 치중되어 있어 로봇이 역동적인 환경에서 복잡한 실시간 물리적 동작을 수행하는 데 한계를 보였다.
엘로리안은 올해 말 로봇의 계획 및 제어 시스템을 위한 모델 API를 출시할 계획이다. 이는 건설 현장에서 안전 규칙 해석, 작업자 식별, 계획 대비 공정 파악 등에 활용되어 다양한 시각적 맥락 이해를 통해 재학습 부담을 해소할 것으로 기대된다.
건축 설계 시 침실 개수와 같은 공간적 제약을 이해하는 것은 필수적이며, 기계 설계는 부품당 100~200시간, 테스트 플랫폼 설계에 수천 시간이 소요되는 노동 집약적 분야이다.
기존 프론티어 모델들은 건축 도면, 3D CAD/CAM 파일 등 전문 시각 정보를 해석하는 데 취약한 모습을 보여왔다.
엘로리안의 접근 방식은 다중 모달 추론을 사용하여 기하학적 논리를 추출하고, 프로그래밍 방식의 단위 테스트처럼 시뮬레이션 검증을 지원하여 설계 오류를 최소화하는 데 기여할 것으로 보인다.
자막에서 근거가 되는 대목을 찾아 답합니다.
AI Engineer의 다음 영상도 받아볼까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 23편 올렸어요.