데이터 없는 AI는 상자에 불과하다
실세계에서 시스템을 구축할 때 데이터 확보와 질은 모델 자체보다 중요한 난관이다. 라파엘 레비는 데이터가 결여된 AI를 빈 상자에 비유하며 그 중요성을 강조했다.
실세계에서 보고 이해하며 행동하는 시스템을 구축하는 데 있어 핵심은 데이터의 질과 확보에 있다.
브라이트 데이터는 웹상의 방대한 동영상으로 로봇 AI 학습의 질을 높이는 새로운 접근 방식을 제안한다.
실세계에서 시스템을 구축할 때 데이터 확보와 질은 모델 자체보다 중요한 난관이다. 라파엘 레비는 데이터가 결여된 AI를 빈 상자에 비유하며 그 중요성을 강조했다.
실세계에서 보고 이해하며 행동하는 시스템을 구축하는 데 있어 핵심은 데이터의 질과 확보에 있다.
2022년 구글은 이미지를 통해 로봇에게 실세계 행동을 가르치기 시작했다.
이후 2023년 다중 로봇 제어 기능의 도약이 있었으며, 2024년 오픈소스 공개로 로봇 AI 연구가 대중화되고 가속화됐다.
샌프란시스코의 웨이모는 이러한 방식을 통해 운전자 없는 주행 기술을 구현했다.
축적된 대시보드 데이터를 통해 기계가 실질적인 조작법을 스스로 학습하는 방식이 주효했다.
대규모 언어 모델(LLM)은 수조 개의 텍스트 데이터를, 이미지 생성 AI는 수십억 개의 라벨링 데이터를 활용할 수 있다.
그러나 로봇 공학 분야의 영상 데이터는 약 100만 개 수준으로 매우 제한적이다.
사람에게 특정 동작을 지시하면 연기하게 되어 자연스러운 움직임과 차이가 발생한다.
카메라를 의식하는 행위 자체가 편향된 데이터를 만들며, 이는 로봇의 직관적이고 효과적인 학습을 저해한다.
누군가에게 무엇을 하라고 시키면, 자연스럽게 행동하지 않는다는 것입니다.
가상 시뮬레이션은 저렴하지만 물리 엔진의 한계로 로봇 훈련에 충분하지 않다.
사람이 직접 조종하며 녹화하는 방식은 시간과 인력 대비 확장성이 낮아 비효율적이다.
유튜브에는 수십억 시간 분량의 일상적인 물리적 행동 데이터가 존재한다.
메타의 AI 모델은 100만 시간의 현실 영상을 학습한 후 단 62시간의 로봇 데이터만으로 실제 제어에 성공한 사례가 있다.
대안은 바로 웹입니다. 유튜브를 한번 생각해 봅시다.
프레임 단위로 두 장면을 비교하여 AI가 움직임의 차이와 각도, 거리를 측정할 수 있다.
수집된 모든 영상이 유효하지 않아 96%는 필터링되며, 이는 컴퓨팅 자원과 저장 공간의 엄청난 낭비를 초래한다.
기존 방식은 다운로드된 영상의 74%가 폐기되는 비효율성을 보였다.
브라이트 데이터(Bright Data)는 수집 전에 검색하는 방식을 제안하며, 키워드가 아닌 행동 기반의 인덱싱으로 데이터 낭비와 비용을 절감한다.
이 채널의 새 영상도 아티클로 메일 받으세요.
인덱싱된 수십억 개의 영상에서 행동 단위의 클립이 추출되어 학습에 적합하도록 다듬어진 상태로 제공된다.
API 호출을 통해 영상 스니펫과 원본 연결 URL을 확보할 수 있어 로봇에 주입할 준비가 완료된다.
영상 제목은 내용과 무관할 수 있어 키워드 검색에 한계가 있지만, 비디오 인덱싱을 활용하면 특정 행동이나 브랜드 노출 상황 등 상세한 내용을 검색할 수 있다.
타임스탬프, 일치 점수, 관련 프레임 수 등 상세 데이터를 제공하여 데이터 탐색의 효율성을 높인다.
불필요한 영상 데이터를 걸러내 데이터 정제(Cleaning)를 통해 학습 중 발생하는 노이즈와 환각 현상을 감소시킨다.
이 방식은 로봇 학습뿐만 아니라 자율 주행 분야의 대시 캠 데이터 등에도 활용될 수 있으며, 온라인상의 방대한 기존 영상 데이터를 물리 모델 및 학습 데이터로 활용하게 한다.
WeMeo와 같은 대시 캠 영상 데이터는 로봇 학습 효율성을 높이는 데 강조된다.
러시아의 대시 캠 사례처럼 일상적인 운전 습관(신호 준수, 회전 방식 등)이 데이터로 유용하며, 로봇이 물리 법칙을 이해하는 데 실제 영상이 필수적이다.
수백만 명에게 특정 행동을 촬영하게 시키는 방식은 비효율적이다.
온라인은 이미 인류가 만든 가장 거대한 데이터베이스이며, 현행 검색 방식이 영상 제목 키워드에만 의존하는 한계를 지적했다.
브라이트 데이터는 유튜브와 비메오 등 영상 플랫폼의 방대한 데이터를 처리 대상으로 삼는다. 특정 행동 단위로 영상을 인덱싱해 게임 공략 검색 등 학습 외적인 용도로도 활용 가능한 솔루션을 개발하고 있다.
이 솔루션은 게임 공략 영상 검색 등 학습 데이터 외에도 다양한 활용 가능성을 가지며, 유튜브, 비메오 등 방대한 영상 플랫폼 데이터를 처리 대상으로 한다.
자막에서 근거가 되는 대목을 찾아 답합니다.
AI Engineer의 다음 영상도 받아볼까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 26편 올렸어요.