연구와 배포의 선순환 구조로 로봇 상용화
사내 R&D와 실제 배포 워크플로우를 연동해 데이터로 문제를 식별하고 연구 초점을 최적화하는 전략이 필요하다.
사내 연구 개발(R&D)과 실제 배포 워크플로우를 상호 연동하여 배포 데이터를 통해 문제점을 식별하고 연구의 초점을 최적화하는 방식이다.
유튜브 데모 수준을 넘어 로봇 기술이 인간의 삶에 실질적으로 기여하는 방안을 모색 중이다.
다이애나 로보틱스, 범용 로봇 모델 Dyna-1으로 냅킨 접기 24시간 연속 99.4% 성공률 달성
사내 R&D와 실제 배포 워크플로우를 연동해 데이터로 문제를 식별하고 연구 초점을 최적화하는 전략이 필요하다.
사내 연구 개발(R&D)과 실제 배포 워크플로우를 상호 연동하여 배포 데이터를 통해 문제점을 식별하고 연구의 초점을 최적화하는 방식이다.
유튜브 데모 수준을 넘어 로봇 기술이 인간의 삶에 실질적으로 기여하는 방안을 모색 중이다.
카메라 착용 영상, 공개 데이터셋, 시뮬레이션 데이터를 활용하여 현장 데이터와 테스트 데이터 간의 분포 차이를 줄이고 있다.
이를 통해 총 20만 시간 이상의 학습 파이프라인 데이터를 확보하여 모델 학습에 활용한다.
다이애나 로보틱스의 모델 아키텍처는 고수준 추론 모델과 저수준 행동 모델로 나뉘어 세밀하고 높은 빈도로 정교한 동작을 출력한다.
이러한 아키텍처는 세밀한 물리적 상호작용과 실수 회복 능력을 구현하는 데 기여한다.
방대한 데이터와 결합하여 작업별 신속한 미세 조정이 가능하도록 설계되었다.
잘 구축된 사전 훈련을 거치면, 매우 적은 양의 데이터만으로도 고도의 정교한 도구 사용 작업을 수행하도록 모델을 사후 훈련할 수 있다.
이는 사전 훈련 데이터에 없던 새로운 작업도 사전 훈련 모델을 통해 수행 가능하다는 뜻이다.
1시간 미만의 작업별 데이터로 높은 반복 성공률을 달성하여 실전 배치를 위한 상용 수준의 디딤돌을 확보한다.
현재 대규모 파운데이션 모델은 범용성을 갖췄지만, 실제로 배포하면 성공률이 대략 80%에서 90% 수준에 머문다.
제이슨 마는 현재 성공률로 10번 연속 작업을 마칠 확률은 0.1% 미만이라며 상업적 배치에 한계가 있다고 본다.
반면 특정 작업에 특화된 파이프라인 모델은 높은 성공률을 보이지만, 작업 확장성이 떨어진다는 단점이 있다.
다이애나 로보틱스의 연구 결과물인 'Dyna-1'은 식당 냅킨 접기 작업을 위해 파인 튜닝된 범용 로봇 파운데이션 모델이다.
Dyna-1은 24시간 연속 가동 테스트에서 99.4%의 높은 성공률을 기록하여 견고한 성능을 입증했다.
이 모델은 조명 변화와 같은 다양한 환경 변화에도 안정적인 작업 수행 능력을 유지하는 것으로 확인됐다.
로봇이 냅킨을 여러 장 집어드는 것과 같은 예상치 못한 오류 상황에서 스스로 복구하는 능력은 상업적 환경에서 필수적이다.
실험실 데모와 달리 상업 현장에서는 정밀한 성공 기준과 등급 분류가 필수적이다.
기존의 사전 학습 및 사후 학습만으로는 로봇이 실수 시 분포를 벗어나 멈추는 한계가 있어 복구 능력의 중요성이 부각된다.
로봇의 실수마다 점수를 깎아 오류를 스스로 인지하고 복구하도록 유도하는 보상 모델이 도입됐다.
로봇이 실수할 때마다 점수가 하락하여 모델이 오류를 인지하고 스스로 복구하도록 유도한다.
자율 주행 중 보상 모델이 점수를 단조 증가시키며 로봇이 안정적으로 작업을 수행하도록 돕는다.
모델 성능이 90% 수준에 도달하면 수동 감독 방식은 비효율적이므로, 다이애나 로보틱스는 '확장 가능한 감독' 방식을 사용한다.
로봇이 냅킨을 접을 때 백그라운드에서 보상 모델을 실행하여 실수를 감지하고, 이 때 연구원이나 운영자는 모델이 어려워하는 영상 사례를 파악한다.
해당 사례에 대해 정밀한 데이터 수집과 오류 복구 학습을 진행하며 인간의 개입이 포함된 능동 학습으로 오류 복구 능력을 강화한다.
냅킨은 변형 가능한 물체로, 놓일 수 있는 상태나 형태가 거의 무한대에 가깝다는 점이 특징이다.
능동 학습을 반복한 결과, 모델은 실수로부터 회복하는 새로운 방식을 스스로 학습하고 작업을 이어가는 것을 확인했다.
이러한 복구 기능 덕분에 Dyna-1은 99.4%라는 성공률로 냅킨을 접을 수 있었고, 현재 미국 내 여러 식당 현장에 배치되어 있다.
이 채널의 새 영상도 아티클로 메일 받으세요.
다이애나 로보틱스는 작년 말, 로봇이 새로운 현장에 배치될 때 추가 데이터 없이도 작업 성능을 유지할 수 있도록 다양한 작업을 수집하는 데이터 레시피를 연구했다.
CoRL 2025에서 시연된 Dyna-1은 참가자들의 방해에도 불구하고 3일 내내 쉬지 않고 티셔츠를 계속 접으며, 이전에 본 적 없는 환경에서도 작업을 수행할 수 있음을 증명했다.
또한 레드불 행사에서는 조명과 배경이 급변하는 상황에서도 캔 따기 작업을 성공적으로 수행하며 환경 변화에 대한 견고한 일반화 능력을 선보였다.
현재는 자체 하드웨어 스택을 구축하는 작업에 집중하고 있다. 로드맵에 포함될 가능성은 열려 있으나 구체적인 출시 계획은 잡히지 않았다.
상업적 파트너를 위한 개발자 키트는 아직 준비되지 않았다. 당장 이를 출시할 단계는 아니다.
교육 분야 진출은 현재 고려 대상이 아니나 미래 가능성은 열려 있다.
풀 스택 로봇 파이프라인이 성숙하고 자체 하드웨어와 데이터 수집 툴킷이 갖춰진다면 교육 분야 진출이 매우 흥미로울 것이라고 내다본다.
어린이 대상 로봇 학습은 충분히 가치 있는 영역이다.
다이애나 로보틱스의 장기적인 목표는 어디서나 누구에게나 배치될 수 있는 로봇 모델과 하드웨어 플랫폼을 개발하는 것이다.
현재는 기업용 사례에 집중하고 있는데, 기업 고객과 협업하는 것이 유통 경로상 더 쉽다고 판단하기 때문이다.
기업 현장은 로봇 배치와 반복 개선이 용이한 이상적인 시험대가 되며, 소비자용 제품은 오류 관용도가 낮고 개인정보 및 안전 문제 등 완성도 기준이 엄격하다는 점을 고려한 전략이다.
다이애나 로보틱스는 로봇과 인간의 상호작용이 중요하다고 보며, 음성 명령을 수행하는 로봇 모델을 지향한다.
기존의 훌륭한 음성-텍스트 변환 모델을 온보드에서 실행하여 인간의 의도나 음성을 빠르게 텍스트로 변환하고, 그 텍스트 명령을 추론 모델과 월드 모델이 해석하여 역할을 수행하게 한다.
로봇 파운데이션 모델은 여전히 임의 명령 실행 과정에서 병목 현상을 겪는다.
다이애나 로보틱스는 사전 학습, 사후 학습, 능동 학습을 모두 활용하여 로봇의 지능을 분배한다.
범용 모델을 충분히 학습시켜 물리 세계에 대한 일반적인 이해를 갖추게 하는 것이 매우 유용하다는 설명이다.
다양한 작업에서 습득한 오류 회복 행동을 보간하는 방식으로 모델의 회복력을 확보했다. 작업 특화 모델에만 의존할 경우 물리적 지식 보간이 어려워져 오류 대응력이 낮아진다.
자막에서 근거가 되는 대목을 찾아 답합니다.
AI Engineer의 다음 영상도 받아볼까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 26편 올렸어요.