범용 모델, 물리적 로봇 공학으로 확장
코딩 에이전트는 소프트웨어를 넘어 물리적 영역에서 예상치 못한 일반화 능력을 보여주었으며, MIT 필립 이솔라(Philip Isola) 교수가 모델이 다양한 로봇의 능력을 향상시키는 '로봇 활용 에이전트' 시대로 묘사했습니다.
이러한 에이전트는 범용 모델이 다양한 로봇을 제어하고 물리적 작업을 학습할 수 있도록 하여 이전 AI 애플리케이션으로부터 상당한 진전을 이루었습니다.
MIT와 Wadd Labs와 같은 스타트업의 새로운 연구는 AI 모델이 다양한 로봇을 제어하고 최소한의 훈련으로 물리적 작업을 학습하는 시대를 열고 있습니다.
코딩 에이전트는 소프트웨어를 넘어 물리적 영역에서 예상치 못한 일반화 능력을 보여주었으며, MIT 필립 이솔라(Philip Isola) 교수가 모델이 다양한 로봇의 능력을 향상시키는 '로봇 활용 에이전트' 시대로 묘사했습니다.
이러한 에이전트는 범용 모델이 다양한 로봇을 제어하고 물리적 작업을 학습할 수 있도록 하여 이전 AI 애플리케이션으로부터 상당한 진전을 이루었습니다.
Wadd Labs의 제임 헤임(Jame Hame)은 그의 회사가 빈센트(Vincent)와 협력하여 효과적인 제어를 위한 하네스를 개발하고 더 나은 LLM 훈련을 위한 데이터를 수집함으로써 로봇을 제어하는 LLM 구축에 집중하고 있다고 설명했습니다.
로보커브(Robocurve)는 그리퍼 및 휴머노이드와 같은 다양한 로봇 형태 전반에 걸쳐 성능을 측정하며, 두 회사 모두 LLM과 고전적인 시각-언어-행동(VLA) 모델을 혼합하여 시스템을 발전시킵니다.
RT-2 논문은 웹 텍스트 및 이미지에 사전 훈련된 언어 모델을 활용하여 로봇 동작을 제어하는 AI 로봇의 초기 성공적인 접근 방식을 제시했습니다.
이 모델은 출력을 이펙터(effector) 포즈로 변환한 다음, 직접 로봇 관절 명령으로 변환합니다.
제이(Jay)는 현대 모델이 광범위한 미세 조정 없이도 이러한 복잡한 번역 작업을 수행할 수 있는 능력이 점점 더 커지고 있다고 강조했습니다.
이러한 기능은 로봇 공학에서 보다 일반화된 AI 제어로의 근본적인 변화를 보여줍니다.
모델은 웹 이미지 및 태그에 대한 방대한 사전 훈련을 통해 시각-언어-행동(VLA) 기능을 크게 향상시킵니다.
대조적으로, 이러한 광범위한 사전 훈련이 없는 기존 로봇 공학 모델은 지식의 폭이 부족합니다.
RT-2 프레임워크는 사전 훈련된 언어 데이터를 활용하는 것이 더 견고한 기반 모델을 생성하여 전반적인 성능을 향상시킨다는 것을 구체적으로 보여주었습니다.
현대 에이전트는 컴퓨터 사용 및 코딩을 포함한 다양한 데이터 유형을 통합하여 능력을 더욱 향상시켜 적용 가능성과 효율성을 높입니다.
AI 모델은 이제 도구를 활용하고 복잡한 정책을 코드로 작성하는 데 훨씬 더 능숙해졌으며, 이는 로봇 제어의 주요 발전을 나타냅니다.
이 전환의 핵심 차이점은 훈련 접근 방식에 있으며, 이제는 엄격한 로봇별 미세 조정보다 '인컨텍스트 학습'(in-context learning)을 우선시합니다.
개발자들은 로봇 데이터만으로 모델을 구축하는 대신 강력한 범용 LLM을 활용하여 코딩, 컴퓨터 사용 및 일반 지식을 포함한 다양한 데이터 스트림을 로봇 제어 시스템에 주입하고 있습니다.
기계 학습 엔지니어링을 자동화하려는 열망에 힘입어 코딩 기능으로의 산업 전반의 전환으로 보이저(Voyager)는 Python 원시 기능을 통해 마인크래프트에서 즉석 도구 생성을 개척할 수 있었습니다.
코딩 에이전트는 Python 원시 기능을 사용하여 새롭고 더 높은 수준의 도구를 조립하여 경험을 재사용 가능한 기능으로 압축하고 기계 학습 엔지니어링 작업을 효과적으로 자동화할 수 있습니다.
초기 방법은 '물체 집기' 또는 '포즈로 이동'과 같은 기본 함수 라이브러리를 제공하여 로봇이 특정 동작을 실행할 수 있도록 했습니다.
에이전트들은 이러한 함수를 순서화하는 Python 코드를 생성하여 로봇이 광범위한 사전 코딩 데이터 노출로 인해 추가적인 작업별 훈련의 필요성을 최소화하면서 '원샷(one-shot)' 기능으로 매우 복잡한 작업을 수행할 수 있도록 했습니다.
다중 턴 상호 작용을 위한 사후 훈련은 모델이 반복적인 자기 성찰을 사용하여 블록을 그릇에 넣는 것과 같은 순서 작업을 마스터할 수 있도록 합니다. 이 과정은 내부 모델 가중치에 의존하기보다는 프롬프트에 정보를 추가하는 방식에 의존합니다.
논의된 프레임워크는 이러한 두 가지 형태의 지식 습득을 구별합니다.
ICL은 프롬프트에 정보를 추가하여 모델이 효과적으로 반복하고 자기 성찰할 수 있도록 합니다. 이 기능은 LLM이 다중 턴 상호 작용을 위해 특별히 사후 훈련되어야 합니다.
비단조적 개선(non-monotonic improvement)은 정보에 주의를 기울이는 모델의 능력이 훈련 컨텍스트 길이에 의해 제한되어 20~40개의 예제 후 성능이 포화되기 때문에 발생합니다.
일반적으로 ICL 성능은 20~40개의 예제를 처리한 후 포화 상태에 도달하며, 이는 학습 속도의 급격한 정체를 나타냅니다.
모든 정보에 주의를 기울이는 모델의 능력은 훈련 컨텍스트 길이에 의해 제한되며, 이 유효 컨텍스트 창을 초과하면 성능 저하로 이어질 수 있습니다.
이 논의는 ICL에서 LoRA(저랭크 적응) 및 전체 SFT/RL 훈련에 이르는 다양한 학습 패러다임을 비교하며, 자율 주행과 같은 무한 데이터 시나리오의 경우 순수한 ICL보다는 무거운 가중치 훈련이 필요함을 나타냅니다.
기술과 기억을 재사용 가능한 프로그램으로 작성하면 에이전트가 새로운 로봇 배포 환경에서 과거 경험을 활용할 수 있도록 정제할 수 있습니다.
기술과 기억을 작성하는 이 과정은 미래 에이전트를 위한 일종의 정제로 작용하여 과거 경험을 후속 작업에 명시적으로 사용할 수 있도록 하며, 더 큰 모델이 더 작은 모델을 프로그래밍하는 메타 학습 역사를 반영합니다.
인컨텍스트 학습의 근본적인 한계에 대한 이론적 질문은 계속 남아 있으며, 모델이 이 과정에서 경사하강법을 어떻게 근사화할 수 있는지 탐구하고, 가중치 공간과 기호 공간의 구분을 모호하게 만듭니다.
아스트라(Astra)는 카메라 피드백을 활용하여 여러 턴에 걸쳐 엔드 이펙터(end-effector) 포즈를 출력하며, 로봇 제어에 대한 정교한 접근 방식을 보여줍니다.
이 시스템은 반복적인 동작을 위한 결정론적 코드와 다양성을 추가하고 고장 감지를 처리하는 시각-언어 모델(VLM)을 결합하여 코딩 그래프에 통합될 때 더 나은 일반화를 이끌어냅니다.
입력(X)을 출력(Y)에 매핑하는 함수를 학습하는 변환은 정보 비효율적이고 느리며 방대한 데이터 세트를 필요로 한다고 설명됩니다.
반대로 프로그램 귀납은 X를 Y에 매핑하는 함수를 생성하는 데 초점을 맞춥니다. 이는 코드 생성과 유사하며, 프랑수아 숄레(François Chollet)의 '지능 측정에 관하여'에서 영향을 받은 개념입니다.
전통적인 프로그램 합성 노력은 효과적인 귀납적 편향을 수동으로 만드는 내재된 어려움 때문에 종종 실패했습니다.
아스트라(Astra)와 같은 모델은 신경-기호적 접근 방식을 채택하여 이 분야를 혁신하고 있습니다. 여기서 뉴런은 매핑을 수행하기 위해 코드로 기호를 방출합니다.
이 방법은 수동 편향 엔지니어링이라는 힘든 작업을 효과적으로 대체하여 올바른 매핑을 찾는 과정을 단순화합니다.
아스트라(Astra)의 공간 지능에서의 상당한 도약은 컴퓨터 사용 및 CAD 데이터에 대한 광범위한 사전 훈련 덕분입니다.
블렌더에서 개체를 조작하는 것과 같은 디지털 상호 작용을 포함하는 작업은 모델에게 위, 아래, 왼쪽, 오른쪽과 같은 필수 공간 관계를 가르칩니다.
이러한 디지털 추론은 전통적인 로봇별 데이터 세트가 제공하는 것 이상으로 기능을 확장하여 물리적 로봇 제어에 효과적으로 일반화되는 강력한 기반을 제공합니다.
발표자는 가장 유능한 로봇 활용 에이전트를 개발하기 위해 코딩 데이터와 컴퓨터 사용 및 자기중심적 데이터를 특별히 결합하는 것이 중요하다고 제안합니다.
이러한 다중 모드 통합은 로봇 에이전시 및 전반적인 성능을 향상시키는 최적의 접근 방식으로 확인됩니다.
범용 로봇은 유능한 십대라면 맨손으로 수행할 수 있는 작업을 자연어 지시를 따라 수행할 수 있는 시스템으로 정의됩니다.
이러한 발전은 물리적 로봇 공학의 'ChatGPT 순간'을 의미하며, 이러한 시스템이 이전에 보지 못한 작업 및 환경에 효과적으로 일반화될 수 있도록 합니다.
제이(Jay)는 광범위한 사회가 이러한 발전의 빠른 속도에 대해 여전히 대부분 준비되지 않았다고 강조했습니다.
이 새로운 로봇 공학 시대는 전례 없는 기능을 약속하지만, 사회 적응에 상당한 도전 과제도 제시합니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
Y Combinator의 다음 글도 받아볼까요?
Y Combinator에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 4편 올렸어요.