제약회사가 '둠' 기반 세계를 만드는 이유: 에이전트 시스템 탐색
원본 영상 0:30알렉산더 체르노프는 제약 연구 개발 분야에서 '둠'과 같은 게임 세계를 구축하여 에이전트 시스템을 탐색하는 프로젝트를 소개했습니다. 그는 이 강연이 제약 연구 개발 자체에 대한 것이 아니라, 게임과 유사한 세계를 통해 제닉(Agentic) 시스템을 탐구하는 것에 초점을 맞춘다고 설명했습니다.
게임 엔진의 통제 루프와 실시간 피드백을 활용, AI 에이전트의 비결정적 행동을 연구하고 실제 시스템 설계에 적용합니다.
이 채널 새 영상도 이렇게 정리해 드릴까요?
알렉산더 체르노프는 제약 연구 개발 분야에서 '둠'과 같은 게임 세계를 구축하여 에이전트 시스템을 탐색하는 프로젝트를 소개했습니다. 그는 이 강연이 제약 연구 개발 자체에 대한 것이 아니라, 게임과 유사한 세계를 통해 제닉(Agentic) 시스템을 탐구하는 것에 초점을 맞춘다고 설명했습니다.
알렉산더 체르노프는 이 프로젝트가 '의미론적 거울'과 유사한 개념을 사용한다고 밝혔습니다. 그는 전체 둠 게임을 에이전트로 재구축하는 것이 아니라, 게임의 의미론을 이해하고 이를 에이전트로 복제하는 것이 목표라고 설명했습니다. 이는 디지털 트윈이 의도하는 바와 매우 유사하지만, 범위는 더 작다고 덧붙였습니다.
에이전트를 세계의 의미론적 거울로 활용하는 아이디어는 게임 엔진이 이미 수행하는 시뮬레이션을 처음부터 다시 만들지 않는다는 전제에서 출발합니다. 대신, 이 미러는 세 가지 계층으로 구성됩니다. 첫째, '구조적 미러'는 모든 액터의 위치, 건강, 얼굴 등 보이는 요소를 관찰자 상태 머신으로 약 7Hz로 추적합니다. 둘째, '의미론적 미러'는 샷건, 위험, 탄약 부족과 같은 레이블을 붙이는 소수의 퍼셉션 브로커를 통해 세계에 대한 해석을 제공합니다. 셋째, '행동' 계층에서는 1,000개의 에이전트 소비자가 추론과 관련된 작업을 수행하며, 이들 모두가 반드시 LLM을 실행하는 것은 아닙니다.
알렉산더 체르노프는 AI 엔진의 주요 문제를 전통적인 소프트웨어와 달리 비결정적이라는 점을 지적했습니다. AI의 행동은 환경과의 상호작용에서 나타나며, LLM 뒤에 있기 때문에 결정론적인 추론이 불가능합니다. 또한 길고 연쇄적인 의사결정 체인과 다중 상호작용에서 발생하는 행동, 그리고 환경에 따라 달라지는 결과가 AI 엔진의 복잡성을 가중시킨다고 설명했습니다. 반면, 게임 엔진은 이러한 문제에 대한 해결책을 제공합니다. 엄격한 제어 루프, 복잡한 상태 전환, 실시간 피드백, 공유 상태 기반 시스템, 그리고 이벤트 시스템은 에이전트 시스템에 필요한 핵심 기능을 제공하며, 이를 통해 AI 에이전트의 행동을 효과적으로 모델링하고 제어할 수 있다고 강조했습니다. 그는 게임 엔진이 이러한 복잡한 시스템을 탐색하기 위한 이상적인 환경이라고 주장했습니다.
이 시스템은 표준 둠이 아닌 패치된 둠을 기반으로 하며, 외부 세계와의 소통을 강화하여 에이전트를 연결할 수 있도록 설계되었습니다. 주요 기여 요소로는 ZSCRIPT로 작성된 'PH 상태 에이전트 프레임워크', 에이전트의 행동을 정의하는 '정책 가드 시스템', '외부 Rust 제어 평면', 'MCP 게이트웨이 통합', 그리고 '에이전트 셀 프레임워크 어댑터'가 있습니다. 이러한 요소들은 에이전트 시스템의 유연성과 확장성을 보장하며, 둠 환경 내에서 복잡한 AI 행동을 구현할 수 있게 합니다.
AI 에이전트가 게임 환경을 정확하게 인식하기 위해 월드 스테이트 모델링은 5개의 레이어로 구성됩니다. 첫째, '스페셜 스테이트'는 액터의 빠른 움직임을 다룹니다. 둘째, '존 스테이트'는 안전, 분쟁, 격리, 추출 구역의 네 가지 유형으로 나뉘며 공간적 맥락을 제공합니다. 셋째, '에이전트 스테이트'는 유한 상태 머신 행 카운터와 대상 참조를 포함하여 각 에이전트의 내부 상태를 정의합니다. 넷째, '정책 스테이트'는 에이전트가 게임 내에서 할 수 있는 행동과 특정 객체와의 상호작용 가능 여부를 규정합니다. 마지막으로, '시나리오 스테이트'는 특정 조건(예: ABCD 요인) 발생 시 에이전트의 특정 행동 가능 여부를 구현합니다.
에이전트가 게임 세계를 인식하는 방식은 세 가지 주요 센서 채널을 통해 이루어집니다. 첫 번째는 '스크립트 센서'로, 35Hz의 속도로 시야 거리, 3D 섹터 쿼리, 존 콘텍스트를 확인합니다. 두 번째는 현재 존 유형을 평가하는 '에이전트 비전 파이프라인'입니다. 이 파이프라인은 렌즈를 통해 방 안의 특정 객체를 보고 해당 객체에만 반응할 수 있도록 필터링된 정보를 제공합니다. 이러한 센서들은 에이전트가 게임 환경에서 필요한 정보를 효율적으로 수집하고 처리할 수 있도록 돕습니다.
이 시스템은 두 계층의 에이전트 비전을 통해 의미론적 미러를 생성합니다. 첫 번째 계층은 '저렴한 관찰자 스웜'으로, 스크립트가 7Hz로 액터 목록을 화면 좌표에 투영하여 특정 객체가 목격된 위치를 보여줍니다. 이 계층은 LLM이 없으며 결정론적으로 작동하여 빠른 처리가 가능합니다. 두 번째 계층은 'LLM 브로커 스웜'으로, 엔티티, HUD, 모션, 존의 네 가지 렌즈를 가지고 있습니다. 이 에이전트들은 브로커를 통해 이 렌즈들을 보고 게임 내에서 무엇을 볼 수 있는지 필터링합니다. 두 계층의 비전 시스템을 사용하는 이유는 처리 속도의 차이 때문입니다. LLM은 느리기 때문에, LLM 없이 처리할 수 있는 작업은 첫 번째 계층에서 빠르게 처리하고, LLM을 통해 추론이 필요한 작업은 두 번째 LLM 계층에서 처리하여 효율성을 극대화합니다.
알렉산더 체르노프는 Doom 기반의 AI 에이전트 시스템에서 캐시를 활용하여 효율성을 높인다고 설명했습니다. 이 캐시는 이전에 관찰된 정보를 저장하여, 동일한 객체를 다시 찾을 때 Open AI에 매번 같은 정보를 전송할 필요 없이 캐시에서 검색하도록 합니다. 이는 시간과 비용을 절약하는 효과를 가져오며, 일반적인 맵 플레이에 약 2달러 정도의 비용이 소요된다고 언급했습니다.
알렉산더 체르노프는 매트릭스 영화의 '에이전트 스미스'에서 영감을 받아 AI 에이전트 생성 시스템을 구현했다고 밝혔습니다. 그는 영화에서 네오가 방에 들어설 때 에이전트가 나타나 공격하는 것처럼, 비슷한 아이디어를 시나리오 처리 예시로 구현했다고 설명했습니다. 이는 특정 조건에서 에이전트가 동적으로 생성되어 특정 행동을 수행하는 시나리오를 가능하게 합니다.
이 시스템의 스크립트들은 애플리케이션 실행 시 컴파일되며, 런타임에 배포 가능한 특징을 가지고 있습니다. 이는 업데이트나 변경 사항이 발생했을 때 게임이 실행 중인 상태에서도 즉시 푸시할 수 있음을 의미합니다. 이러한 방식은 깃헙스(GitOps) 방식의 작업과 유사하며, 실시간으로 시스템을 조정하고 개선할 수 있는 유연성을 제공합니다.
이러한 실시간 배포 능력은 AI 에이전트의 행동 규칙이나 시나리오를 신속하게 수정하고 테스트할 수 있도록 합니다. 예를 들어, 특정 에이전트의 공격 패턴을 변경하거나 새로운 위험 요소를 도입할 때, 게임을 재시작할 필요 없이 즉시 적용하여 결과를 확인할 수 있습니다.
이 기능은 개발 및 연구 과정에서 매우 중요한 이점을 제공합니다. 빠른 반복과 실험을 통해 에이전트 시스템의 동작을 최적화하고, 예상치 못한 상황에 대한 대응 능력을 향상시킬 수 있습니다. 이는 제약 연구 개발과 같은 실제 응용 분야에서도 민첩한 개발을 가능하게 합니다.
따라서 이 시스템은 단순한 게임 시뮬레이션을 넘어, 실제 환경에서 에이전트 시스템을 관리하고 업데이트하는 방식에 대한 통찰을 제공합니다. 깃헙스 방식의 배포는 지속적인 통합 및 배포(CI/CD) 원칙을 에이전트 시스템 개발에 적용한 좋은 사례로 평가할 수 있습니다.
이 시스템은 다중 에이전트 조정 기능을 갖추고 있어, 에이전트들이 내부 게임 엔진을 통해 서로 소통할 수 있습니다. 이를 통해 에이전트들은 자신이 무엇을 하고 있는지 인지하며, 특정 행동을 함께 조율할 수 있습니다. 예를 들어, 한 에이전트가 '쏘기 시작하라'는 지시를 내리면, 다른 에이전트들도 이 행동에 동참하여 공격을 시도하는 방식으로 협력합니다.
이러한 조정 메커니즘은 복잡한 시나리오에서 에이전트들이 단일 목표를 향해 협동하거나, 분산된 작업을 효율적으로 수행하는 데 필수적입니다. 게임 엔진이 제공하는 공유 상태와 이벤트 시스템을 통해 에이전트 간의 실시간 정보 교환이 가능해집니다.
따라서 이 기능은 단순한 개별 에이전트의 행동을 넘어, 집단 지능 또는 분산 시스템의 행동을 연구하고 설계하는 데 중요한 기반을 제공합니다.
알렉산더 체르노프는 게임 내에서 구현된 원리들이 실제 애플리케이션에도 적용될 수 있음을 강조했습니다. 이 시스템은 '텔레메트리 이벤트'(구조화된 로깅)와 '리플레이 저장소'(감사 추적)를 갖추고 있어, 게임에서 발생하는 모든 일을 기록하고 재생할 수 있습니다. 이는 실제 애플리케이션에서 특정 프로세스나 디자인을 복제하고 싶을 때 동일하게 활용할 수 있는 기능입니다.
특히, 게임 내에서 이벤트가 발생할 때마다 기록되는 데이터는 실제 애플리케이션의 '감사 추적'과 같은 역할을 합니다. 이를 통해 시스템의 모든 동작을 상세하게 분석하고, 문제 발생 시 원인을 파악하며, 미래의 행동을 예측하는 데 활용할 수 있습니다.
이러한 접근 방식은 게임 환경이 단순히 오락을 넘어, 복잡한 실제 시스템의 동작을 모델링하고 검증하는 강력한 도구가 될 수 있음을 시사합니다.
알렉산더 체르노프는 AI 에이전트 시스템을 사용하여 지도를 한 번 실행하는 데 약 2달러 정도의 비용이 소요된다고 밝혔습니다. 그는 비용이 지도의 복잡성에 따라 달라질 수 있다고 덧붙였습니다. 이러한 비용 효율성은 'Semantic Cache Proxy '모스키토독''이라는 캐시 프록시를 사용하기 때문에 가능하다고 설명했습니다.
알렉산더 체르노프는 대규모 언어 모델(LM)이 시스템 내에서 '계획자'가 아니라 '의미 엔진'의 역할을 수행한다고 강조했습니다. 그는 LM이 의사결정 체인의 일부를 담당하지만, 전체적인 계획과 실행은 게임 엔진의 통제하에 이루어진다고 설명했습니다. 게임 엔진은 에이전트 시스템에 필수적인 제어 루프, 상태 관리, 이벤트 시스템과 같은 엔지니어링 규율을 제공하기 때문입니다. 이는 LM의 역할을 명확히 하고, 게임 엔진이 복잡한 AI 에이전트 시스템을 관리하는 데 핵심적인 프레임워크를 제공한다는 점을 부각합니다.
알렉산더 체르노프는 AI 에이전트의 물체 감지 속도가 복잡도에 따라 크게 달라진다고 언급했습니다. 그는 데모에서 물체 감지에 5초, 3초, 2초가 걸리는 것을 볼 수 있었다며, 이는 시스템의 복잡성을 얼마나 높게 설정하느냐에 따라 달라지는 부분이라고 설명했습니다.
AI 에이전트 시스템에는 'ERQ(인터럽션)' 기능이 포함되어 있어, 각 에이전트가 특정 워크플로우(예: ABC)를 따르던 중에도 이를 중단하고 돌발 상황에 대응할 수 있습니다. ERQ는 에이전트에게 '이제 이 워크플로우를 따를 필요 없어'라고 지시하며, 게임에서 일어나는 어떤 반응이든 실시간으로 추론에 영향을 미칠 수 있게 합니다. 이는 에이전트가 예측 불가능한 환경에서 유연하게 행동하고, 변화하는 상황에 적응할 수 있도록 돕는 일종의 유비쿼터스 아날로그로 사용됩니다.
현재 시스템에는 사운드 상호작용이 구현되어 있지 않습니다. 그러나 알렉산더 체르노프는 시각 정보를 캡처하는 것처럼 사운드도 캡처할 수 있다고 언급했습니다. 그는 각 데몬이 고유한 소음을 내므로, 이 소음을 통해 어떤 데몬이 방에 있는지 이해하고 반응할 수 있다고 시사했습니다. 또한 플레이어 자신이 특정 위치에서 총을 쏘는 것과 같은 행동도 액션에 영향을 미칠 수 있다고 덧붙였습니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
이 채널 새 영상도 이렇게 정리해 드릴까요?
NDC Conferences에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 새 영상이 없었어요.
숏츠는 빼고 보내 드려요. 메일이 필요 없어지면 언제든 구독을 끄실 수 있어요.