도덕성 스트레스 테스트 프레임워크인 루프홀 소개
원본 영상 0:12모건 스탠리의 기계 학습 연구원인 브렌던 라파조는 오픈소스 프로젝트 '루프홀'을 소개했습니다. 라파조는 이 프로젝트가 모건 스탠리와는 아무런 관련이 없으며, 개인적인 관심사로 독립적으로 개발된 개인적인 노력이라고 강조했습니다. 루프홀은 불일치를 식별하여 개별 도덕 체계를 평가하고 개선하도록 설계된 적대적 에이전트 프레임워크를 활용합니다.
브렌던 라파조는 적대적 AI를 사용하여 개인의 도덕 체계를 면밀히 조사하고 개선하는 오픈소스 프로젝트인 '루프홀'을 소개합니다.
이 채널 새 영상도 이렇게 정리해 드릴까요?
모건 스탠리의 기계 학습 연구원인 브렌던 라파조는 오픈소스 프로젝트 '루프홀'을 소개했습니다. 라파조는 이 프로젝트가 모건 스탠리와는 아무런 관련이 없으며, 개인적인 관심사로 독립적으로 개발된 개인적인 노력이라고 강조했습니다. 루프홀은 불일치를 식별하여 개별 도덕 체계를 평가하고 개선하도록 설계된 적대적 에이전트 프레임워크를 활용합니다.
루프홀 프로젝트의 시작은 라파조가 23andMe와 같은 DNA 검사 서비스를 개인적으로 경험하면서 비롯되었습니다. 그는 DNA 데이터가 특히 법의학적 목적으로 어떻게 사용될 수 있는지에 대한 윤리적 '미끄러운 경사'에 대해 고심했습니다. 이는 데이터 사용과 관련된 모든 가능한 시나리오에 대해 구체적이고 미묘한 규칙을 수동으로 정의하는 것이 인지적으로 압도적이고 비현실적이라는 깨달음으로 이어졌습니다.
라파조는 사회의 법률 시스템이 근본적으로 집단적 도덕적 신념을 성문화하려는 시도라고 주장했습니다. 그는 복잡한 인간의 도덕을 정밀한 법률 프레임워크로 번역하는 과정을 본질적으로 어려운 작업으로 설명했습니다. 이러한 어려움은 종종 '실패 모드'로 이어지는데, 지나치게 일반적인 규칙은 그들이 지지하려던 도덕적 원칙의 정신에 위배되는 '이상한 예외 사례'를 만듭니다.
미묘한 경계의 복잡성을 탐색하기 위해 판례법을 사용하는 영국 보통법에 비유하면서, 라파조는 대규모 언어 모델(LLM)을 활용할 것을 제안했습니다. 그는 최신 세대의 LLM이 '인공 판례법 생성'에 필요한 종류의 고수준 도덕적 추론을 수행할 만큼 충분히 정교해졌다고 말했습니다. 루프홀의 핵심 목표는 이 과정을 자동화하여 사용자 정의 도덕적 입력에서 가상의 시나리오를 생성하여 견고성을 테스트하는 것입니다.
사용자는 터미널 기반 인터페이스를 통해 자연어로 도덕 시스템을 입력하여 루프홀과 상호 작용합니다. 그러면 시스템은 두 가지 유형의 에이전트를 배포합니다. 하나는 '허점'을 식별하도록 지시받은 에이전트로, 사용자 정의 규칙에 따라 비도덕적이지만 허용되는 시나리오이며, 다른 하나는 '과잉'을 찾도록 설계된 에이전트로, 도덕적으로 허용되지만 시스템에 의해 금지되는 상황입니다. 심판 에이전트는 이러한 시나리오를 평가하여 법률 코드가 자동 '패치'를 요구하는지 또는 사용자가 감지된 불일치를 해결하기 위해 수동 판결을 내려야 하는지 결정합니다.
루프홀의 기술 프레임워크는 사용자가 포괄적인 도덕적 원칙과 특정 성문화된 법률 시스템을 모두 입력하도록 요구합니다. 이 시스템은 서문 및 입력 코드의 다양한 섹션에 정확하고 법률적인 언어를 사용하는 것을 강조합니다. 이러한 구조화된 입력은 인공 판례법 생성을 허용하며, 이는 정의된 원칙을 다양한 실제 시나리오에 대해 엄격하게 테스트하는 데 사용됩니다.
설명적인 예시에서 라파조는 루프홀이 모델이 실제 DNA 자체가 아닌 DNA 아티팩트를 사용하여 DNA 기반 결과를 예측할 수 있는 시나리오를 어떻게 식별했는지 설명했습니다. 이 시스템은 사용자 정의 시스템에 따라 기술적으로 합법적이지만 입력에 따라 도덕적으로 반대되는 결과를 효과적으로 감지합니다. 루프홀에는 이러한 식별된 모순을 해결하기 위해 법률 코드에 대한 변경 사항을 제안하고 적용할 수 있는 '자동 패치' 메커니즘이 장착되어 있으며, 원래 시스템에 'git 스타일 차이'를 제공합니다.
라파조는 루프홀이 과잉을 발견한 사례를 제시했습니다. 이는 연구원이 유전 연구를 위해 제출된 피험자의 DNA에서 희귀하지만 치료 가능한 유전 질환을 발견한 경우입니다. 질환의 치료 가능한 특성에도 불구하고, 사용자의 초기 도덕적 틀은 이 정보의 공개를 금지할 수 있습니다. 자동 패치가 적절하거나 충분하지 않을 수 있는 이러한 복잡한 윤리적 딜레마에서 시스템은 이러한 사례를 수동 판단을 위해 인간 사용자에게 에스컬레이션하여 명시적인 도덕적 결정을 내리도록 요구합니다.
루프홀의 중요한 잠재적 응용 분야는 고객 대면 챗봇과 같은 AI 에이전트를 위한 '헌법'의 자동 생성입니다. 이 방법은 챗봇이 무엇을 논의해야 하고 무엇을 논의해서는 안 되는지 명확히 정의하여 운영 경계를 효과적으로 설정하는 것을 목표로 합니다. 적대적 에이전트를 사용함으로써 시스템은 목표 지향적 적대적(GAI) 테스트와 유사하게 챗봇의 시스템 프롬프트를 원치 않는 공개 또는 거부에 대해 스트레스 테스트하여 프롬프트의 견고성을 보장할 수 있습니다.
라파조는 또한 루프홀이 임시 또는 분산형 계약 협상을 가능하게 하는 도구로 구상했습니다. 이 시스템은 개인이 복잡한 기업 서비스 약관에 대해 개인 도덕적 프레임워크를 비교하여 계약 서명 전에 불일치를 강조할 수 있도록 합니다. 이 응용 프로그램은 협상 과정 초기에 잠재적인 도덕적 불일치를 드러내어 여러 당사자 간의 분산형 계약을 촉진하여 보다 명확하고 일치된 계약을 촉진합니다. 이 기능은 다양한 계약 관계에서 투명성과 공정성을 크게 향상시킬 수 있습니다. 이 시스템은 적대적 관점을 시뮬레이션하여 계약 내에 숨겨진 의미를 밝혀내고, 모든 당사자의 도덕적 및 윤리적 고려 사항이 명시적으로 다루어지고 조정되도록 보장하는 것을 목표로 합니다.
앞으로 라파조는 '더 똑똑한 정부' 또는 더 효율적인 거버넌스 프로세스를 만드는 데 루프홀의 잠재적 역할에 대해 추측했습니다. 그는 이것이 여전히 염원적인 목표로 남아 있지만, AI 지원 법률 및 윤리적 프레임워크의 더 넓은 의미를 강조한다고 인정했습니다. 이를 달성하려면 개인 정보 보호, 물류 복잡성, 그리고 기존 정부 구조에 이러한 시스템을 통합하는 것과 관련된 상당한 장애물을 극복해야 합니다. 장기적인 비전은 AI 기반 도덕적 및 법률적 평가를 통해 공공 정책 및 행정 효율성을 향상시키는 것을 목표로 합니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
이 채널 새 영상도 이렇게 정리해 드릴까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 24편 올렸어요.
숏츠는 빼고 보내 드려요. 메일이 필요 없어지면 언제든 구독을 끄실 수 있어요.