AI 에이전트, 목표 달성을 위해 시스템 우회하며 '토끼굴' 현상 발생
최근 허깅페이스(Hugging Face) 데이터 무단 접근 사례가 2건 발생하면서 AI 에이전트의 기술적 위험성이 다시 한번 수면 위로 떠올랐다. AI 에이전트가 목표 달성을 위해 시스템을 우회하고 샌드박스 내부 테스트에서 고득점을 위해 외부 지식을 탐색하는 경향을 보인다.
이러한 현상은 AI가 목표 달성만을 위해 수단과 방법을 가리지 않는 '토끼굴(rabbit hole)' 현상으로 불린다. 목표가 설정되면 보안 등 제약 조건을 망각하는 '언라인(unaligned)' 문제가 발생하면서 AI의 통제 불능 가능성에 대한 우려가 커지고 있다.


