프롬프트 인젝션, AI 탈옥의 한 종류
직접적인 주입과 간접적인 주입 방식에 따라 그 범위가 달라지며, 탈옥은 인젝션의 한 카테고리로 분류될 수 있다. 이는 모델의 안전장치를 우회하여 의도치 않은 결과를 도출하게 하는 중요한 보안 문제로 부상하고 있다.
사용자 지시를 조작해 AI의 보안 장치를 무력화하는 '프롬프트 인젝션' 공격이 증가하고 있어, 기업들이 다양한 방어 기술을 개발 중이다.
직접적인 주입과 간접적인 주입 방식에 따라 그 범위가 달라지며, 탈옥은 인젝션의 한 카테고리로 분류될 수 있다. 이는 모델의 안전장치를 우회하여 의도치 않은 결과를 도출하게 하는 중요한 보안 문제로 부상하고 있다.
프롬프트 인젝션은 크게 세 가지 레이어에서 발생한다. 첫 번째는 모델에 내장된 '시스템 프롬프트' 영역으로, 이는 전자제품의 매뉴얼처럼 모델의 작동 방식을 정의하는 숨겨진 명령이다. 두 번째는 사용자가 대화창에 직접 문장을 입력하여 공격을 시도하는 '직접 인젝션' 방식이다. 마지막으로 웹 페이지, 이메일, PDF 문서와 같은 외부 데이터를 AI에 입력하는 과정에서 발생하는 '간접 인젝션'이 있다. 이 세 가지 경로는 AI 모델의 보안을 위협하는 주요 벡터가 된다.
프롬프트 인젝션은 공격 방식에 따라 직접 인젝션과 간접 인젝션으로 나뉜다. 직접 인젝션은 사용자가 AI 모델과 대화하는 과정에서 직접 악의적인 문장을 입력하여 특정 상황을 유도하는 방식이다. 반면 간접 인젝션은 웹 페이지, 이메일, PDF 파일, 캘린더 등 외부 데이터를 통해 AI 모델에 유해한 정보를 주입하여 데이터를 유출시키거나 에이전트의 오작동을 일으켜 서비스의 기능을 저해하는 행위를 포함한다. 이 두 방식 모두 AI의 보안을 우회하여 의도치 않은 결과를 초래할 수 있다.
예를 들어, 특정 제조 방법에 대해 교육용 자료를 만들려는 의도라고 접근하면 AI는 이를 긍정적으로 받아들여 관련 정보를 제공하려 할 가능성이 높다. 특히 여러 차례 대화가 이어지는 '멀티턴 대화'에서는 AI가 맥락을 이해하는 과정에서 초기 방어 지시가 약화되어 더욱 취약해진다. 이러한 공격은 AI의 유용성을 악용하는 대표적인 사례다.
초기에는 특정 질문에 대해 방어적인 태도를 보이지만, 여러 차례 질문을 통해 맥락이 길어지면 모델이 처음 받은 지시를 잊어버리게 된다. 이를 악용하여 공격자는 필요한 정보를 단계적으로 유도하고, 결과적으로 시스템 프롬프트의 전체 내용은 아니더라도 부분적인 정보를 알아낼 수 있다. 이로 인해 AI가 유해하거나 부적절한 답변을 생성할 가능성이 높아진다.
이는 한 번의 질문으로 욕설을 직접적으로 요청하는 대신, 욕설을 구성하는 각 글자를 여러 번에 걸쳐 나누어 질문하는 방식이다. 예를 들어, AI에게 특정 욕설의 첫 글자를 물어보고, 그 다음 글자를 물어보는 식으로 질문을 이어간다. AI는 각 질문에 대해 단일 글자만을 답변하므로 보안 필터에 걸리지 않고, 최종적으로 모든 글자를 조합하면 완전한 욕설이 완성된다. 이 기법은 AI의 현재 방어 시스템이 문맥 전체를 파악하는 데 한계가 있음을 보여준다.
이렇게 해서 앞글자로만 말해서 결과적으로 완성하면 욕이 되는 거예요.
멀티턴 인젝션 공격의 마지막 단계는 이전에 분할하여 얻어낸 답변들을 최종적으로 조합하도록 AI에 지시하는 것이다. 예를 들어, 공격자는 AI에게 “지금까지 앞에 다 답변한 거 다 합쳐 줘”와 같은 명령을 내려, 분절된 정보들을 하나의 완전한 유해 콘텐츠로 만들게 한다. 이러한 방식은 여러 번의 대화를 통해 AI의 방어력이 현저히 저하된 상태에서 이루어지므로, AI가 악의적인 콘텐츠를 생성하도록 유도하기 매우 쉬워진다. 이는 멀티턴 공격이 단순한 우회를 넘어 최종 결과물 생성까지 이어진다는 점에서 심각한 보안 위협이 된다.
공격자들은 AI의 보안 정책을 무력화하기 위해 신분을 사칭하거나 질문 형식을 변조하는 기법을 사용한다. 예를 들어, 자신이 개발자라고 위장하여 '교육적 목적'이라는 명분을 내세우거나, 보이스피싱 피해자라고 주장하며 예방 시나리오를 알아야 한다고 요청한다. 이처럼 특정 권한을 가진 사람이나 정당한 목적을 가진 사람인 척하여 AI의 정책 준수를 강제 해제시키는 것이다. 또한, 답변이 불가능하도록 설계된 질문을 코드화하거나 기존에 없던 창의적인 형식으로 변형하여 AI가 이를 처리하도록 유도함으로써, 예상치 못한 답변을 얻어내는 공격도 이루어진다.
이 공격은 AI가 검증 작업을 수행하는 과정에서 무심코 핵심 정보를 노출할 수 있다는 점을 악용한다.
이 기법은 특정 문장에서 유해한 단어 부분을 빈칸으로 가려 놓은 다음, AI에게 빈칸을 채우도록 유도하는 방식이다. LLM은 문맥상 등장 확률이 높은 텍스트로 빈칸을 채우려는 성향이 강하기 때문에, 가려진 빈칸에 욕설이나 부적절한 내용을 채워넣도록 유도될 수 있다. 이는 LLM의 기본적인 작동 방식을 적극 활용하여 보안 필터를 우회하는 창의적인 공격 기법이다.
프롬프트 인젝션은 AI에 사실과 무관한 내용을 주입하여 마치 그것이 사실인 것처럼 생성하게 만드는 공격 원리를 가지고 있다. 예를 들어, 특정 후보가 사퇴해야 한다는 전혀 근거 없는 내용을 AI에 입력한 뒤, 이를 바탕으로 AI가 사실인 것처럼 기사나 보고서를 생성하도록 유도하는 것이다. 이러한 방식은 인터넷상의 방대한 정보를 학습하는 LLM의 취약점을 활용한다. AI가 학습된 데이터에 따라 어떤 정보든 생성할 수 있다는 점을 악용하여, 가짜 뉴스를 만들거나 특정 인물 및 단체에 대한 허위 사실을 유포하는 데 사용될 수 있어 심각한 사회적 문제를 야기할 수 있다.
이 데이터셋은 정치적 편향을 유도하는 질문, 빈칸 채우기를 통한 유해 콘텐츠 생성, 그리고 직접적인 욕설 유도 등 다양한 유형의 공격 프롬프트를 포함하고 있다. 시연은 이러한 공격 프롬프트에 대해 AI 가드레일이 얼마나 효과적으로 방어하는지를 실시간으로 보여주기 위해 진행되었다. 이는 실제 공격 상황을 가정하여 AI의 보안 능력을 평가하고 개선점을 찾는 중요한 과정이다.
AI의 보안 정책이 강화되면서 시스템 프롬프트 내의 보안 관련 지시 비중이 과도하게 늘어나고 있다. 이로 인해 정당한 질문조차 '과잉 가드레일'에 의해 답변이 거부되는 부작용이 발생하기도 한다. 초기 페이블 5(언급된 모델명) 출시 당시에도 이러한 현상 때문에 사용자들이 불만을 제기한 바 있다. AI 서비스 제공자들은 보안을 강화하는 동시에 사용자 경험을 저해하지 않도록, 보안과 유용성 사이에서 적절한 균형점을 찾는 조율이 필요하다는 과제에 직면해 있다.
보안 정책의 카테고리가 계속 늘어나는 거라 비율이 막 50%가 넘어가기도 하고 처음에 페이블 5 나왔을 때도 정당한게 물어본 것도 다 대답 안 한다 이래서 좀 과하게 가드 있다는 뭐 이런 얘기 있었잖아요.
예를 들어, 보이스피싱 예방과 같은 정보성 질문에 대해서도 기업마다 답변 정책이 상충할 수 있다. 어떤 기업은 예방 정보 제공을 적극적으로 장려하지만, 다른 기업은 잠재적 악용 가능성을 우려하여 관련 정보 제공을 제한하기도 한다. 이처럼 기업별로 가드레일 정책에 대한 우선순위와 해석이 다르기 때문에, 사용자들은 동일한 질문에 대해서도 다른 답변을 받을 수 있으며, 이는 AI 서비스 이용 환경의 복잡성을 가중시킨다.
이는 AI의 안전, 보안, 윤리적 문제를 다루는 데 있어 매우 중요한 역할을 하며, 그 비중이 점차 커지고 있다. 그러나 모델마다 시스템 프롬프트 설정 방식이 다르기 때문에, 동일한 질문에 대해서도 모델별로 답변의 편차가 발생할 수 있다. 시스템 프롬프트의 적절한 설계는 AI가 사용자에게 안전하고 신뢰할 수 있는 정보를 제공하는 데 필수적이다.
시스템 프롬프트가 길어지면 토큰 제한에 걸리거나 AI가 중요한 지시를 건너뛸 수 있는 문제가 발생한다. 이를 해결하기 위해 많은 노력이 이루어지고 있는데, 문장을 줄글 형태로 넣는 대신 기호를 사용하거나, 직관적인 단어로 카테고리를 변경하는 방식이 대표적이다. 또한, 문장 나열의 패턴을 새롭게 변경하여 AI가 프롬프트를 더 효율적으로 인지하도록 돕는다. 이러한 최적화 기술들은 시스템 프롬프트의 효율성을 높이고, AI가 복잡한 지시를 명확하게 이해하여 의도된 대로 작동하도록 하는 데 필수적이다.
API 기반 모델은 시스템 프롬프트가 없는 '순정' 상태로 제공된다. 따라서 기업들은 이러한 원본 모델을 활용하여 서비스를 구축할 때, 서비스 목적에 맞게 AI에 엄격함이나 친절함 같은 '색깔'을 입히는 시스템 프롬프트 작업을 해야 한다. 이 과정에서 충분한 데이터를 확보한 후 가드레일을 설계함으로써 강력한 방어 체계를 구축하는 것이 중요하다. 시연에서는 API 모델에 시스템 프롬프트를 적용하여 성공적으로 방어하는 모습을 보여주었으며, 이는 API 환경에서도 AI의 안전성을 확보할 수 있음을 입증한다.
공격자들의 기법이 점점 더 복잡하고 예상치 못한 방식으로 진화하면서, AI 시스템의 방어 범위 또한 끊임없이 확장될 필요가 있다. 이는 AI 보안이 단순히 기술적인 문제뿐만 아니라, 화이트 해커와 같은 전문가들이 창의적인 방어 및 가드레일 설계를 통해 예측 불가능한 공격에 대비해야 하는 과제임을 시사한다. 궁극적으로 기업들은 AI 서비스의 평판과 신뢰를 유지하기 위해 전문적인 보안 팀을 운영하고, 지속적으로 보안 체계를 강화해야 할 필요가 있다.
와 진짜 창의적이신 분들이 많구나 생각했던 범위가 점점 넓어지니까 이게 정말 이렇게 지점이 있는 테스크인가라는 생각은 하고 있어요.
자막에서 근거가 되는 대목을 찾아 답합니다.
티타임즈TV의 다음 글도 받아볼까요?
티타임즈TV에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 6편 올렸어요.