대부분의 코드 작업 승인, 수동 승인 피로감 초래
원본 영상 0:00클로드 코드 사용에 대한 연구 결과에 따르면, 권한 프롬프트 중 97%가 사용자에게서 승인되는 것으로 나타났습니다. 이는 대부분의 코드 작업이 실제로 승인되지만, 사용자가 매번 수동으로 작업을 승인해야 하는 반복적인 피로감을 유발할 수 있음을 시사합니다. 이러한 반복적인 승인 과정은 작업 효율성을 저해하는 요인으로 작용합니다.
클로드 코드의 자동 모드는 별도의 분류기를 통해 잠재적 위험을 감지하고, AI가 스스로 작업을 승인하지 않아 편향을 방지하며 사용자 개입을 줄여 효율성을 높입니다.
이 채널 새 영상도 이렇게 정리해 드릴까요?
클로드 코드 사용에 대한 연구 결과에 따르면, 권한 프롬프트 중 97%가 사용자에게서 승인되는 것으로 나타났습니다. 이는 대부분의 코드 작업이 실제로 승인되지만, 사용자가 매번 수동으로 작업을 승인해야 하는 반복적인 피로감을 유발할 수 있음을 시사합니다. 이러한 반복적인 승인 과정은 작업 효율성을 저해하는 요인으로 작용합니다.
수동 승인으로 인한 피로감을 해소하기 위해 몇 달 전 클로드 코드에 자동 모드가 도입되었습니다. 이 자동 모드는 잠재적으로 해로운 작업을 식별하고 차단하면서도, 클로드가 사용자의 방해 없이 장기적인 작업을 완료할 수 있도록 설계되었습니다. 이를 통해 개발자는 반복적인 승인 과정에서 벗어나 핵심 업무에 더욱 집중할 수 있게 됩니다.
클로드 코드가 자신의 행동을 스스로 승인할 경우, 자체 검토자로서 편향이 발생하여 공유 코드에 영향을 미칠 수 있습니다. 이를 방지하기 위해 클로드가 행동을 제안하면, 별도의 분류기가 이를 검사하고 승인하거나 거부합니다. 이 분류기는 클로드와 독립적으로 작동하여 객관적인 판단을 내리도록 설계된 중요한 안전 장치입니다.
분류기는 클로드의 도구 호출에 포함된 메시지만을 참조하여 판단합니다. 클로드의 추론, 응답 또는 도구 출력에는 영향을 받지 않으므로, 이러한 요소들로 인해 판단이 왜곡될 위험이 없습니다. 분류기는 각 행동이 사용자의 원래 의도와 일치하는지 비교하고, 일치하는 행동만을 승인합니다. 특히 클로드가 의도를 벗어나 되돌릴 수 없거나 파괴적인 행동을 시도하는지 여부를 중점적으로 확인하여 사용자 보호를 강화합니다.
클로드가 읽는 웹페이지나 파일에 원래 의도를 벗어나도록 유도하는 숨겨진 악성 지침이 포함될 수 있습니다. 이를 방어하기 위해 콘텐츠가 클로드의 컨텍스트에 들어가기 전에 서버 측 프로브가 모든 도구 결과를 스캔하여 악성 지침을 찾고, 의심스러운 내용에 대해 경고를 보내 콘텐츠를 회의적으로 처리하도록 합니다. 이후 분류기는 클로드의 다음 행동이 여전히 사용자가 요청한 내용과 일치하는지 다시 한번 확인합니다. 이처럼 악성 공격은 두 가지 계층의 필터를 모두 통과해야만 실행될 수 있어 보안이 강화됩니다.
클로드 코드의 보안 시스템을 검증하기 위해 프롬프트 주입 공격을 테스트했습니다. 그 결과, 프로브와 자동 모드를 모두 활성화한 상태에서는 프롬프트 주입 공격의 성공률이 0으로 떨어지는 것을 확인했습니다. 이는 이중 필터링 시스템이 악성 지침 공격에 대해 매우 효과적인 방어 기능을 제공함을 의미합니다.
모든 행동이 분류기를 거칠 필요는 없으며, 거부, 요청 및 허용 규칙이 먼저 실행됩니다. 이후 계층 검사가 어떤 행동을 분류기가 검토할지 결정합니다. 클로드 코드의 대부분의 작업은 읽기 전용이거나 복구 가능한 성격을 띠므로, 코드베이스 검색이나 프로젝트 파일 편집과 같은 작업은 분류기를 건너뛸 수 있습니다. 반면 셸 명령, 웹 페치 또는 환경 외부로 확장되는 작업과 같이 더 위험한 행동은 반드시 분류기를 통해 검사를 받도록 하여 안전성을 확보합니다.
자동 모드를 최대한 활용하기 위해서는 환경을 적절히 구성하는 것이 중요합니다. 관리자는 관리 설정에서 조직의 모든 개발자가 상속할 환경을 정의할 수 있으며, 개발자는 사용자 설정에서 자신만의 항목을 추가할 수 있습니다. 단, 관리자가 이미 설정한 내용을 개발자가 임의로 제거할 수는 없습니다. 이러한 설정을 통해 자동 모드는 각 팀의 특성과 보안 요구사항에 맞춰 최적의 효율성을 발휘할 수 있습니다.
더욱 세분화된 제어가 필요할 경우, '허용(allow)' 규칙을 사용하여 특정 예외를 허용할 수 있습니다. 또한, 명시적으로 요청하지 않으면 차단해야 하는 작업에는 '소프트 거부(soft deny)'를, 어떤 요청이든 상관없이 무조건 차단해야 하는 작업에는 '하드 거부(hard deny)'를 설정할 수 있습니다. 이러한 필드는 분류기가 각 검사에 고려하는 지침으로, 엄격한 규칙이 아닌 유연한 제어 기능을 제공하여 특정 상황에 맞는 맞춤형 보안 정책을 구현할 수 있도록 돕습니다.
클로드 코드의 자동 모드는 여러 구성 요소가 통합되어 작동합니다. 여기에는 클로드의 메시지가 아닌 사용자의 메시지를 읽는 독립적인 분류기, 되돌리기 어려운 행동을 위해 예약된 계층 검사 시스템, 숨겨진 악성 지침을 스캔하는 프로브, 그리고 사용자가 직접 구성할 수 있는 신뢰 경계가 포함됩니다. 이 모든 메커니즘이 결합되어 수동 검토 과정에서 놓칠 수 있는 잠재적인 위험 요소들을 효과적으로 감지하고 차단합니다. 이를 통해 자동 모드는 효율성과 안전성이라는 두 가지 목표를 동시에 달성합니다.
자동 모드를 배포할 때는 초기에는 좁은 범위에서 시작하여, 어떤 작업이 거부되는지 확인한 다음 점진적으로 범위를 넓혀나가는 전략이 권장됩니다. 프로덕션 인프라 변경과 같은 고위험 작업의 경우에는 클로드의 행동을 직접 검토하는 것이 여전히 중요합니다. 또는 더 높은 수준의 신뢰를 확보하기 위해 자체 평가 시스템을 구축하는 방법도 고려할 수 있습니다. 이는 자동 모드가 제공하는 효율성과 잠재적 위험 사이의 균형을 유지하기 위한 현실적인 접근 방식입니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
이 채널 새 영상도 이렇게 정리해 드릴까요?
Claude에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
숏츠는 빼고 보내 드려요. 메일이 필요 없어지면 언제든 구독을 끄실 수 있어요.