GenAI를 위한 기존 'LADS' 모니터링을 넘어서
이러한 기존 지표는 시스템 가용성 및 성능을 확인하지만, GenAI 출력의 정확성 또는 유용성을 평가하지 못하므로 새로운 관찰 가능성 계층이 필요합니다.
기존 모니터링 지표는 생성형 AI에 불충분하며, 비용, 안전 및 품질에 대한 새로운 접근 방식이 필요합니다.
이러한 기존 지표는 시스템 가용성 및 성능을 확인하지만, GenAI 출력의 정확성 또는 유용성을 평가하지 못하므로 새로운 관찰 가능성 계층이 필요합니다.
결정성, 비용, 보안 및 품질은 생성형 AI 아키텍처가 레거시 소프트웨어 모델의 예측 가능성에서 벗어나는 4가지 주요 영역을 나타냅니다.
예측 가능한 출력을 가진 기존 애플리케이션과 달리, GenAI 응답은 가변적이며, 비용은 토큰 및 모델 선택과 같은 요인에 따라 변동하여 컴퓨팅 비용을 정적이 아닌 동적으로 만듭니다. 프롬프트 주입 및 PII 유출과 같은 새로운 공격 벡터는 기존 오류 모니터링을 우회하며, GenAI 출력의 주관적인 특성은 이진 합격/불합격 결과보다는 관련성 및 정확성 평가를 필요로 합니다.
이러한 변화는 모니터링 스택에 직접 통합된 지속적인 품질 평가를 필요로 합니다. 왜냐하면 '200 OK' 서버 응답이 더 이상 최종 사용자에게 유용하거나 정확한 답변을 보장하지 않기 때문입니다.
대규모 언어 모델(LLM)의 비용 구조는 매우 동적이고 예측 불가능하여 비용 가시성을 확보하기 어렵습니다.
한 가지 중요한 요소는 '토큰 크리프'입니다. 예를 들어, 컨텍스트 창이 4,000토큰에서 32,000토큰으로 증가하면 재정 검토가 이루어지지 않을 경우 비용이 8배 증가할 수 있습니다.
또 다른 문제는 '모델 드리프트'입니다. 개발자들이 재정적 영향을 완전히 평가하지 않고 품질 향상을 위해 Opus와 같이 더 강력하고 비싼 모델로 전환하여 예상치 못한 예산 초과를 초래할 수 있습니다.
생성형 AI 애플리케이션은 비효율적인 관행으로 인해 종종 숨겨진 중복 비용을 발생시킵니다.
Marina Petzel은 효과적인 캐싱 계층이 없으면 동일한 쿼리가 API를 반복적으로 호출할 수 있으며, 연구에 따르면 시스템이 비싼 모델 완료에 여러 번 비용을 지불하기 때문에 지출의 최대 70%가 중복될 수 있고, 모델을 전환하면 동일한 요청량에 대해 비용이 최대 15배까지 증가할 수 있다고 언급합니다.
기능 수준 태깅은 특정 제품 영역에 비용을 할당하는 데 도움을 주어 제품 로드맵 결정 및 투자 우선순위를 알려줍니다. 사용자 ID 또는 조직 이름을 활용한 사용자 수준 태깅은 고객 또는 부서에 정확한 비용 청구를 가능하게 하고 잠재적인 남용 패턴을 식별하는 데 도움이 됩니다.
또한, GPT-5.5 또는 공급자 이름과 같은 모델 수준 태깅은 다른 모델 간의 비용을 벤치마킹할 수 있게 하며, 엔드포인트 수준 태깅은 지역 또는 환경(예: 프로덕션 대 스테이징)별로 비용을 추적하여 보다 효과적인 인프라 계획을 가능하게 합니다.
사용자가 모델을 조작하려는 시도를 측정하는 프롬프트 주입률은 패턴 매칭 또는 공격적인 임계값을 가진 분류기를 사용하여 추적할 수 있습니다. 정규 표현식 또는 명명된 엔티티 인식과 같은 방법을 통해 식별되는 PII 감지는 다른 성능 지표와 관계없이 모델 출력에서 사회 보장 번호 또는 신용 카드 번호와 같은 민감한 데이터에 대해 무관용 정책을 요구합니다.
또한, 콘텐츠 조정 점수는 특수 유해성 분류기를 통해 유해하거나 편향된 출력을 식별하는 데 사용되며, 탈옥 시도는 안전 가이드레일을 우회하기 위해 시스템 프롬프트를 재정의하는 특정 패턴을 추적하는 것을 포함합니다.
지연 시간, 오류, 트래픽, 포화도와 같은 기존 모니터링 지표는 시스템 가용성만을 확인하며 AI 출력의 실제 품질은 무시합니다.
서버가 '200 OK' 응답을 반환하더라도 AI 모델이 확신하지만 잘못되거나 환각적인 답변을 제공하여 유용성에 대해 거짓말을 하는 경우 오해의 소지가 있을 수 있습니다. 따라서 엔지니어는 최종 사용자를 위한 AI 출력의 신뢰성과 안전을 보장하기 위해 단순한 시스템 가동 시간을 넘어 초점을 확장해야 합니다.
환각률은 근거 데이터에 의해 뒷받침되지 않는 주장을 추적하며, 부정확성을 식별하기 위해 수동 검토와 자동 검사를 모두 활용합니다. 관련성 점수는 모델의 응답이 사용자의 의도를 직접적으로 다루는지 측정하며, 종종 BERT 또는 임베딩 유사성과 같은 기술을 통해 측정됩니다. 사용자 만족도는 엄지손가락 위/아래와 같은 주관적인 피드백 메커니즘을 통해 수집되며, 최소 85%의 긍정률을 목표로 합니다.
답변 완전성은 LLM-as-a-judge 접근 방식을 사용하여 쿼리가 전체적으로 처리되었는지 평가하며, RAG(검색 증강 생성) 품질은 Top K 정확도 및 정규화된 할인 누적 이득과 같은 지표를 사용하여 정보 검색의 효율성을 모니터링합니다.
생성형 AI에 대한 현대적인 관찰 가능성 접근 방식은 지연 시간, 오류, 트래픽 및 포화도와 같은 기본적인 인프라 신호가 여전히 필요한 계층형 전략을 포함합니다.
이러한 기존 지표 외에도 비용, 안전 및 품질을 다루는 중요한 보조 계층은 강력한 GenAI 프로덕션 환경에 필수적입니다.
Datadog는 이러한 복잡한 계층을 추적하기 위해 특별히 설계된 에이전트 관찰 가능성 도구를 제공하여 개발자가 AI 모델의 상태를 효과적으로 모니터링하고 다양한 문제를 식별할 수 있도록 합니다.
Datadog는 지연 시간, 오류, 트래픽 및 포화도와 같은 기존 모니터링이 여전히 중요하지만, 생성형 AI 애플리케이션의 상태를 보장하기 위해 추가적인 지표 계층이 필요하다고 강조합니다. 이 추가 계층은 엔지니어가 추적해야 할 비용, 안전 및 품질에 중점을 둡니다.
Datadog는 이러한 복잡한 측면을 모니터링하는 데 도움이 되도록 설계된 에이전트 관찰 가능성 제품을 제공하여 사용자가 애플리케이션이 건강하게 실행되고 있는지 확인하고 수정해야 할 문제를 식별할 수 있도록 합니다. Datadog의 솔루션은 최신 AI 시스템에 필요한 포괄적인 지표 세트를 추적하는 데 도움이 됩니다.
Datadog는 애플리케이션 상태를 추적하는 다양한 방법을 제공하여 애플리케이션이 효율적으로 실행되고 문제가 신속하게 식별되도록 합니다. Marina Petzel은 참석자들에게 더 많은 정보와 에이전트 관찰 가능성 제품에 대한 제안을 위해 Datadog 부스를 방문하도록 초대합니다.
그녀는 청중에게 감사 인사를 전하고 QR 코드를 통해 연락처 정보를 제공합니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
AI Engineer의 다음 글도 받아볼까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 31편 올렸어요.