1억 개 이상 숏폼 비디오, 악성 콘텐츠와 시스템 탈취 시도에 직면
숏폼 비디오 데이터는 매우 복잡하고 불규칙한 특성을 보이며, 1억 개 이상의 비디오와 훨씬 더 많은 바이럴 콘텐츠가 산재한다.
이러한 환경에서 악의적인 콘텐츠와 시스템 탈취 시도가 끊이지 않고 있으며, 다국어 텍스트와 역동적인 데이터 변화로 인해 데이터 드리프트(data drift) 문제가 발생하여 정답을 정의하기 어렵다.
복잡한 숏폼 콘텐츠의 불일치 감지 및 저작권 문제 해결을 위한 멀티 에이전트 시스템을 소개한다.
숏폼 비디오 데이터는 매우 복잡하고 불규칙한 특성을 보이며, 1억 개 이상의 비디오와 훨씬 더 많은 바이럴 콘텐츠가 산재한다.
이러한 환경에서 악의적인 콘텐츠와 시스템 탈취 시도가 끊이지 않고 있으며, 다국어 텍스트와 역동적인 데이터 변화로 인해 데이터 드리프트(data drift) 문제가 발생하여 정답을 정의하기 어렵다.
인트라 모달리티(intra-modality) 불일치 문제는 기존 클립 모델을 활용하여 해결할 수 있으며, 이는 영상 내 부적절한 삽입 구간을 식별하는 데 초점을 맞춘다.
예를 들어 긴 비디오 시청 중 갑자기 광고, 특정 메시지, 정치적인 내용 등 클릭해서는 안 될 부분이 나타나는 경우를 감지하기 위해 클립 및 프레임 단위의 세부 영상 이해가 필요하다.
오늘날 AI 도구의 발달은 콘텐츠를 복제하거나 변형하는 과정을 매우 쉽게 만들었다. 이러한 기술적 환경은 저작권 위반과 크레딧 누락을 유발하며 콘텐츠 생태계의 불균형을 초래한다.
비 원본 콘텐츠를 식별하고 그 출처를 파악하는 작업이 더욱 중요해졌다. 복제된 콘텐츠를 걸러내지 못할 경우 저작권 침해 문제는 지속해서 발생하게 된다.
숏폼 비디오 데이터의 복잡한 문제를 해결하기 위해 다중 에이전트 시스템이 도입되었다.
이 시스템은 검색, 콘텐츠 이해, 추론 등 각 부분에 특화된 노드와 그 노드들을 조율하는 중앙 집중식 오케스트레이터의 이해가 필요하며, 단일 대규모 언어 모델(LLM)만으로는 해결하기 어려운 복합적인 문제를 처리할 수 있다.
중앙 집중식 오케스트레이터인 검토자 에이전트는 API 게이트웨이처럼 신호 분해를 수행하고 이미지에서 발생하는 일을 파악한다.
인식 에이전트는 비디오 언어 모델(VLM) 기반 도구로 영상 의미를 파악하고 시맨틱 임베딩과 광학 문자 인식(OCR)으로 메타 데이터를 추출한다.
이 과정에서 시간적 변화 기법으로 프레임을 압축하여 처리함으로써 효율성을 높인다.
벡터 데이터베이스와 그래프 데이터베이스를 병용해 온라인 추론 시 유사 클립과 엔티티를 파악하면 재현율을 높일 수 있다.
이를 통해 벡터 데이터베이스와 그래프 데이터베이스를 병용하여 온라인 추론 시 특정 클립과 유사한 클립, 엔티티 및 주제를 찾아 재현율을 높일 수 있도록 인덱싱한다.
수십억 프레임에 달하는 비디오 데이터를 처리하기 위해서는 압축적이고 비용 효율적인 모델 제공 방식이 필요하다.
이를 위해 Perceiver를 통해 전체 비디오의 의미론적 분해를 수행하고, 사전 학습, 미세 조정, 지식 추출, 양자화 과정을 거쳐 모델을 배포한다.
시스템은 쿼리, 클립 ID, 메타 데이터를 통해 데이터베이스에서 유사한 클립, 유사한 제작자, 기타 메타 데이터 정보를 탐색한다.
탐색된 결과는 스팸 점수 및 품질 분류 모델을 활용하여 순위가 재조정되며, 최종적으로 최상위 후보군이 인간 검토자에게 전달된다.
인간 검토자는 시각적 클립 정보에 댓글이나 감정, 라이선스 같은 사용자 피드백을 결합하는 역할을 수행한다.
VLM 및 기타 에이전트가 놓칠 수 있는 오프라인 신호나 실시간 반응을 파악하여 감정 변화를 식별하고, 검토자는 추가 데이터 요청 여부를 결정한다.
기존의 기초 VLM과 정제된 웹 데이터는 메타의 특정 작업 흐름에 맞지 않는다는 한계가 있다.
이에 따라 사용자 생성 비정형 데이터를 학습하기 위해 이미지 토큰과 언어 데이터를 활용하여 비전 트랜스포머를 처음부터 미세 조정하고, 정책 및 스키마 기반의 명령어 미세 조정을 적용한다.
데이터 포지셔닝(DPO) 단계는 주로 사후 학습 단계에서 모델을 특정 영역, 도메인 정책 이해 등에 맞게 미세 조정하는 데 사용된다.
이 기술은 대규모 언어 모델(LLM)이 처리하기 어려운 샘플을 추출하고 재학습하여 모델의 특정 정책 이해도를 증진시킨다.
모델 성능을 개선하고자 인간 검토자가 대기열에서 에이전트와 LLM 호출, 다중 콘텐츠 처리(MCP)로 수집된 얼굴 이미지를 검토한다.
모델의 임계값(예: 95%) 미만인 경우 해당 데이터를 모델 오류 분석에 활용하며, 사고 과정, 도구 사용, 검색 실패 여부 등 노드별 점검을 통해 문제가 발생한 지점을 파악한다.
이후 부정 샘플 기반의 재학습을 통해 시스템을 지속적으로 개선하고, 운영 환경 데이터를 바탕으로 데이터 드리프트와 작동 원리를 파악한다.
표준 VLM 모델은 확장성과 복잡성 문제로 인해 특화된 도메인 문제 해결에 적합하지 않다.
따라서 오프 폴리시 및 온 폴리시 지식 증류를 수행하고, 4비트 양자화, 브레인 플로트(BrainFloat) 등 실험적인 양자화 방식을 적용하여 추론 환경에서의 컴퓨팅 자원 및 비용을 절감한다.
시스템의 작업 성공 여부를 판단하기 위해 정밀도, 재현율, F1 점수 등 다양한 평가 지표를 활용한다.
각 노드의 검색 효율성과 지연 시간을 분석하고, 복잡한 문제를 해결하기 위해 적응형 추론 예산을 유동적으로 할당하는 것이 중요하다.
또한 시스템의 견고성을 유지하고 예외 상황 발생 시 오류율을 분석하여 전체적인 품질을 개선한다.
최적화 측면에서는 공간-시간적 축소 최적화를 사용하여 비디오 처리량을 절감하며, 이는 유사한 프레임을 찾아 모든 요소를 하나의 측면으로 압축하는 데 효과적이다.
유사 콘텐츠를 대상으로 캐싱 시스템을 적용하고, 높은 신뢰도 데이터에 대해서는 메타 데이터 가지치기를 수행하여 효율성을 높인다.
예측 모니터링과 질적 개선 과정은 시스템의 지속가능성을 강화하는 데 초점을 맞춘다.
자막에서 근거가 되는 대목을 찾아 답합니다.
AI Engineer의 다음 글도 받아볼까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 82편 올렸어요.