마켓플레이스 탐색을 참여에서 시맨틱 이해로 전환
전통적 시스템은 탐색을 참여 최적화 문제로 취급하는 경우가 많아 미묘한 쿼리에 대해 최적이 아닌 결과를 초래했습니다.
DoorDash는 참여 지표를 넘어 LLM을 활용해 쇼퍼 의도와 상품 의미를 이해함으로써 다양한 마켓플레이스를 구현합니다.
전통적 시스템은 탐색을 참여 최적화 문제로 취급하는 경우가 많아 미묘한 쿼리에 대해 최적이 아닌 결과를 초래했습니다.
모든 구매 가능한 순간을 포착하기 위해 회사는 기존 레스토랑 서비스와 함께 식료품, 리테일, 반려동물, 선물 서비스를 제공합니다.
소비자는 여러 세션이나 며칠에 걸친 광범위한 쇼핑 미션을 자주 수행하며, '새 강아지' 같은 단일 쿼리에도 다양한 상품 카테고리와 컬렉션이 포함될 수 있습니다.
감독, 카탈로그 시맨틱, 시맨틱 개인화, 조정 가능한 콘텐츠 생성이 회사의 고객 여정 매핑의 기반을 이룹니다.
감독은 시스템에 랭킹에서 '좋음'이 무엇인지 가르치는 것이고, 카탈로그 시맨틱은 상품의 본질적 특성을 이해하는 데 초점을 맞추며, 시맨틱 개인화는 특정 사용자 의도에 맞게 결과를 조정하고, 조정 가능한 콘텐츠 생성은 동적 결과를 생성합니다.
인기 있는 일반 스파게티가 검색 결과에서 '글루텐 프리 파스타'를 자주 가리는데, 참여 신호가 랭킹을 고볼륨 상품으로 편향시키기 때문입니다.
참여 지표는 노출, 위치, 가격 같은 요인으로 본질적으로 편향되어 있어, 정확한 매칭, 대체품, 무관한 상품을 구분하려면 등급화된 관련성이 필요합니다.
고품질 학습 라벨은 LLM을 활용해 오프라인에서 비용이 큰 추론을 수행한 뒤 이를 경량 모델로 증류해 인간의 정답 데이터를 보완함으로써 생성됩니다.
이 과정은 오프라인에서 비용이 큰 추론을 수행해 인간 피드백과 카테고리 모델을 조정하고, 경량의 빠른 서비스 가능 모델로 증류하기 위한 골든 데이터셋을 만듭니다.
표준 임베딩은 이커머스 규모에서 관련 상품과 일치 상품의 구분을 종종 붕괴시켜 검색 시스템에 중대한 과제를 제기합니다.
DoorDash는 2단계 대조 학습 접근법으로 이를 해결합니다. 먼저 다중 수준 감독 대조 손실로 전역 기하학을 형성한 뒤, 모델이 이전에 혼동했던 하드 네거티브를 사용한 커리큘럼 학습을 수행합니다.
검색 계층에서 2단계 프로세스를 구현한 결과 DoorDash의 NDCG가 2.3% 향상되었습니다.
LLM 등급 라벨을 활용하는 순서형 관련성 타워가 랭커에 추가되었으며, 하위 계층을 공유해 클릭과 전환 같은 참여 지표와 함께 시맨틱 적합성을 증류합니다.
가치 함수를 사용해 다양한 표면에서 참여와 관련성의 균형을 미세 조정하고, LLM을 전체 검색 및 랭킹 인프라를 대체하는 것이 아니라 추론과 이해에 활용합니다.
시맨틱 ID는 분류 체계와 유사한 짧은 계층 코드를 제공하며, 접두사는 넓은 영역을 정의하고 뒤 토큰은 더 세밀한 구분을 포착합니다. 이는 라벨 없는 데이터에서 나와 핫소스 같은 상품을 특산(예: 멕시코, 카리브, 한국)별로 분류합니다.
이 시스템은 교차 카테고리 관계를 촉진하고, 콜드 스타트 문제를 해결하며, 테일 상품에 대한 커버리지를 제공하고, 인간 라벨과 시맨틱 학습 라벨을 비교하는 역 감사를 가능하게 합니다.
시맨틱 ID는 DoorDash 랭커를 크게 개선해 평균 역순위(MRR)를 4~5% 높이고 측정 가능한 전환 이익을 가져왔습니다.
쿼리 재구성에서 시스템은 쿼리를 시맨틱 영역에 매핑해 더 관련성 높은 상품을 제안하며, 품절 상품 제안을 방지하고 쿼리 제안에서 상당한 MRR 이익을 냅니다.
이 채널의 새 영상도 아티클로 메일 받으세요.
이 접근법은 잘 이해된 에이전트-맥락 메모리 개념을 기반으로 개인화를 풍부하게 합니다.
이 프레임워크는 과거 주문과 검색에서 지속적 선호를 추적하는 장기 메모리, 장바구니 상태 같은 세션별 상호작용을 관리하는 실시간 맥락, Ask DoorDash 같은 에이전트 상호작용의 직접 입력을 포착하는 명시적 선호를 구분합니다. 메모리 블록은 분리되어 새 사용자 차원을 재해석 없이 추가할 수 있습니다.
여기에는 사람이 읽을 수 있는 텍스트 요약, 검색 및 랭킹 시스템과의 통합을 위한 잠재 벡터 임베딩, 브랜드와 분류 체계 간의 복잡한 관계를 매핑하는 그래프 및 계층 접근법이 포함됩니다.
그래프 기반 임베딩은 현재 검색 작업에서 기존 분류 체계 기반 임베딩을 능가하며 그 효과를 입증합니다.
이 메모리 프레임워크는 개인화 컬렉션, 에이전트 개인화를 지원하고 다운스트림 모델과 LLM 애플리케이션에 중요한 기능을 제공합니다.
이 시스템은 식물 기반 식단이나 특정 반려동물 같은 특정 쇼퍼 선호에 맞춰 콘텐츠를 조정하며, 반려동물 버티컬 테스트에서 주문률 1%, 활성 사용자 6% 증가를 보였습니다. 이는 시스템 성능을 유지하면서 정교한 추론을 가능하게 하는 배치 처리로 달성되었습니다.
탐색은 단순한 참여 지표가 아니라 근본적으로 시맨틱 이해 문제입니다.
최적 아키텍처는 직접적인 온라인 LLM 호출을 거의 포함하지 않으며, 대신 추론을 시맨틱 ID와 메모리 블록 같은 확장 가능한 원시 요소로 오프라인에서 증류해야 합니다. 이를 통해 더 작고 빠른 모델이 검색, 랭킹, 콘텐츠 생성 전반에 걸쳐 이러한 인사이트를 일관되게 제공할 수 있습니다.
자막에서 근거가 되는 대목을 찾아 답합니다.
AI Engineer의 다음 영상도 받아볼까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 29편 올렸어요.