스포티파이, LLM 네이티브 추천 아키텍처로 전환
구글 검색과 넷플릭스에서 개인화 배경을 쌓은 라이몬드는 대규모 언어 모델 기능을 깊이 통합해 "추천 시스템을 뒤집어 놓겠다"는 야심을 강조했다.
스포티파이의 새로운 대규모 취향 모델(LTM)이 생성형 개인화를 구현해 사용자가 콘텐츠를 조정하고 AI가 만든 경험과 상호작용할 수 있게 한다.
구글 검색과 넷플릭스에서 개인화 배경을 쌓은 라이몬드는 대규모 언어 모델 기능을 깊이 통합해 "추천 시스템을 뒤집어 놓겠다"는 야심을 강조했다.
콘텐츠 카탈로그 역시 방대해 1억 개가 넘는 음악 트랙과 다양한 팟캐스트, 오디오북, 비디오를 포함하며 개인화된 콘텐츠 매칭에 막대한 도전을 제시한다.
두 번째 단계에서는 2014년 Discover Weekly 출시로 대표되는 추천 엔진이 도입돼 알고리즘으로 사용자와 콘텐츠를 매칭하는 데 집중했다.
생성형 개인화로 불리는 현재 단계는 단순 매칭을 넘어 상호작용 경험을 동적으로 생성하며, 시스템의 초점을 순위 매김을 통한 '추측'에서 '추론'으로, '블랙박스' 알고리즘에서 '조정 가능한' 알고리즘으로 옮긴다.
스포티파이 DJ는 사용자가 버튼을 눌러 실시간으로 음악 방향을 조정할 수 있게 하며, 알고리즘이 즉각적인 피드백에 따라 세션을 조정한다.
프롬프트 재생 목록은 사용자가 '오늘 밤 샌프란시스코에서 공연하는 밴드' 같은 일반적인 주제부터 '달리기용 음악' 같은 기능적 요청까지 매우 구체적인 콘텐츠를 요청할 수 있게 한다.
이 동적 시스템은 사용자 입력에 적응해 재생 목록을 즉석에서 수정할 수 있으며, 예를 들어 운동의 여러 단계에 따라 음악을 바꾼다.
스포티파이는 뉴질랜드에서 '취향 프로필' 기능을 출시해 사용자가 알고리즘이 자신의 선호에 대해 학습한 내용을 자연어로 이해하고 성찰할 수 있게 했다.
이 기능은 사용자가 프로필을 직접 편집하고 다듬어 알고리즘의 가정을 바로잡거나 빠진 정보를 추가할 수 있게 한다. 예를 들어 공유 기기가 프로필에 영향을 준 경우 어린이용 디즈니 음악을 개인 추천에서 제외할 수 있다.
사용자는 추천에 대한 명시적 통제권을 얻어 "내 취향이 아니에요"라고 신호해 특정 콘텐츠가 부적절한 맥락에서 추천되는 것을 막을 수 있다.
직접 필터링을 넘어 이러한 프로필은 새로운 언어 학습이나 새로운 장르 탐색 같은 열망 목표를 지원해 시스템 추천이 사용자의 현재 의도와 맞도록 한다.
이 새로운 기능에는 사용자의 커뮤니티와 특정 관심사에 맞춘 매일의 오디오 브리핑 생성이 포함되며 콘텐츠는 매일 제작된다.
스포티파이의 대규모 취향 모델(LTM)은 모든 추천 애플리케이션을 하나의 통합 아키텍처로 결합해 예측과 추론을 합쳐 실시간으로 사용자가 프롬프트할 수 있는 경험을 생성한다.
이 시스템은 과거 상호작용을 이해하며 미국 프리미엄 구독자 4명 중 1명이 매일 사용하고, 자동 재생, 팟캐스트 탐색, DJ 상호작용 같은 영역에서 상당한 성능 향상을 낸다.
이 모델들은 자연어 요청과 이러한 특정 의미 토큰을 모두 이해하도록 미세 조정돼 더 풍부한 상호작용을 가능하게 한다. 예를 들어 사용자가 '도덕에 관한 팟캐스트'를 요청하면 특정 에피소드와 함께 자연어 설명을 받을 수 있다.
재클린 우드는 특정 도메인에 LLM을 정착시키고 기존 언어 능력을 잊지 않으면서 새로운 역량을 유도하도록 설계된 4단계 과정인 스포티파이의 NEO 훈련 패러다임을 설명했다.
단계는 의미 기반( ID 토큰 생성), 도메인 정착(LLM 백본을 동결한 채 ID 토큰을 언어 임베딩과 정렬), 역량 유도(멀티태스크 지시 튜닝), 선택적 사후 훈련(예: 강화학습 미세 조정)을 포함한다.
우리는 여기에 링크된 논문을 발표했는데, NEO라고 불리는 네 개의 뚜렷한 단계로 구성된 우리의 훈련 패러다임을 설명합니다.
이 접근 방식은 특히 '콜드 스타트' 엔터티에 효과적이었으며, 예를 들어 팟캐스트 소비의 기존 데이터를 활용해 오디오북 추천을 개선했다.
이 채널의 새 영상도 아티클로 메일 받으세요.
절제 연구는 사전 훈련된 오픈 웨이트 LLM 대신 무작위로 초기화된 백본을 사용할 때 모델 성능 저하가 가장 크다는 것을 밝혔다.
연구는 도메인 정착 중 백본을 동결하는 것이 자연어와 세계 지식을 효과적으로 보존한다는 것을 확인했고, 이러한 결과는 Qwen과 Llama 모델 모두에 해당했다.
추론 전략을 비교한 결과 빔 서치는 제약 디코딩 없이도 의미 ID에서 98%의 유효성을 달성해 정확도 면에서 Top P 샘플링을 크게 앞섰다.
빔 서치는 지연 시간이 더 크지만, 스포티파이는 특히 신곡 같은 특정 콘텐츠 유형을 대상으로 제약 디코딩을 사용할 때 더 뛰어난 정확도를 고려해 이 절충을 받아들일 만하다고 판단했다.
프로덕션에 배포된 NEO는 이미 팟캐스트 탐색을 구동하고 있으며 사용자 행동을 더 다양한 낯선 콘텐츠 청취로 성공적으로 전환시켰다.
재클린 우드는 전통적인 오프라인 지표가 생성형 및 설명형 추천을 평가하기에 불충분하다고 지적하며, 신뢰할 수 있는 평가를 위해 의미 있는 데이터로 LLM 판정자를 정착시키는 데 투자해야 한다고 말했다.
텍스트 사용자 프로필로 청취 이력을 요약함으로써 스포티파이는 인간 선호와 75%의 정렬을 달성했고, 검색 쿼리에 행동 신호를 통합해 전체 정렬을 5% 더 높였으며(모호한 쿼리에서는 91%)
전통적인 오프라인 평가 지표는 생성형 및 설명형 추천을 평가하는 데 부족하며, 추천이 사용자에게 이해되는지 또는 설명이 정확한지 측정할 수 없다.
이 지표는 또한 추천이 사용자 의도와 진정으로 일치하는지 판단하지 못해, 정성 평가를 위한 우월한 대안으로 LLM 판정자의 도입이 필요하다.
여러 출처의 후보를 모아 순위를 매기는 Cranfield 스타일 평가 컬렉션은 일반적으로 수동 인간 평가가 필요해 자원 집약적이다.
스포티파이는 인간 시스템 순위를 재현하도록 LLM 판정자를 성공적으로 훈련해 인간 평가자와 0.87의 일치 값을 달성함으로써 이러한 평가를 효율적으로 확장했다.
재클린 우드는 업계가 이제 정적인 추천을 넘어 생성형 개인화의 새로운 시대로 들어서고 있다고 강조했다.
스포티파이는 오픈 웨이트 LLM을 활용해 언어로 조정 가능한 상호작용을 촉진하고, 사용자에게 더 역동적이고 통제 가능한 개인화 콘텐츠 경험을 제공하는 것을 목표로 한다.
자막에서 근거가 되는 대목을 찾아 답합니다.
AI Engineer의 다음 영상도 받아볼까요?
AI Engineer에 새 영상이 올라오면, 방금 읽으신 것처럼 정리해서 메일로 보내 드릴게요.
이 채널은 지난 7일 동안 29편 올렸어요.