netflix4분 읽기

큐레이션 요약

GenPage: 넷플릭스의 엔드투엔드 생성형 홈페이지 구축을 향해

원문 읽기(새 탭에서 열림)

Netflix의 GenPage는 기존의 다단계 추천 파이프라인 대신, 하나의 생성형 Transformer가 사용자·요청 맥락을 입력으로 받아 홈페이지 전체를 한 번에 생성하는 방식이다. 행(row), 콘텐츠(entity), 배치(layout)를 함께 생성하므로 페이지 전체의 사용자 만족도와 콘텐츠 간 상호작용을 최적화할 수 있다. 실제 A/B 테스트에서 기존 운영 시스템보다 핵심 참여 지표를 유의미하게 개선했고, 전체 서빙 지연 시간도 20% 줄였다.

홈페이지 전체를 생성하는 GenPage

  • 기존 Netflix 홈페이지는 다음 요소를 별도 단계에서 처리했다.
    • 어떤 추천 행을 노출할지 결정
    • 각 행 안의 콘텐츠 후보 생성 및 랭킹
    • 행과 콘텐츠의 최종 배치
  • GenPage는 사용자 이력과 요청 맥락을 프롬프트처럼 사용하고, 홈페이지 전체를 자기회귀적으로 생성한다.
  • 일반적인 생성형 추천기가 평평한 콘텐츠 목록만 생성하는 것과 달리, GenPage는 다음을 함께 생성한다.
    • 추천 행
    • 각 행의 콘텐츠
    • 페이지 내 배치 순서와 구조

다단계 추천 시스템에서 엔드투엔드 모델로

  • 하나의 Transformer가 원시 입력 신호에서 최종 페이지를 만들기 때문에 여러 모델 간 목표 불일치를 줄일 수 있다.
  • 후보 생성, 행 랭킹, 콘텐츠 랭킹 등 여러 모델을 유지·운영해야 하는 부담이 감소한다.
  • 기존의 복잡한 특성 공학(feature engineering)을 줄이고, 데이터·연산량·모델 규모를 늘려 성능을 개선하기 쉬운 구조를 제공한다.
  • 새로운 콘텐츠 유형이나 UI를 도입할 때 아키텍처를 크게 바꾸지 않고 확장할 수 있다.
    • 라이브 이벤트
    • 게임
    • 팟캐스트
    • 개인화된 UI 컴포넌트
    • 콘텐츠별 개인화 아트워크

페이지 단위 최적화와 강화학습

  • 기존 시스템은 주로 개별 콘텐츠나 행의 클릭·시청 가능성을 최적화한다.
  • GenPage는 페이지 전체를 생성하므로 행과 콘텐츠 사이의 상호작용을 페이지 보상으로 학습할 수 있다.
  • 예를 들어 상단의 ‘Continue Watching’ 행은 즉각적인 만족도를 높일 수 있지만, 사용자가 다른 행을 탐색하는 양은 줄일 수 있다.
  • 강화학습(RL)을 적용하면 다음과 같은 전체 페이지 수준의 효과를 고려할 수 있다.
    • 콘텐츠 다양성
    • 여러 행의 탐색성과 시청 유도력 간 균형
    • 사용자 만족도와 페이지 탐색량의 trade-off
  • 흥미롭게도 오프라인 평가에서는 다양성을 직접 보상 목표에 포함하지 않았음에도 RL 후처리 학습 이후 홈페이지 다양성이 증가했다.

홈페이지 데이터를 토큰 시퀀스로 표현

  • 각 학습 샘플은 홈페이지 노출 한 번을 나타내며 다음 세 요소로 구성된다.
    • Context: 사용자 행동 이력, 프로필 속성, 요청 맥락
    • Page: 실제 노출된 추천 행과 콘텐츠, 레이아웃 순서
    • Feedback: 재생, 좋아요, 이탈 등 사용자 반응
  • Context와 Page는 모델 입력·출력으로 토큰화한다.
  • Feedback은 직접 생성하는 대상이 아니라 내부 보상 시스템을 통해 학습 신호로 변환한다.
  • 결과적으로 모델은 일반 텍스트가 아닌, 구조화된 홈페이지 표현을 생성한다.

도메인 특화 토크나이저

  • 일반적인 LLM용 텍스트 토크나이저 대신 Netflix 추천 도메인에 맞춘 전용 토크나이저를 사용한다.
  • 예를 들어 “사용자가 30일 전에 특정 작품을 50분 시청했다”는 이벤트를 다음과 같이 압축할 수 있다.
    • 엔터티 ID
    • 행동 유형
    • 시간 구간
    • 시청 지속시간 구간
  • 일반 GPT 계열 토크나이저로 16개 토큰이 필요한 정보를 4개 토큰으로 표현할 수 있어 시퀀스 길이와 추론 비용을 줄인다.
  • 행과 콘텐츠가 특정 토큰과 직접 대응하므로 제품·비즈니스 규칙을 적용하기도 쉽다.
  • 생성 결과에 허용되지 않는 콘텐츠나 구조가 포함되지 않도록 제어할 수 있다는 점도 장점이다.

사용자 맥락 토큰

  • 사용자 행동 이력은 다음 메타데이터를 포함한 행동 시퀀스로 표현한다.
    • 행동 유형
    • 콘텐츠 ID
    • 발생 시점
    • 행동 지속시간
  • 명시적 신호와 암묵적 신호를 모두 포함한다.
    • 명시적 신호: 재생, ‘My List’ 추가, 좋아요
    • 암묵적 신호: 예고편 시청, 상세 페이지 방문
  • 사용자 프로필에는 언어, 프로필 유형 등을 넣는다.
  • 요청 맥락에는 시간대, 요일, 사용 기기 등의 정보를 포함한다.
  • 전체 노출 이력처럼 지나치게 긴 데이터는 요약해서 사용한다.
  • 이 요약 과정은 모델이 원시 데이터를 완전히 직접 학습하는 대신 사람이 설계한 프롬프트 엔지니어링을 일부 남긴다는 한계가 있다.
  • 장기적으로는 긴 이력을 엔드투엔드 방식으로 압축하는 것이 중요한 연구 과제다.

운영 환경의 주요 과제

  • 홈페이지를 실시간 생성해야 하므로 서빙 지연 시간이 핵심 제약이다.
  • 계속 변화하는 콘텐츠 카탈로그에서 신규 콘텐츠의 콜드 스타트 문제를 해결해야 한다.
  • 사용자의 관심사와 문화적 트렌드 변화에 맞춰 모델을 지속적으로 최신화해야 한다.
  • 생성 결과에도 콘텐츠 정책, 제품 요구사항, 비즈니스 규칙을 적용해야 한다.
  • Netflix는 이러한 제약을 고려하면서도 운영 환경에 GenPage를 적용했다.

실험 및 운영 결과

  • 성숙하고 최적화된 기존 다단계 추천 시스템과 비교한 온라인 A/B 테스트에서:
    • 출시 판단에 사용하는 핵심 사용자 참여 지표가 통계적으로 유의미하게 향상됐다.
    • 전체 엔드투엔드 서빙 지연 시간이 20% 감소했다.
  • 오프라인 분석에서는 모델 규모를 키우는 것보다 프롬프트에 더 풍부한 정보를 넣는 것이 현재 조건에서 더 큰 효과를 보였다.
  • 강화학습은 명시적으로 다양성을 최적화하지 않았음에도 페이지 다양성을 높였다.

GenPage는 홈페이지를 개별 콘텐츠의 집합이 아니라 하나의 최적화 대상인 페이지로 다룬다는 점에서 의미가 있다. 다만 실시간 지연, 신규 콘텐츠, 최신성, 생성 결과 제어가 핵심 과제이므로, 실제 도입 시에는 도메인 특화 토큰화와 강력한 규칙 검증 계층을 함께 설계하는 것이 현실적인 접근이다.

큐레이션 요약을 이어서 읽어보세요.