DevLog

엔지니어링 블로그를 한 곳에서 탐색하고, 최근 발행 흐름을 빠르게 파악할 수 있는 서비스 입니다.

Quick Links

  • Latest Feed
  • Engineering Directory

Support

  • 소개
  • 개인정보처리방침

Contribute

  • 원하는 블로그 추가 (준비 중)
  • Feedback

© 2026 DevLog Inc. All rights reserved.

본 사이트는 공개 RSS 피드를 통해 콘텐츠를 수집하며, 모든 콘텐츠의 저작권은 원저작자에게 있습니다.

Back to Feed
KOEN
Read Original

Contents

Continue Reading

  • More from Netflix
  • Related reads#LLM
#AI

GenRec: 넷플릭스의 LLM 네이티브 추천 시스템을 향하여

GenRec: 넷플릭스의 LLM 네이티브 추천 시스템을 향하여
01

Summary

피처 엔지니어링의 시대는 끝났다? 넷플릭스가 LLM으로 추천 시스템을 통째로 재정의하는 방법

수만 개의 피처 가공 대신 한 줄의 프롬프트와 프리필 전용 추론 최적화로 성능과 비용을 모두 극대화한 GenRec 비하인드

넷플릭스가 기존의 복잡한 머신러닝 피처 인프라를 혁신하기 위해 LLM 네이티브 추천 엔진 'GenRec'을 전격 도입했습니다. 정교하게 다듬어진 2단계 도메인 사후 학습과 vLLM 최적화 서빙 기술을 탑재하여 텍스트 데이터만으로 세계 최고 수준의 추천 정밀도를 완성했습니다. 실서빙 환경에서 기존 프로덕션 모델보다 탁월한 성능을 발휘하면서 비용 장벽까지 허물어뜨린 실제 구현 전략을 전해 드립니다.

  • 01수천 개의 수작업 피처 파이프라인에서 탈피해 프롬프트와 콘텍스트만으로 유연하게 추천을 설계하는 혁신
  • 02오픈소스 LLM 대비 넷플릭스 도메인 데이터를 선학습한 Phase-1 기반 모델이 오프라인 지표 10~20% 우위 달성
  • 03동작 효율 극대화를 위한 '프리필 전용(Prefill-only) 추론' 모드로 대규모 카탈로그 스코어링의 토큰 생성 병목 완벽 제거
  • 04비즈니스 목표와 장기적인 사용자 경험을 균형감 있게 조정하는 리워드 가중 손실(Reward-Weighted Loss) 정렬 기법 탑재
  • 05실제 넷플릭스 사용자 트래픽 10% 대상 대규모 A/B 테스트를 완벽 통과한 프로덕션 수준의 기술 신뢰도

+RECOMMENDATION

레거시 시스템의 수작업 피처 엔지니어링과 기술 부채로 추천 모델 고도화에 골머리를 앓고 있는 AI 및 데이터 플랫폼 엔지니어들에게 적극 추천합니다. LLM을 프로덕션 규모의 무거운 워크로드에 무리 없이 녹여내는 실용적인 콘텍스트 압축 전략과 서빙 비용 절감 패턴을 엿볼 수 있는 최고의 교과서입니다.

The Problem

기존 넷플릭스의 추천 모델은 수천 개의 수작업 피처와 복잡한 파이프라인에 의존하고 있어 신규 콘텐츠 타입이나 서비스 지면을 추가하는 데 지나치게 큰 인프라 비용과 시간이 발생했습니다. 또한, 상용 오픈소스 LLM은 글로벌 인기작만 과다 추천하거나 카탈로그 외 아이템을 추천하는 환각 현상 및 비즈니스 제약 미준수 등의 한계가 있어 프로덕션 추천 서비스에 바로 적용하기가 어려웠습니다.

The Solution

넷플릭스는 자체 파운데이션 LLM을 넷플릭스 독자적인 시청 및 도메인 데이터로 사후 학습(Post-training)시킨 뒤, 카탈로그 인식 스코어링 헤드를 추가한 'GenRec'을 구축했습니다. 실시간 고용량 트래픽의 토큰 서빙 비용을 해결하기 위해 대화 기록을 요약 및 정제하는 '콘텍스트 엔지니어링'을 수행했으며, 순차적 텍스트 생성 단계를 완전히 건너뛰는 '프리필 전용(Prefill-only)' 모드로 vLLM 스택을 활용하여 후보군 전체를 한 번에 연산하도록 최적화했습니다.

The Result

약 4주간 넷플릭스 전체 트래픽의 10%를 대상으로 진행한 대규모 상용 온라인 A/B 테스트에서, GenRec은 기존 대비 40배 적은 Phase-2 라벨링 데이터만으로도 단기 및 장기 비즈니스 지표에서 통계적으로 유의미한 성장을 증명했으며, 오프라인 평가에서는 MRR 약 1.6%의 향상을 기록했습니다. 또한, 콘텍스트 엔지니어링 설계를 통해 성능 저하 없이 토큰 크기와 추론 비용을 기존 예산의 약 3분의 1 수준으로 감축하는 효율성을 확보했습니다.

Trade-off

본 연구에 활용된 LLM 랭커 아키텍처는 가벼운 행렬 분해나 정적 임베딩 기반의 기존 추천 아키텍처에 비해 상당히 높은 메모리와 연산 컴퓨팅 자원을 요구합니다. 또한, 원활한 오프라인 및 실시간 실무 지연 시간을 준수하기 위해 대화형 텍스트 생성 기능을 완전히 포기하고 프리필 전용 스코어링 연산으로만 기동하도록 제약한 점과, 콘텍스트 제한으로 인해 수십 년 치의 오래된 사용자 상세 로그 데이터를 모두 활용하기는 어렵다는 한계가 있습니다.

03

Key Concepts

Concept · 01

Context Engineering

원천 시청 및 탐색 로그 데이터를 LLM의 컨텍스트 한계와 토큰 예산 내에서 최적의 정보 밀도를 유지하도록 정제, 가공 및 압축하는 가공 프로세스입니다. 핵심 선호도 시그널만 걸러내어 비용을 극적으로 줄이면서 모델 성능 저하를 방지합니다.

  • 사용자의 지루하고 반복적인 정주행 패턴을 요약하고 마우스 호버 같은 의미 없는 액션은 생략 처리
  • 품질 저하가 없는 최소한의 엘보우 포인트(Elbow Point) 구간을 도출하여 전체 토큰 크기를 3분의 1 수준으로 최소화
Concept · 02

Prefill-Only Inference

순차적인 텍스트 생성(Generative Decoding) 과정 없이, 한 번의 입력 패스(Prefill Step)에서 추출된 히든 스테이트(Hidden State)만을 스코어링 헤드에 입력하여 추천 리스트를 고속으로 순위화하는 추론 패러다임입니다. 생성 단계 특유의 심각한 지연 시간과 막대한 서빙 인프라 비용 문제를 혁신적으로 극복합니다.

  • vLLM 추론 프레임워크 기반의 엔드포인트를 구축하여 후보군 리스트를 병렬로 한 번에 연산 처리
  • 실제 프로덕션 단계의 실시간 사용자 세션 응답 시간 조건을 맞추는 핵심 비용 절감 전략으로 도입
Concept · 03

Reward-Weighted Loss

기본적인 클릭 정확도를 넘어 넷플릭스 플랫폼 내 다양한 콘텐츠(게임, 생방송 등) 균형과 장기적 사용자 가치를 함께 고려하기 위해 모델 학습 시 개별 관측 데이터의 오차 가중치를 미세 제어하는 정렬 기법입니다. 무거운 강화학습(RLHF)에 비해 리소스를 효율적으로 아끼면서 비즈니스 요구사항에 유연하게 랭커를 조율할 수 있습니다.

  • 지속 참여도 및 이탈 방지 등의 장기 지표 모델링 결괏값을 손실 함수의 가중치로 맵핑하여 계산
  • 단순한 자극적 클릭 유도를 예방하고 신작 활성화 등의 플랫폼 고유 가치를 모델의 객관적 편향에 반영
Continue reading · same source

NetflixMore from Netflix

View all posts from Netflix
  • MAPS: 넷플릭스의 대규모 멀티모달 에셋 개인화

    CLIPMediaFMRecommendation Systems
    1일 전
  • 두 개의 플링크 오토스케일러 이야기

    Apache FlinkAutoscalingStream Processing
    1주 전
  • 넷플릭스가 실시간 분산 그래프를 구축한 방법과 이유: 3부 — gRPC 실행 API를 통한 그래프 쿼리

    gRPCGraph DatabaseDistributed Systems
    3주 전
  • 분석을 위한 디바이스 사양 모델링

    Data ModelingFeature ManagementAnalytics
    4주 전
  • 넷플릭스의 자체 LLM 서빙 플랫폼 구축기

    vLLMTriton Inference ServerLLM Serving
    1개월 전

Related reads#LLM

Explore #LLM
올리브영·MCP

프롬프트를 쓰는 PM과 AI를 이해시키려는 개발자

#LLM1일 전
라인

LLM Wiki: 코드 기준으로 자동 최신화되는 도메인 지식 SSOT 만들기

#LLM2일 전
무신사

AI Native 조직은 도메인 지식을 어떻게 공유하는가

#LLM4일 전
채널 톡

채널톡이 글로벌 상담 Agent를 GPT-5.6 Luna로 갈아탄 이유

#LLM5일 전
여기어때·Grafana

SRE 업무에 AI 녹여내기 — 2편: Alert Adviser로 장애 원인 분석 자동화

#LLM6일 전

Source

Netflix
Netflix
Engineering Blog

Published · July 30, 2026

Topics

LLMRecommendation SystemContext EngineeringvLLMFine-Tuning