DevLog

엔지니어링 블로그를 한 곳에서 탐색하고, 최근 발행 흐름을 빠르게 파악할 수 있는 서비스 입니다.

Quick Links

  • Latest Feed
  • Engineering Directory

Support

  • 소개
  • 개인정보처리방침

Contribute

  • 원하는 블로그 추가 (준비 중)
  • Feedback

© 2026 DevLog Inc. All rights reserved.

본 사이트는 공개 RSS 피드를 통해 콘텐츠를 수집하며, 모든 콘텐츠의 저작권은 원저작자에게 있습니다.

Back to Feed
KOEN
Read Original

Contents

Continue Reading

  • More from Netflix
#AI

더 정교한 AI 비디오 편집을 향하여: 넷플릭스의 초기 연구 탐색

더 정교한 AI 비디오 편집을 향하여: 넷플릭스의 초기 연구 탐색
01

Summary

원본은 그대로, 편집은 자유롭게: 넷플릭스가 공개한 차세대 AI 비디오 편집 기술

레이어 기반 확산 모델 Vera와 물리 법칙을 이해하는 삭제 도구 VOID로 완성하는 프로페셔널 워크플로우

넷플릭스 연구팀이 비디오 편집의 핵심 과제인 '제어 가능성(Controllability)'을 해결하기 위한 두 가지 혁신적인 모델을 공개했습니다. 아티스트의 창의적 의도를 정확히 반영하면서도 원본 영상의 디테일을 완벽하게 보존하는 Vera와, 물리적 상호작용을 계산하여 객체를 지우는 VOID는 영상 제작 공정을 획기적으로 단축할 잠재력을 보여줍니다.

  • 01Vera: 원본 픽셀을 건드리지 않고 새로운 요소만 레이어로 추가하는 혁신적인 접근법
  • 02VOID: 단순히 객체를 지우는 것을 넘어 사물이 사라진 뒤의 물리적 결과(예: 들고 있던 물건이 떨어짐)까지 시뮬레이션
  • 03Mixture-of-Transformers (MoT): 편집 레이어, 알파 매트, 합성 영상을 각각 전문적으로 처리하는 아키텍처 도입
  • 04현업 아티스트 대상 사용자 조사에서 기존 상용/오픈소스 모델 대비 압도적인 선호도 달성
  • 05VLM 기반 추론: 영상 내 물리적 인과관계를 파악하여 편집 영역을 가이드하는 지능형 시스템

+RECOMMENDATION

고품질의 영상 소스를 유지하면서 특정 요소만 정교하게 수정해야 하는 영상 편집자나 AI 연구자에게 필독을 권합니다. 특히 레이어 기반의 생성 방식은 실무 파이프라인 도입 가능성이 매우 높으므로 주목할 가치가 있습니다.

The Problem

기존의 생성형 비디오 편집 모델은 특정 요소만 수정하려 해도 전체 영상을 다시 생성하는 방식이라 원본의 정체성이나 배경이 의도치 않게 변경되는 문제가 있었습니다. 또한, 객체를 삭제할 때 주변 사물과의 물리적 상호작용을 고려하지 못해 결과물이 부자연스러운 경우가 많았습니다.

The Solution

넷플릭스는 수정이 필요한 부분만 별도의 레이어로 생성하는 'Vera' 모델과, VLM 기반 추론을 통해 물리적으로 타당한 배경 채우기를 수행하는 'VOID' 모델을 개발했습니다. Vera는 Mixture-of-Transformers 구조를 활용해 원본 훼손을 최소화하며, VOID는 쿼드마스크와 2단계 추론 파이프라인을 통해 객체 삭제 후의 물리적 변화를 재구성합니다.

The Result

정량적 평가와 인간 선호도 조사 결과, Vera는 원본 보존 능력에서 기존 벤치마크 모델들을 압도했으며, VOID는 물리적 개연성이 필요한 복잡한 시나리오에서 64.8%의 선택을 받아 경쟁 모델 대비 뛰어난 성능을 입증했습니다.

Trade-off

현재 연구 단계에서는 번개나 연기와 같은 복잡한 특수 효과 처리에 한계가 있으며, 비정상적인 카메라 각도나 매우 근접한 촬영본에 대한 일반화 성능이 부족합니다. 또한 지원되는 영상의 해상도와 길이에 제약이 있는 것으로 확인되었습니다.

03

Key Concepts

Concept · 01

Layered Video Diffusion

영상의 모든 픽셀을 새로 쓰는 대신, 추가되거나 변경될 부분만 별도의 투명 레이어(Alpha Matte)와 함께 생성하여 원본 위에 얹는 방식입니다.

  • Vera 모델에서 원본 보존율을 극대화하기 위해 채택된 핵심 전략입니다.
  • 편집 레이어와 알파 매트를 동시에 생성하여 합성의 자연스러움을 높입니다.
Concept · 02

Mixture-of-Transformers (MoT)

하나의 거대한 모델이 모든 작업을 수행하는 대신, 서로 다른 데이터 분포를 가진 각 출력물(편집본, 마스크 등)을 전담하는 여러 개의 Transformer 유닛을 결합한 구조입니다.

  • Vera는 세 개의 독립된 DiT(Diffusion Transformer)를 사용하여 효율성을 높였습니다.
  • 각 유닛은 독립적인 가중치를 가지면서도 Self-Attention을 통해 정보를 교환합니다.
Concept · 03

Physical Plausibility

생성된 영상이 현실 세계의 물리 법칙(중력, 충돌, 운동량 등)에 위배되지 않고 자연스럽게 보이는 성질을 의미합니다.

  • VOID 모델은 객체가 삭제되었을 때 그에 반응하는 주변 사물의 움직임을 재시뮬레이션합니다.
  • VLM(시각 언어 모델)을 이용해 물리적 인과관계가 발생하는 영역을 사전에 예측합니다.
Continue reading · same source

NetflixMore from Netflix

View all posts from Netflix
  • MAPS: 넷플릭스의 대규모 멀티모달 에셋 개인화

    CLIPMediaFMRecommendation Systems
    1일 전
  • 두 개의 플링크 오토스케일러 이야기

    Apache FlinkAutoscalingStream Processing
    1주 전
  • 넷플릭스가 실시간 분산 그래프를 구축한 방법과 이유: 3부 — gRPC 실행 API를 통한 그래프 쿼리

    gRPCGraph DatabaseDistributed Systems
    3주 전
  • 분석을 위한 디바이스 사양 모델링

    Data ModelingFeature ManagementAnalytics
    4주 전
  • GenRec: 넷플릭스의 LLM 네이티브 추천 시스템을 향하여

    LLMRecommendation SystemContext Engineering
    1개월 전

Source

Netflix
Netflix
Engineering Blog

Published · June 23, 2026

Topics

Diffusion ModelsVideo InpaintingComputer VisionNetflix EngineeringMixture of Transformers