
레이어 기반 확산 모델 Vera와 물리 법칙을 이해하는 삭제 도구 VOID로 완성하는 프로페셔널 워크플로우
넷플릭스 연구팀이 비디오 편집의 핵심 과제인 '제어 가능성(Controllability)'을 해결하기 위한 두 가지 혁신적인 모델을 공개했습니다. 아티스트의 창의적 의도를 정확히 반영하면서도 원본 영상의 디테일을 완벽하게 보존하는 Vera와, 물리적 상호작용을 계산하여 객체를 지우는 VOID는 영상 제작 공정을 획기적으로 단축할 잠재력을 보여줍니다.
고품질의 영상 소스를 유지하면서 특정 요소만 정교하게 수정해야 하는 영상 편집자나 AI 연구자에게 필독을 권합니다. 특히 레이어 기반의 생성 방식은 실무 파이프라인 도입 가능성이 매우 높으므로 주목할 가치가 있습니다.
기존의 생성형 비디오 편집 모델은 특정 요소만 수정하려 해도 전체 영상을 다시 생성하는 방식이라 원본의 정체성이나 배경이 의도치 않게 변경되는 문제가 있었습니다. 또한, 객체를 삭제할 때 주변 사물과의 물리적 상호작용을 고려하지 못해 결과물이 부자연스러운 경우가 많았습니다.
넷플릭스는 수정이 필요한 부분만 별도의 레이어로 생성하는 'Vera' 모델과, VLM 기반 추론을 통해 물리적으로 타당한 배경 채우기를 수행하는 'VOID' 모델을 개발했습니다. Vera는 Mixture-of-Transformers 구조를 활용해 원본 훼손을 최소화하며, VOID는 쿼드마스크와 2단계 추론 파이프라인을 통해 객체 삭제 후의 물리적 변화를 재구성합니다.
정량적 평가와 인간 선호도 조사 결과, Vera는 원본 보존 능력에서 기존 벤치마크 모델들을 압도했으며, VOID는 물리적 개연성이 필요한 복잡한 시나리오에서 64.8%의 선택을 받아 경쟁 모델 대비 뛰어난 성능을 입증했습니다.
Trade-off
현재 연구 단계에서는 번개나 연기와 같은 복잡한 특수 효과 처리에 한계가 있으며, 비정상적인 카메라 각도나 매우 근접한 촬영본에 대한 일반화 성능이 부족합니다. 또한 지원되는 영상의 해상도와 길이에 제약이 있는 것으로 확인되었습니다.
영상의 모든 픽셀을 새로 쓰는 대신, 추가되거나 변경될 부분만 별도의 투명 레이어(Alpha Matte)와 함께 생성하여 원본 위에 얹는 방식입니다.
하나의 거대한 모델이 모든 작업을 수행하는 대신, 서로 다른 데이터 분포를 가진 각 출력물(편집본, 마스크 등)을 전담하는 여러 개의 Transformer 유닛을 결합한 구조입니다.
생성된 영상이 현실 세계의 물리 법칙(중력, 충돌, 운동량 등)에 위배되지 않고 자연스럽게 보이는 성질을 의미합니다.




