netflix

더욱 정교하게 제어할 수 있는 AI 영상 편집을 향해: 넷플릭스의 초기 연구 탐색 (새 탭에서 열림)

넷플릭스는 AI가 영상 전체를 무분별하게 재생성하지 않고, 창작자가 지정한 부분만 정밀하게 수정해야 전문적인 영상 편집에 활용될 수 있다고 주장합니다. 이를 위해 편집 영역만 별도 레이어로 생성하는 Vera와, 객체를 제거한 뒤 물리적으로 자연스러운 장면을 복원하는 VOID를 제안했습니다. 두 연구의 목표는 원본 영상의 정체성·연기·배경을 보존하면서도 복잡한 편집 작업을 자동화해 창작자의 통제력을 높이는 것입니다.

전문 영상 편집에서 AI가 겪는 문제

  • 기존 생성형 비디오 편집 모델은 수정 대상뿐 아니라 영상 전체의 픽셀을 다시 생성하는 경우가 많습니다.
  • 그 결과 다음과 같은 의도하지 않은 변화가 발생할 수 있습니다.
    • 인물의 얼굴이나 정체성 변화
    • 배우의 연기와 동작 변형
    • 배경, 소품, 장면의 세부 정보 훼손
  • 객체 제거 모델은 대상 객체를 지우는 데 집중한 나머지, 객체가 장면의 물리적 상호작용에 미친 영향을 복원하지 못할 수 있습니다.
  • 그림자, 반사, 가려진 배경, 움직임의 연속성이 깨지면 객체를 제거한 결과가 부자연스럽게 보입니다.

Vera: 편집 영역만 생성하는 레이어드 비디오 확산 모델

  • Vera는 원본 영상 전체를 재생성하지 않고 다음 두 가지를 별도로 생성합니다.
    • 편집 레이어: 새로 추가하거나 변경할 시각적 요소
    • 알파 매트: 편집 레이어가 적용될 영역을 나타내는 grayscale 마스크
  • 생성된 레이어를 원본 영상과 합성하므로, 편집 영역 바깥의 원본 픽셀은 그대로 유지됩니다.
  • 텍스트 지시를 기반으로 다음과 같은 작업을 지원합니다.
    • 객체 추가
    • 배경 변경
    • 복잡한 장면의 시각적 요소 수정
  • 이 방식은 원본 인물의 정체성, 연기, 카메라에 포착된 세부 사항을 보존하는 데 유리합니다.

Vera의 학습 데이터 구축

  • 기존 공개 데이터셋에는 깨끗한 입력 영상, 알파 매트, 편집 레이어, 합성 결과를 함께 제공하는 고품질 레이어드 데이터가 부족했습니다.
  • 넷플릭스는 오픈소스 영상, 자동 처리, 사람의 품질 검수를 결합해 총 48만 6천 프레임, 해상도 832×480 규모의 데이터셋을 구축했습니다.
  • 데이터는 세 단계로 구성됩니다.
    • 합성 영상
      • 고품질 전경 알파 매트를 다양한 자동 생성 배경에 합성
      • 객체 추가와 배경 변경을 위한 알파 매트 학습에 활용
    • 현실적인 단일 객체 영상
      • 분할, 매팅, 배경 인페인팅 또는 생성 과정을 적용
      • 사람의 품질 검수를 거쳐 다양한 장면과 카메라 움직임을 확보
    • 효과가 포함된 다중 객체 영상
      • 개별 객체와 함께 그림자·반사 같은 시각 효과도 분리
      • 복잡하고 동적인 장면에서의 합성 성능을 개선

Vera의 MoT 모델 구조

  • Vera가 생성해야 하는 출력은 서로 다른 특성을 가집니다.
    • 편집 레이어
    • 알파 매트 레이어
    • 자연스러운 합성 영상 레이어
  • 하나의 공유 아키텍처만 사용하면 데이터 효율이 떨어질 수 있어, Vera는 Mixture-of-Transformers(MoT) 구조를 사용합니다.
  • 하나의 DiT 대신 출력별로 세 개의 DiT를 둡니다.
    • 각 분기는 독립적인 QKV projection과 FFN 가중치를 유지합니다.
    • 세 분기의 토큰을 결합한 뒤 joint self-attention을 적용해 서로 간의 상호작용을 가능하게 합니다.
    • 각 분기는 전문성을 유지하면서 다른 레이어의 정보도 활용합니다.
  • 세 DiT는 동일한 사전 학습 T2V 모델에서 초기화됩니다.
  • 추가 입력 처리 방식은 다음과 같습니다.
    • 원본 영상 토큰은 합성 레이어 토큰에 더해집니다.
    • 선택적 마스크 영상 토큰은 노이즈가 포함된 알파 토큰에 더해집니다.
  • 모든 레이어는 동일한 RoPE를 공유하며, 알파·합성 토큰에는 레이어를 구분하도록 0으로 초기화된 학습 임베딩을 추가합니다.

Vera의 평가와 결과

  • 평가용 벤치마크는 다음으로 구성되었습니다.
    • 객체 추가 72개
    • 배경 변경 69개
  • 느리고 빠른 움직임, 다양한 카메라 움직임, 단일·다중 객체, 단순·복잡한 장면을 포함합니다.
  • 성능은 세 기준으로 평가했습니다.
    • 콘텐츠 보존: 편집 대상 바깥 영역이 변하지 않았는지 픽셀 및 지각적 유사도로 측정
    • 지시문 준수: 텍스트 프롬프트를 얼마나 정확히 실행했는지 평가
    • 영상 품질: 시간적 일관성과 프레임별 공간 품질 측정
  • Vera-1.3B와 Vera-14B는 기존 기준 모델보다 콘텐츠 보존 성능에서 크게 우수했습니다.
  • 동시에 가장 강력한 기존 모델들과 비슷한 수준의 영상 품질과 지시문 준수 성능을 유지했습니다.

VOID: 물리적으로 자연스러운 객체 제거

  • VOID는 영상에서 객체와 객체가 장면에 미친 상호작용을 함께 제거하는 비디오 인페인팅 모델입니다.
  • 단순히 객체 영역을 지우는 것이 아니라 다음 요소까지 장면에 맞게 복원하는 것을 목표로 합니다.
    • 객체 뒤에 가려져 있던 배경
    • 객체가 만든 그림자와 반사
    • 주변 물체와의 물리적 상호작용
    • 시간에 따른 움직임과 장면 연속성
  • 따라서 결과 영상은 객체가 처음부터 존재하지 않았던 것처럼 보이도록 설계됩니다.

창작자 통제력을 중심에 둔 연구 방향

  • 넷플릭스는 AI가 창작자의 의도를 대체하기보다 창작 선택을 확장해야 한다는 원칙을 강조합니다.
  • 영상 편집 도구는 무엇을 바꿀지뿐 아니라 무엇을 절대 바꾸지 않을지도 통제할 수 있어야 합니다.
  • Vera는 변경 범위를 레이어 단위로 제한하고, VOID는 제거 후 장면의 물리적 일관성까지 고려함으로써 전문 편집 환경에 필요한 예측 가능성과 보존성을 높이려는 접근입니다.
  • 연구진은 두 모델의 알고리즘과 실험 결과를 논문으로 공개해 후속 연구와 발전을 촉진하려 합니다.

실무적으로는 영상 전체를 재생성하는 방식보다, 편집 영역·보존 영역·합성 결과를 분리하는 구조가 원본 훼손을 줄이고 편집 결과를 더 쉽게 검수할 수 있습니다. 특히 객체 제거 작업에서는 시각적 삭제뿐 아니라 그림자, 반사, 가려진 배경, 시간적 움직임까지 함께 처리해야 자연스러운 결과를 얻을 수 있습니다.