1 of 26

VIDEOCOMPOSER: COMPOSITIONAL VIDEO SYNTHESIS WITH MOTION CONTROLLABILITY��VIDEOCOMPOSER:具有運動可控性的影片合成

Presenter: Hsin-Wei, Lin

Date: 2024/01/10

2 of 26

OUTLINE

  • Introduction (引言)
  • Related Work (相關工作)
  • Workflow (流程)
  • Experiments (實驗)
  • Conclusion (結論)

3 of 26

INTRODUCTION (1/2)

3

現有的DM影片生成調整方法

    • 分割圖
    • 修復遮罩
    • 草圖

    • Shortcoming:
      • 存在有限的畫面可控性。

Composer

    • 在各種輸入條件下組合影像。

    • Shortcoming:
      • 主要專注於考慮空間維度的多層次條件,生成時間動態資料(影片)時可能會有困難。

VideoComposer

    • 改進的時間和空間感知的可控性;
    • 訓練了以時間、空間、文字條件爲輸入的模型;
    • 引入特別的運動向量和STC-編碼器以給予時序引導;
    • 可手動定義運動方向。

  • 特別的運動向量和STC-編碼器
    • 明確捕獲幀間動態,從而提供對內部運動的直接控制;
    • 時空條件編碼器(STC-encoder):利用跨幀注意機制捕獲順序輸入時間和空間的關係,從而增強輸出影片的幀間一致性

4 of 26

INTRODUCTION (2/2) – 貢獻

  • VideoComposer能夠生成符合文本、空間和時間條件或以上之子集的影片(圖a-c;
  • VideoComposer可以合成符合從兩個簡單筆畫派生的預期運動模式(紅色筆畫)和形狀模式(白色筆畫)之影片。

4

5 of 26

RELATED WORK

5

GAN

VAE

flow models

Diffusion

  • 訓練穩定√
  • 樣本質量增強√
  • 提高條件生成之靈活性√

Enhanced�&�Improves

text

encoder

video

generation

DALL· E [CFG + CLIP]

Imagen [LLM: T5]

pix2pix-zero, prompt-to-prompt editing

[交叉注意力以遵循指導文本]

ControlNet, T2I-adapter

[合併空間條件至模型中]

multi-condition

Composer

Composer

image-to-vid

others

  • 在像素空間建模(計算量高)
  • 交叉注意力圖、影像-影片微調策略(過於依賴基於文本的指令)
  • (缺少多個條件運用於單一模型、模型結合運動向量的研究)

VideoComposer

  • 潛在擴散模型建模
  • 運動向量對影像的可控性優化
  • 設計良好的增強時間控制
  • 在單個模型中結合運動向量的指導或結合多個指導條件生成影片

6 of 26

WORK FLOW (1/7) – 系統架構圖

6

3

2

1

7 of 26

WORK FLOW (2/7) – VLDM (1/2)

  • 感知影片壓縮

7

Video

Pre-trained�Encoder

Latent�Representation

Decoder

D

Pixel Space

8 of 26

WORK FLOW (3/7) – VLDM (2/2)

  • 潛在空間的擴散模型
    • Temporal Convolutional Networks
    • Cross-Attention

8

T = 1000

Latent

“3D U-Net”

Conditions

9 of 26

WORK FLOW (4/7) – 條件 (1/2)

  • Textual Condition(文本條件)
    • 對DM生成影像有著非常直接的指示性
    • 論文採用 OpenCLIP2 ViT-H/14 中廣泛使用的預訓練文本編碼器來獲取文本描述的語義嵌入。
  • Spatial Conditions(空間條件)
    • 三種空間條件來提供結構和風格指導:
      • 單影像:影片的第一幀作爲空間條件執行影像到影片的生成
      • 單草圖:使用PiDiNet提取第一個影片幀的草圖
      • 風格:應用 OpenCLIP ViT-H/14 中的預訓練影像編碼器來提取風格表示

9

圖源:https://github.com/mlfoundations/open_clip

10 of 26

WORK FLOW (5/7) – 條件 (2/2)

  • Temporal Conditions(時間條件)
    • 運動向量:顯式地編碼兩個相鄰幀之間的像素級運動
    • 草圖序列:與單個草圖相比,草圖序列可以提供更多的控制細節,從而實現精確的定制合成。
    • 深度順序
    • 遮罩序列

10

圖源:Towards Robust Monocular Depth Estimation: Mixing Datasets for Zero-shot Cross-dataset Transfer

11 of 26

WORK FLOW (6/7) – STC-ENCODER

  • 作用:合併時間、空間關係
    • 二維卷積和平均池化層應用於輸入序列
      • 旨在提取局部空間資訊
    • 將得到的條件序列輸入Temporal Transformer 層
      • 進行Temporal Modeling
  • STC編碼器有助於時間線索的顯式嵌入,為不同的輸入提供統一的條件介面,從而增強幀間一致性。

11

12 of 26

WORK FLOW (7/7) – 訓練和推理

  • 兩階段訓練策略
    • 第一階段的目標是預訓練模型,通過文本到影片生成專門進行時間建模。
    • 在第二階段,論文優化VideoComposer,通過合成訓練在多種條件控制的影片合成方面表現出色。
  • 推理
    • 採用DDIM來增強樣本品質並提高推理效率。論文採用無分類器 (CFG)指導以確保生成結果符合指定條件。

12

13 of 26

EXPERIMENTS (1/12)– 實驗設定

  • 資料集
    • WebVid 10M
    • LAION-400M
      • 使用CLIP進行過濾的影像-文字配對資料集
  • 評估指標
    • 為了評估影片連續性,論文按照 Gen-1 計算兩個連續幀的平均 CLIP 余弦相似度,作為幀一致性指標;
    • 為了評估運動可控性,論文採用端點誤差作為運動控制度量,它測量每個像素的預測光流和ground truth光流之間的歐氏距離。

13

14 of 26

EXPERIMENTS (2/12) – 具有多條件的可組合影片生成(1/6)

  • 組合image-to-video生成 - Motion

14

“Tiger”

“Tiger”

TEXT + SINGLE IMAGE

TEXT + SINGLE IMAGE + MOTION

15 of 26

EXPERIMENTS (3/12) – 具有多條件的可組合影片生成(2/6)

  • 組合image-to-video生成(續) - Depth

15

“Bouquet of the yellow leaves.

Autumn girl walking in city park”

TEXT + SINGLE IMAGE

TEXT + SINGLE IMAGE + DEPTH

“Bouquet of the yellow leaves.

Autumn girl walking in city park”

16 of 26

EXPERIMENTS (4/12) – 具有多條件的可組合影片生成(3/6)

  • 組合image-to-video生成(續) - Sketch

16

“The Matterhorn with flowers in the foreground”

TEXT + SINGLE IMAGE

TEXT + SINGLE IMAGE + SKETCH

“The Matterhorn with flowers in the foreground”

17 of 26

EXPERIMENTS (5/12) – 具有多條件的可組合影片生成(4/6)

  • 組合影片修復

17

INPUT MASKED VIDEO

TEXT + MASK

TEXT + MASK + DEPTH

TEXT + MASK + SKETCH

“Swan lazily drifting and trimming itself on a calm river”

“Swan lazily drifting and trimming itself on a calm river”

“Black swan lazily drifting and trimming itself on a calm river”

選取欲修改區域之遮罩

18 of 26

EXPERIMENTS (6/12) – 具有多條件的可組合影片生成(5/6)

  • 組合影片修復(續)

18

INPUT MASKED VIDEO

TEXT + MASK

TEXT + MASK + DEPTH

TEXT + MASK + SKETCH

“Coastal view of Cleveland Road and Robin Hood's Bay, blue sky and sea with white clouds”

“Coastal view of Cleveland Road and Robin Hood's Bay, blue sky and sea with white clouds”

19 of 26

EXPERIMENTS (7/12) – 具有多條件的可組合影片生成(6/6)

  • 組合sketch-to-video生成

19

INPUT HAND DRAWINGS

TEXT + SINGLE SKETCH

TEXT + SINGLE SKETCH + DEPTH

“Pigeon sits on a stone with an iron net behind it”

“Pigeon sits on a stone with an iron net behind it”

單個草圖的合成訓練使VideoComposer具有動畫化靜態草圖的能力

20 of 26

EXPERIMENTS (8/12) – 運動控制的實驗結果(1/3)

  • 定量評估
    • 隨機選取1000「文字-影片」配對資料並合成相應的影片。
    • 當「運動向量」作爲條件會減少運動控制誤差
    • STC-encoder的結合進一步提高了運動影片的可控性

20

21 of 26

EXPERIMENTS (9/12) – 運動控制的實驗結果(2/3)

  • 運動向量優先考量移動視覺線索
    • 運用運動向量對於「動」和「靜」描述的特性
    • 有利於合成運動影片
    • (配圖)相較於其他「條件」的引導生成,使用「運動向量」的條件引導對於消除靜態背景有非常大的幫助。

21

“American Staffordshire Terrier is lying on the floor in an abandoned building.”

22 of 26

EXPERIMENTS (10/12) – 運動控制的實驗結果(3/3)

  • 具有運動向量的多功能運動控制

22

“A moving golden moon”

TEXT + HAND-CRAFTED MOTIONS

TEXT + HAND-CRAFTED MOTIONS

TEXT + HAND-CRAFTED MOTIONS

TEXT + HAND-CRAFTED MOTIONS

23 of 26

EXPERIMENTS (11/12) – 消融研究(1/2)

  • 定量分析
    • 提出了在 1000 個測試影片上計算的幀一致性度量
    • 合併 STC 編碼器增強了幀一致性,論文將其歸因於其時間建模能力
    • 該觀察結果適用於各種時間條件,例如草圖、深度圖和運動向量。

23

24 of 26

EXPERIMENTS (12/12) – 消融研究(2/2)

  • 定性分析

24

25 of 26

CONCLUSION

  • 在本文中,論文提出了VideoComposer,旨在探索影片合成領域的組合性,力求獲得靈活可控的合成系統。特別是,論文探索使用影片的時間條件,特別是運動向量,作為強大的控制訊號來提供時間動態方面的指導STC 編碼器進一步設計為統一介面,用於聚合順序輸入的空間和時間依賴性,以實現幀間一致性。論文的實驗涉及各種條件的組合以增強可控性,強調了論文設計選擇的關鍵作用,並揭示了所提議的 VideoComposer 令人印象深刻的創造力

25

26 of 26

THAT’S ALL�THANK YOU!