Multi-criteria Token Fusion with One-step-ahead Attention
for Efficient Vision Transformers
Sanghyeok Lee, Joonmyung Choi, Hyunwoo J. Kim
Korea University
Korea Univ.
1
CVPR 2024
Motivation
Total Complexity
-> Quadratic cost in the number of tokens and channels!
Korea Univ.
2
CVPR 2024
Motivation
Liu, Ze, et al. "Swin transformer: Hierarchical vision transformer using shifted windows." ICCV, 2021.
Chu, Xiangxiang, et al. "Twins: Revisiting the design of spatial attention in vision transformers." NeurIPS, 2021.
Wang, Sinong, et al. "Linformer: Self-attention with linear complexity.” Arxiv, 2020.
Xiong, Yunyang, et al. "Nyströmformer: A nyström-based algorithm for approximating self-attention." AAAI, 2021.
Korea Univ.
3
CVPR 2024
EViT (ICLR ‘22)
DynamicViT (NeurIPS ‘21)
Motivation
Problem : informativeness-based fusion often merges substantially dissimilar tokens, resulting in collapsed representations
Korea Univ.
4
CVPR 2024
Token pooling (WACV ‘23)
ToMe (Token merging) (ICLR ’23, Oral)
Motivation
Problem : similarity-based token fusion is prone to combine the foreground tokens despite the importance of it.
Multi-Criteria Token Fusion (MCTF)
to optimize vision transformers by fusing tokens based on multi-criteria.
Korea Univ.
5
CVPR 2024
MCTF
: attraction function by k-th critertion
: temperature parameter to adjust the influence of k-th criteron
Korea Univ.
6
CVPR 2024
2. Informativeness : Capture importance
3. Size : Suppress large-sized tokens
MCTF
Excessive fusion of the foreground object
the tokens in the background are largely fused
Korea Univ.
7
CVPR 2024
MCTF
low Informativeness in previous layer
But High informativeness in the next layer
Korea Univ.
8
CVPR 2024
> different representation
(Token-level augmentation)
(Fixed, dynamic)
MCTF
Korea Univ.
9
CVPR 2024
Experiments
Korea Univ.
10
CVPR 2024
Experiments
Korea Univ.
11
CVPR 2024
Experiments
Korea Univ.
12
CVPR 2024
Multi-criteria Token Fusion with One-step-ahead Attention
for Efficient Vision Transformers
Korea Univ.
13
CVPR 2024