1 of 26

Secret;Weapon

张鑫,李宇轩,李翔

2 of 26

目录

CONTENTS

团队介绍

Team Introduction

01

赛题简介

Competition Introduction

02

工作调研

Related Work

03

算法创新

Novel Solution

04

生成图片展示

Generated Photos Gallery

05

3 of 26

01

团队介绍

Team Introduction

4 of 26

团队介绍

  • 伦敦大学学院 本硕一等学位
  • 第二届计图人工智能挑战赛冠军
  • 首届粤港澳大湾区算法算例大赛遥感目标检测亚军
  • Facebook Hack-a-Project 2019 亚军
  • 一作发表 ICCV2023

李宇轩

(南开大学博士生)

张鑫

(南开大学研究生)

李翔

(南开大学副教授)

  • 国家奖学金、重庆大学优秀本科毕业生
  • 首届粤港澳大湾区算法算例大赛遥感目标检测亚军
  • 华为云人工智能大赛算法赛道冠军
  • 百青人才引进计划
  • 2020年度博士后创新人才计划
  • 阿里巴巴天池首届大数据竞赛冠军
  • 滴滴首届大数据算法竞赛冠军
  • 第二届计图人工智能挑战赛冠军
  • 首届粤港澳大湾区算法算例大赛遥感目标检测亚军
  • 发表人工智能领域顶会顶刊CVPR、NeurIPS T-PAMI等20+篇论文,Google Citation 7600+

数据预处理,模型调整

整体规划,组织交流

模型设计,实验设计

5 of 26

02

赛题简介

Competition Introduction

6 of 26

[1] Xie E, Wang W, Yu Z, et al. SegFormer: Simple and efficient design for semantic segmentation with transformers[J]. Advances in Neural Information Processing Systems, 2021, 34.

[2] She D, Lai Y K, Yi G, et al. Hierarchical layout-aware graph convolutional network for unified aesthetics assessment. CVPR. 2021: 8475-8484.

[3] Talebi H, Milanfar P. NIMA: Neural image assessment[J]. IEEE transactions on image processing, 2018, 27(8): 3998-4011.

[4] Lee J T, Kim C S. Image aesthetic assessment based on pairwise comparison a unified approach to score regression, binary classification, and personalization. CVPR. 2019: 1191-1200.

风格及语义引导的风景图片生成

Mask accuary[1] * ( 美学评分[2-4] * 20% + ( 风格相似度*0.5 + 0.5 ) * 30% + (100 - FID) / 100 * 50%)

语义分割图

风格参考图

语义信息

风格信息

7 of 26

03

工作调研

Related Work

8 of 26

工作调研(baseline选择)

SPADE[1]

(GAN)

APF-GAN[2]

(GAN)

SDM[3]

(DIFFUSION)

[1] Park T, Liu M Y, Wang T C, et al. Semantic image synthesis with spatially-adaptive normalization. CVPR. 2019: 2337-2346.

[2] https://github.com/zcablii/APF-GAN-jittor.

[3] Wang W, Bao J, Zhou W, et al. Semantic image synthesis via diffusion models[J]. arXiv preprint arXiv:2207.00050, 2022.

9 of 26

工作调研(baseline选择)

[1] Park T, Liu M Y, Wang T C, et al. Semantic image synthesis with spatially-adaptive normalization. CVPR. 2019: 2337-2346.

[2] https://github.com/zcablii/APF-GAN-jittor.

[3] Wang W, Bao J, Zhou W, et al. Semantic image synthesis via diffusion models[J]. arXiv preprint arXiv:2207.00050, 2022.

模型

年份

参考风格

FID

风格相似度

训练速度

SPADE[1]

2019

36.0146

0.4583

一般

APF-GAN[2]

2022

33.4127

0.3478

较快

SDM[3]

2022

40.3076

0.1289

较慢

SPADE在参考风格图片情况下上限有限

APF-GAN有训练速度快、性能好的特点,选其作为Baseline模型,并进行改进创新

10 of 26

04

算法创新

Novel Solution

11 of 26

针对Decoder

针对Encoder

模型创新

测试创新

风格自适应归一化

模型风格微调+解耦桥接

图像区域融合

算法创新

12 of 26

模型创新

测试创新

风格自适应归一化

模型风格微调+解耦桥接

图像区域融合

算法创新

针对Encoder

针对Decoder

13 of 26

模型风格微调

Relu+Conv+IN

Conv+IN

Relu+Conv+IN

Relu+Conv+IN

Relu+Conv+IN

Relu+Conv+IN

relu

训练完成的APF-GAN模型

Ada

Ada

Ada

Ada

Ada

Relu+Conv+IN

Conv+IN

Relu+Conv+IN

Relu+Conv+IN

Relu+Conv+IN

64*256*256

Conv

ZConv

ZConv

GP

γ

β

GP

GP

ZConv

Global Pooling

Zero Convolution

Encoder

Decoder

14 of 26

模型解耦桥接

D

初始模型

(根据APF-GAN训练完成)

E

风格微调阶段

D1

E1

D2

E2

Fine-tune

D99

E99

D

E99

模型桥接

推理生成

FID: 31->36 (变糟)

微调结构

15 of 26

模型风格微调+解耦桥接

Mask_acc↑

美学评分↑

FID↓

风格相似度↑

总分↑

Baseline

0.9236

0.5150

31.5723

0.3524

0.5985

+风格微调

0.9093

0.4975

36.7296

0.5223

0.5858

+解耦桥接

0.9219

0.5072

30.8868

0.4647

0.6147 (+1.62%)

风格微调的情况下,FID与风格相似度无法同时提升

模型桥接的操作可以将两个指标进行解耦,在保证FID不变情况下提升风格相似度

该方法生成的图像质量较高,将作为基础模型1

16 of 26

模型创新

测试创新

风格自适应归一化

模型风格微调+解耦桥接

图像区域融合

算法创新

针对Decoder

针对Encoder

17 of 26

风格自适应归一化

γ

β

Conv

Conv

conv

conv

conv

Instance

Norm

×

+

element-wise

Image Encoder

APF-GAN原有结构

风格自适应归一化

空间自适应归一化

Encoder

Decoder

Decoder中的spade结构

18 of 26

风格自适应归一化

Mask_acc↑

美学评分↑

FID↓

风格相似度↑

总分↑

Baseline

0.9236

0.5150

31.5723

0.3524

0.5985

风格自适应归一化

0.8940

0.5078

34.7925

0.7497

0.6169 (+1.84%)

风格自适应归一化的方法能带来风格相似度的显著提升

该方法生成的图像风格相似度较高,将作为基础模型2

19 of 26

风格自适应归一化

语义分割图

风格参考图

模型2

模型1

模型2 无法参考风格图片中没有的类别进行图像生成,图片整体风格相似度高

模型1 模型设计本身没有考虑参考风格图片,生成图像没有限制生成质量高

存在问题:语义图和风格图类别不匹配

20 of 26

模型创新

测试创新

风格自适应归一化

模型风格微调+解耦桥接

图像区域融合

算法创新

针对Encoder

针对Decoder

21 of 26

区域融合策略

语义分割图

风格参考图

模型2

(风格更佳)

模型1

(质量更佳)

融合后图片

22 of 26

区域融合策略

Mask_acc↑

美学评分↑

FID↓

风格相似度↑

总分↑

模型1

0.9219

0.5072

30.8868

0.4647

0.6147

模型2

0.8940

0.5078

34.7925

0.7497

0.6169

区域融合

0.9035

0.5080

33.4437

0.7034

0.6233

区域融合策略能够很好平衡FID风格相似度

23 of 26

05

结果展示

Generated Photos Gallery

24 of 26

结果展示

语义分割图

风格参考图

模型生成图

25 of 26

开源情况

模型权重开源

GitLink

GitHub

第三方库均为开源库

代码说明文件开源

关键代码注释

26 of 26

Secret;Weapon

张鑫,李宇轩,李翔