Secret;Weapon
张鑫,李宇轩,李翔
目录
CONTENTS
团队介绍
Team Introduction
01
赛题简介
Competition Introduction
02
工作调研
Related Work
03
算法创新
Novel Solution
04
生成图片展示
Generated Photos Gallery
05
01
团队介绍
Team Introduction
团队介绍
李宇轩
(南开大学博士生)
张鑫
(南开大学研究生)
李翔
(南开大学副教授)
数据预处理,模型调整
整体规划,组织交流
模型设计,实验设计
02
赛题简介
Competition Introduction
[1] Xie E, Wang W, Yu Z, et al. SegFormer: Simple and efficient design for semantic segmentation with transformers[J]. Advances in Neural Information Processing Systems, 2021, 34.
[2] She D, Lai Y K, Yi G, et al. Hierarchical layout-aware graph convolutional network for unified aesthetics assessment. CVPR. 2021: 8475-8484.
[3] Talebi H, Milanfar P. NIMA: Neural image assessment[J]. IEEE transactions on image processing, 2018, 27(8): 3998-4011.
[4] Lee J T, Kim C S. Image aesthetic assessment based on pairwise comparison a unified approach to score regression, binary classification, and personalization. CVPR. 2019: 1191-1200.
风格及语义引导的风景图片生成
Mask accuary[1] * ( 美学评分[2-4] * 20% + ( 风格相似度*0.5 + 0.5 ) * 30% + (100 - FID) / 100 * 50%)
语义分割图
风格参考图
语义信息
风格信息
03
工作调研
Related Work
工作调研(baseline选择)
SPADE[1]
(GAN)
APF-GAN[2]
(GAN)
SDM[3]
(DIFFUSION)
[1] Park T, Liu M Y, Wang T C, et al. Semantic image synthesis with spatially-adaptive normalization. CVPR. 2019: 2337-2346.
[2] https://github.com/zcablii/APF-GAN-jittor.
[3] Wang W, Bao J, Zhou W, et al. Semantic image synthesis via diffusion models[J]. arXiv preprint arXiv:2207.00050, 2022.
工作调研(baseline选择)
[1] Park T, Liu M Y, Wang T C, et al. Semantic image synthesis with spatially-adaptive normalization. CVPR. 2019: 2337-2346.
[2] https://github.com/zcablii/APF-GAN-jittor.
[3] Wang W, Bao J, Zhou W, et al. Semantic image synthesis via diffusion models[J]. arXiv preprint arXiv:2207.00050, 2022.
模型 | 年份 | 参考风格 | FID | 风格相似度 | 训练速度 |
SPADE[1] | 2019 | 是 | 36.0146 | 0.4583 | 一般 |
APF-GAN[2] | 2022 | 否 | 33.4127 | 0.3478 | 较快 |
SDM[3] | 2022 | 否 | 40.3076 | 0.1289 | 较慢 |
SPADE在参考风格图片情况下上限有限
APF-GAN有训练速度快、性能好的特点,选其作为Baseline模型,并进行改进创新
04
算法创新
Novel Solution
针对Decoder
针对Encoder
模型创新
测试创新
风格自适应归一化
模型风格微调+解耦桥接
图像区域融合
算法创新
模型创新
测试创新
风格自适应归一化
模型风格微调+解耦桥接
图像区域融合
算法创新
针对Encoder
针对Decoder
模型风格微调
Relu+Conv+IN
Conv+IN
Relu+Conv+IN
Relu+Conv+IN
Relu+Conv+IN
Relu+Conv+IN
relu
训练完成的APF-GAN模型
Ada
Ada
Ada
Ada
Ada
Relu+Conv+IN
Conv+IN
Relu+Conv+IN
Relu+Conv+IN
Relu+Conv+IN
64*256*256
Conv
ZConv
ZConv
GP
γ
β
GP
…
…
…
…
GP
ZConv
Global Pooling
Zero Convolution
Encoder
Decoder
模型解耦桥接
D
初始模型
(根据APF-GAN训练完成)
E
风格微调阶段
D1
E1
…
D2
E2
Fine-tune
D99
E99
D
E99
模型桥接
推理生成
FID: 31->36 (变糟)
微调结构
模型风格微调+解耦桥接
| Mask_acc↑ | 美学评分↑ | FID↓ | 风格相似度↑ | 总分↑ |
Baseline | 0.9236 | 0.5150 | 31.5723 | 0.3524 | 0.5985 |
+风格微调 | 0.9093 | 0.4975 | 36.7296 | 0.5223 | 0.5858 |
+解耦桥接 | 0.9219 | 0.5072 | 30.8868 | 0.4647 | 0.6147 (+1.62%) |
风格微调的情况下,FID与风格相似度无法同时提升
模型桥接的操作可以将两个指标进行解耦,在保证FID不变情况下提升风格相似度
该方法生成的图像质量较高,将作为基础模型1
模型创新
测试创新
风格自适应归一化
模型风格微调+解耦桥接
图像区域融合
算法创新
针对Decoder
针对Encoder
风格自适应归一化
γ
β
Conv
Conv
conv
conv
conv
Instance
Norm
×
+
element-wise
Image Encoder
APF-GAN原有结构
风格自适应归一化
空间自适应归一化
Encoder
Decoder
Decoder中的spade结构
风格自适应归一化
| Mask_acc↑ | 美学评分↑ | FID↓ | 风格相似度↑ | 总分↑ |
Baseline | 0.9236 | 0.5150 | 31.5723 | 0.3524 | 0.5985 |
风格自适应归一化 | 0.8940 | 0.5078 | 34.7925 | 0.7497 | 0.6169 (+1.84%) |
风格自适应归一化的方法能带来风格相似度的显著提升
该方法生成的图像风格相似度较高,将作为基础模型2
风格自适应归一化
语义分割图
风格参考图
模型2
模型1
模型2 无法参考风格图片中没有的类别进行图像生成,图片整体风格相似度高
模型1 模型设计本身没有考虑参考风格图片,生成图像没有限制生成质量高
存在问题:语义图和风格图类别不匹配
模型创新
测试创新
风格自适应归一化
模型风格微调+解耦桥接
图像区域融合
算法创新
针对Encoder
针对Decoder
区域融合策略
语义分割图
风格参考图
模型2
(风格更佳)
模型1
(质量更佳)
融合后图片
区域融合策略
| Mask_acc↑ | 美学评分↑ | FID↓ | 风格相似度↑ | 总分↑ |
模型1 | 0.9219 | 0.5072 | 30.8868 | 0.4647 | 0.6147 |
模型2 | 0.8940 | 0.5078 | 34.7925 | 0.7497 | 0.6169 |
区域融合 | 0.9035 | 0.5080 | 33.4437 | 0.7034 | 0.6233 |
区域融合策略能够很好平衡FID和风格相似度
05
结果展示
Generated Photos Gallery
结果展示
语义分割图
风格参考图
模型生成图
开源情况
模型权重开源
GitLink
GitHub
第三方库均为开源库
代码说明文件开源
关键代码注释
Secret;Weapon
张鑫,李宇轩,李翔