1
Introduction to Large Language Models System
Zirui “Ray” Liu
University of Minnesota, Twin Cities
Quantization
2
Outline
3
Takeaway for quantization
4
Quantization
5
Quantization
6
Quantization
7
IEEE 754 Floating Point Number
8
Integer Number
9
Asymmetric v.s. Symmetric Quantization
10
Asymmetric v.s. Symmetric Quantization
11
Weight only quantization kernel
12
Weight only quantization kernel
13
Weight only quantization kernel
14
Activation-Weight quantization kernel
15
Activation-Weight quantization kernel
16
Activation-Weight quantization kernel
improve throughput
(3725 GB of tokens -> 14GB weight file) 266 X
(7450 GB of tokens -> 14GB weight file) 532 X
(55875 GB of tokens -> 16GB weight file) 3496 X
Insight regarding “Compression”
(3725 GB of tokens -> 14GB weight file) 266 X
(7450 GB of tokens -> 14GB weight file) 532 X
(55875 GB of tokens -> 16GB weight file) 3496 X
Compression is hard to do for latest models
19
Takeaway for quantization
20
Quantization Algorithm
21
Quantization Algorithm