Artificial Intelligence
Tech-Crashcourse: Block 2
1
Fahrplan
2
About the course
3
Was ist KI? In diesem Kurs: Deep Learning
4
Sammelbegriff für viele verschiedenen Verfahren
Bestimmte Verfahrensweise
Spezifische Modelle
GOFAI
Programm letzter Block
5
Perceptron
Bildklassifikation�(LeNet)
Word2Vec
Transformer�LLM
ChatGPT
2018
2013
1958
1989
2023
From zero to ChatGPT
Zum Einstieg
6
Programm dieser Block
7
Perceptron
Word2Vec
Transformer�LLM
ChatGPT
2018
2013
1958
1989
2023
Bildklassifikation�(LeNet)�
1991
Autoencoder
2014
GANs
2019
Diffusion
2021
Stable
Diffusion
CLIP
Wiederholung & Ergänzung
8
Perceptron
Word2Vec
Transformer�LLM
ChatGPT
2018
2013
1958
1989
2023
Bildklassifikation�CNNs, (LeNet)
Maschinelles Lernen
9
* w1
+
* w2
Eingabe(n)
Erwünschte Ausgabe(n)
Fehler
Optimierer
Algorithmus�
Parameter
Ausgabe(n)
Katze
Die Parameter werden so angepasst, dass aktuelle und erwünschte Ausgabe übereinstimmen
Hund
Trainingsbeispiel
Abgleich von erwünschter und tatsächlicher Ausgabe
“drehen an den Parametern”
Maschinelles Lernen
10
* w1
+
* w2
Eingabe(n)
Erwünschte Ausgabe(n)
Fehler
Optimierer
Algorithmus�
Parameter
Ausgabe(n)
Anhand des generellen Prinzips können wir die Bausteine mit Daten und Mechanismen befüllen
Perceptron
11
* w1
+
* w2
Samples | S1 | S2 | S3 | S4 |
Petal Länge [cm] | 4.3 | 4.1 | 6.0 | 5.1 |
Petal Breite [cm] | 1.3 | 1.3 | 2.5 | 1.9 |
versicolor := 0 virginica := 1 | 0 | 0 | 1 | 1 |
x0
b
x1
* w1
+
* w2
S1 | S2 | S3 | S4 |
0 | 1 | 1 | 1 |
Fehler f �erw. Ausgabe - Ausgabe | |||
S1 | S2 | S3 | S4 |
0 | -1 | 0 | 0 |
wi = wi + ɑ * -1 * xi ɑ := Lernrate
Summe der gewichteten Inputs müssen Schwellenwert überschreiten
Verbesserung 1�“Weiche Klassifikation”
12
* w1
+
* w2
x0
b
x1
* w1
+
* w2
* w1
+
* w2
x0
b
x1
* w1
+
* w2
Ausgabe �0: Klasse 0�1: Klasse 1
Ausgabe zwischen 0 und 1
Interpretation als Wahrscheinlichkeit von Klasse 1
Multilayer Perceptron
13
Eingabe(n)
Erwünschte Ausgabe(n)
Fehler
Optimierer
Ausgabe(n)
Backpropagation: �Gradienten basierte �Optimierung
…
…
1
LeNet�Yann LeCun
14
Eingabe(n)
Erwünschte Ausgabe(n)
Fehler
Optimierer
Ausgabe(n)
1
Wiederholung & Ergänzung
15
Perceptron
Word2Vec
Transformer�LLM
ChatGPT
2018
2013
1958
1989
2023
Bildklassifikation�CNNs, (LeNet)
Convolutional Neural Networks (CNNs)
16
Convolutions
Input Image
Kernel
Featuremap
Stride
LeNet�Yann LeCun
19
Eingabe(n)
Erwünschte Ausgabe(n)
Fehler
Optimierer
Ausgabe(n)
1
Convolutional Neural Networks (CNNs)
20
Deep Learning (~2010)
21
* w1
+
* w2
input
desired output
loss
optimize
Algorithmus�
Parameter
output
A lot, really a lot, perceptrons in parallel and in row
sehr schwierig!
Viele kleine Modifikationen
Transfer Learning: Finetuning
22
Target Domain: Your Data
Dolphin�Plane�� �Cat�Chair
NewCat1��NewCat2��NewCat3
Wir nehmen ein Netz, welches auf einen großen Datensatz vortrainiert wurde und passen es an unsere Aufgabe an, indem wir die hinteren Schichten austauschen
Wiederholung & Ergänzung
23
Perceptron
Word2Vec
Transformer�LLM
ChatGPT
2018
2013
1958
1989
2023
Bildklassifikation�CNNs, (LeNet)
Word2Vec
0
0
1
0
0
0
0
0
0
0
0
0
Ein Satz dem ein in der Mitte fehlt
0
0
0
.7
0
0
.5
.8
0
0
0
.3
0
.1
.2
.4
.1
0
2
4
1
Wort
One-Hot Encoding des Vokabular
Vorhersage von
benachbarten Wörtern
Latenter Code: WordVector
1 0 0 1 0 0 0 0 1 0 1 0 1 1 0
gewünschter Output
Output
Eingabe
ein
dem
kleiner
Wort
Satz
anderer
etwas
komplett
verschiedene
Geschichte
in
fehlt
der
Mitte
Stück
Masked �Language�Models
1
0
1
3
3
1
9
2
1
1
2
2
0
0
1
1
0
1
3
3
3
3
2
1
3
2
2
0
0
0
...
contextualization
contextualization
contextualization
...
A <mask> at the road
...
...
...
...
tree
...
way
sun
sign
0.1 0.3 0.1 0.1
“BERT” - Familie
Masked Language Model
Pretrained Masked Language Model:�https://huggingface.co/microsoft/mpnet-base
Erkläre den Unterschied zwischen den beiden Vorhersagen:
Können Sie den Kontext des folgenden Satzes so erweitern, dass sich die Wahrscheinlichkeit von “apartment” stark erhöht?
Attention
27
3
2
0
3
1
2
1
1
5
2
0
1
The beginning of
0
0
0
0
0
0
0
0
1
2
1
1
1
1
1
1
2
4
0
1
WordVectors
Attention
28
3
2
0
3
1
2
1
1
5
2
0
1
0
0
0
0
0
0
0
0
1
2
1
1
1
1
1
1
2
4
0
1
3
2
0
3
1
2
1
1
5
2
0
1
The beginning of
Attention
29
3
2
0
3
1
2
1
1
5
2
0
1
0
0
0
0
0
0
0
0
1
2
1
1
1
1
1
1
2
4
0
1
3
2
0
3
1
2
1
1
5
2
0
1
3
2
0
3
1
2
1
1
5
2
0
1
The beginning of
Attention
30
3
2
0
3
1
2
1
1
5
2
0
1
0
0
0
0
0
0
0
0
1
2
1
1
1
1
1
1
2
4
0
1
3
2
0
3
1
2
1
1
5
2
0
1
3
2
0
3
1
2
1
1
5
2
0
1
The beginning of
Query-, Key-, Valuevektor
Attention
31
3
2
0
3
1
2
1
1
5
2
0
1
0
0
0
0
0
0
0
0
1
2
1
1
1
1
1
1
2
4
0
1
3
2
0
3
1
2
1
1
5
2
0
1
3
2
0
3
1
2
1
1
5
2
0
1
The beginning of
= 0.4
= 0.5
*
= 0.1
Query-, Key-, Valuevektor
Attention
32
3
2
0
3
1
2
1
1
5
2
0
1
0
0
0
0
0
0
0
0
1
2
1
1
1
1
1
1
2
4
0
1
3
2
0
3
1
2
1
1
5
2
0
1
3
2
0
3
1
2
1
1
5
2
0
1
The beginning of
0.4 *
0.5 *
*
0.1 *
Query-, Key-, Valuevektor
2
4
1
2
+
Attention
33
3
2
0
3
1
2
1
1
5
2
0
1
0
0
0
0
0
0
0
0
1
2
1
1
1
1
1
1
2
4
0
1
3
2
0
3
1
2
1
1
5
2
0
1
3
2
0
3
1
2
1
1
5
2
0
1
The beginning of
0.1 *
0.6 *
*
0.3 *
+
2
4
1
2
2
1
1
1
Attention
34
3
2
0
3
1
2
1
1
5
2
0
1
0
0
0
0
0
0
0
0
1
2
1
1
1
1
1
1
2
4
0
1
3
2
0
3
1
2
1
1
5
2
0
1
3
2
0
3
1
2
1
1
5
2
0
1
The beginning of
0.0 *
0.1 *
*
0.9 *
+
2
4
1
2
2
2
1
1
2
1
1
1
Attention
35
3
2
0
3
1
2
1
1
5
2
0
1
0
0
0
0
0
0
0
0
1
2
1
1
1
1
1
1
2
4
0
1
3
2
0
3
1
2
1
1
5
2
0
1
3
2
0
3
1
2
1
1
5
2
0
1
The beginning of
2
4
1
2
2
2
1
1
2
1
1
1
(stärker) kontextualisierte �Wordvektoren
�Wordvektoren
Masked �Language�Models
...
A <mask> at the road
...
...
contextualization
contextualization
contextualization
...
...
...
“BERT” - Familie
tree
...
way
sun
sign
0.1 0.3 0.1 0.1
1
0
1
3
3
1
9
2
1
1
2
2
0
0
1
1
0
1
3
3
3
3
2
1
3
2
2
0
0
0
1
0
1
3
3
1
9
2
1
1
2
2
0
0
1
1
0
1
3
3
1
9
2
1
1
2
2
0
0
1
Causal �Language �Models
37
1
2
2
1
0
1
...
A tree in the
0
0
1
wood
...
house
sea
I
.1 .9 0 0
1
0
1
12
03
12
1
03
1
1
0
1
1
0
1
1
0
1
Contextualisation
Contextualisation
Contextualisation
Token
WordVectors
contextualized
WordVectors
next Token
probability
One-hot Encoding
“GPT” - Familie
Von Text Generation to Instruction Following
38
Instructions sollen nach den 3H beantwortet werden: Helpful, Harmless, Honest
Instruction Following Finetuning
Instruct GPT (März 2022)
Lernpyramide
Casual Language Model�Lernt Syntax und Semantik �von Sprache
Instruction �Following Model�Lernt zu Antworten (3H)
Pretraining
Transfer Learning
Finetuning der Gewichte
Großer Korpus von Textdaten
Manuell kuratierte gewünschte Antworten
In Context Learning�Prompt Engineering
Model�+ System Prompt
+ User Prompt
Nutzerspezifische Anpassungen
ChatGPT: Anwenderperspektive
42
Few-shot Prompting
43
Brown, T., Mann, B., Ryder, N., Subbiah, M., Kaplan, J. D., Dhariwal, P., ... & Amodei, D. (2020). Language models are few-shot learners.
Modelgröße
Chain-of-thought Prompting
44
Kojima, T., Gu, S. S., Reid, M., Matsuo, Y., & Iwasawa, Y. (2022). Large language models are zero-shot reasoners.
Achtung
45
(Achtung)
46
ChatGPT Plugins
47
Lernpyramide
Casual Language Model�Lernt Syntax und Semantik �von Sprache
Instruction �Following Model�Lernt zu Antworten (3H)
Pretraining
Transfer Learning
Finetuning der Gewichte
Großer Korpus von Textdaten
Manuell kuratierte gewünschte Antworten
In Context Learning�Prompt Engineering
Model�+ System Prompt
+ User Prompt
Nutzerspezifische Anpassungen
Transformer Agents
49
Programm dieser Block
50
Perceptron
Word2Vec
Transformer�LLM
ChatGPT
2018
2013
1958
1989
2023
Bildklassifikation�CNNs (LeNet)�
1991
Autoencoder
2014
GANs
2019
Diffusion
2021
Stable
Diffusion
CLIP
Autoencoder
* w1
+
Eingabe
gewünschte Ausgabe
Ausgabe
Fehler
Optimierung
Minimaler Rekonstruktionsfehler�(Pixelbasiert)
Show me the Code
52
Autoencoder
Embedding
Input
Output
Autoencoder
Embedding
Input
Output
e2 + a * (e4 - e2)
e4
e2
e4
e4-e2
0
→
→
→
→
→
→
→
→
0.1
0.2
0.3
0.4
0.6 0.7 0.8 0.9
Im Embeddingraum rechnen
Variational Autoencoder (VAE)
* w1
+
Eingabe
gewünschte Ausgabe
Ausgabe
Fehler
Optimierung
Komplizierterer Fehlertem
Encoder-Decoder Transformationen
56
Man kann den Autoencoder auch trainieren um Bilder zu transformieren
Encoder-Decoder Architektur
57
Input
Transformation
Transformation von Bildern
Encoder-Decoder Architektur
58
Transformation von Bildern
UNet: Encoder-Decoder mit Highway
59
Embedding
Input
Output
UNet: Instance Segmentation
MICCAI COVID-19 Lung Segmentation Challenge:�Markieren von erkranktem Gewebe
UNet: Instance Segmentation
Semantische Strukturierung von Bildern
Programm dieser Block
62
Perceptron
Word2Vec
Transformer�LLM
ChatGPT
2018
2013
1958
1989
2023
Bildklassifikation�CNNs (LeNet)�
1991
Autoencoder
2014
GANs
2019
Diffusion
2021
Stable
Diffusion
CLIP
Generative Adversarial Networks
63
GANs | realistische Bilder per Zufall generieren
Generator
GANs | realistische Bilder per Zufall generieren
Generator
�Gewünschter Output Bild sieht aus wie ein “natürliches” Bild
Fehler Stellen im Bild die unnatürlich erscheinen
GANs | Bewerten der Natürlichkeit mit Diskriminator
Zufall
Generator
generiertes Bild
Gewünschter Output:� realistisches Bild
Diskriminator
natürliches Bild
Ausgabe: Wahrscheinlichkeit für natürliches Bild
GANs | Trainieren des Generators
Zufall
Generator
generiertes Bild
Gewünschter Output:� realistisches Bild
Diskriminator
natürliches Bild
Ausgabe: Wahrscheinlichkeit für natürliches Bild
Fehler: Diskriminator erkennt generiertes Bild�(mit Information woran er es erkannt hat)
update
GANs | Trainieren des Diskriminator
Zufall
Generator
generiertes Bild
Gewünschter Output:� realistisches Bild
Diskriminator
natürliches Bild
Ausgabe: Wahrscheinlichkeit für natürliches Bild
Fehler: Diskriminator erkennt generiertes Bild � nicht
update
Show me the Code
69
70
Perceptron
Word2Vec
Transformer�LLM
ChatGPT
2018
2013
1958
1989
2023
Bildklassifikation�CNNs (LeNet)
1991
Autoencoder
2014
GANs
2019
Diffusion
2021
Stable
Diffusion
CLIP
Vision Transformer
CNN für Bildklassifizierung
71
Vision Transformer für Bildklassifizierung
72
Dosovitskiy et al. in An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
Performance of ViT
und
73
74
Perceptron
Word2Vec
Transformer�LLM
ChatGPT
2018
2013
1958
1989
2023
Bildklassifikation�CNNs (LeNet)
1991
Autoencoder
2014
GANs
2019
Diffusion
2021
Stable
Diffusion
CLIP
75
Perceptron
Word2Vec
Transformer�LLM
ChatGPT
2018
2013
1958
1989
2023
Bildklassifikation�CNNs (LeNet)�
1991
Autoencoder
2014
GANs
2019
Diffusion
2021
Stable
Diffusion
CLIP
CLIP: Contrastive Language Image Pretraining
76
Ausgabe:
Gewünschte Ausgabe:
Eingabe: �Stapel von Bildern mit Textbeschreibungen
Text-Embeddings
Bild-Embeddings
CLIP: Zero-shot prediction
77
Show me the code
78
Diffusion
79
Idee: Ein Bild zu “verrauschen” ist ein einfacher physikalischer Prozess, wir müssen lernen das Bild zu entrauschen
Diffusion Training erklärt:
80
81
82
83
84
85
86
87
88
Perceptron
Word2Vec
Transformer�LLM
ChatGPT
2018
2013
1958
1989
2023
Bildklassifikation�CNNs (LeNet)
1991
Autoencoder
2014
GANs
2019
Diffusion
2021
Stable
Diffusion
89
Zuerst Autoencoder
90
Diffusion mit den latenten Repräsentationen
91
Diffusion mit den latenten Repräsentationen
92
Denoising mit Text Guidance
93
Denoising mit Text Guidance
Stable Diffusion
94
Stable Diffusion nutzen
Mit Erklärung:
95
Finetuning Stable Diffiusion
96
Dreambooth Training
� oder
97