DLHLP - HW4-1
BERT
TA: 紀伯翰,謝濬丞
Task(s)
BERT - NLI
Text Entailment
Homework Task
Ground Truth: Entailment
4-1-1 (5%) Natural Language Inference - (1)
Contextualized v.s static
圖片來源:
Example - (1)
圖片來源:
Example - (2)
圖片來源:
How to measure the Contextuality ?
4-1-2 Definition(s)
Self-similarity
圖片來源:
Intra-sentence similarity
圖片來源:
If more Contextualized on vector space,
Expect:
Issue ?
圖片來源:
Isotropy vs Anisotropy
圖片來源:
Isotropy vs Anisotropy
Self-Similarity(w) = 0.95 is relatively high if all embeddings are isotropic.
Self-Similarity(w) = 0.95 is relatively high if all embeddings are isotropic but relatively low if they are anisotropic.
Prepare Data
extract embedding vector of each word on each layer.
extract embedding vector of each word on each layer.
Warning
在接下來,我們要畫的圖裡面,會畫出 BERT 內 從 第 0 層 到 第 12 層的 intra-sentence similarity 以及 anisotropy 還有 self-similarity 這三個 數值, 要注意的一點是 所謂的 第0層 指的就是 前面 BERT 圖示的 token embedding 的 vector,並沒有加上 positional embedding 以及 segment embedding (token type embedding),如果你是使用助教這份github的話,我在 這份 github的 transformers/model_bert.py 內已有做修改,在第0層的時候是會吐出embedding matrix那一層的embedding,line 375,但你如果是自己做的話,記得要去修正這一點。
4-1-2 Extract each layer Embedding(s) - (2)
Anisotropy
(每一層都要) 作為那一層的 anisotropy.
Implementation
Hint: similarity_student.py - finish todo block!
(5%) Implementation -Anisotropy
Plot the Anisotropy:
Self-similarity, Intra-sentence similarity(Anisotropy)
Self-similarity
每一層 對同一個 word 不同 context 兩兩做 cosine-similarity,並取平均
即為 該層的 self-similarity
(5%)
Implementation - Self Similarity
Intra-sentence similarity
每一層,同一個句子,把句子內的字的embedding 取平均,即為該句子的 sentence embedding,並把句子內的每一個字對這句話的sentence embedding算cosine similarity ,再取平均即為一筆 intra-sentence similarity,算出所有句子的 intra-sentence similarity 再取平均,即為該層的 intra-sentence similarity.
(5%)
Implementation - Intra sentence similarity
(10%) Adjusting for Anisotropy
Self-similarity
Intra-sentence similarity
Adjust Version:
Bonus: Maximum explainable variance (MEV)
PCA (Principal Component Analysis)
Chinese Characters & Words
Characters: 漢字,中文的基本組成單位。e.g. 揶、揄...
Words: 詞彙,中文裡表達意思的最小單位。e.g. 家、國、鍋、揶揄...
Chinese Word Segmentation (CWS)
我一直是在親自指揮,親自部署。
我 一直 是 在 親自 指揮 , 親自 部署 。
Task
As a sequence labeling task
Prepare data
Transition Diagram
B, M, E, S,
B
ME
S
Github submission
Report
report 連結 請一併放到 YOUR_REPO/hw4 命名為 report.pdf 一併繳交
Deadline
2020.5.27 9:00