DEEP LEARNING JP
[DL Papers]
LLMの評価について
Keno Harada, D1, the University of Tokyo
http://deeplearning.jp/
大規模言語モデル講座が開講します
2
よく見るleaderboard, 何を評価している?
3
From: Chatbot Arena
From: Open LLM Leaderboard
日本語ベンチマークJGLUE
4
実際に解いてみよう
https://docs.google.com/forms/d/e/1FAIpQLSc2YtM_ItuZwqmIHmKdSW88cFf_Z_w2Myom68mhZKowChrbcA/viewform
自由記述の問題はChatGPT使わずに答えてください🙏
5
LLMの評価について
6
7
Perplexity 次単語予測の性能
8
学習中眺めるもの
9
10
11
12
Can we include learned components in our evaluation metrics?
22
How do we evaluate open-ended text generation?
23
25
26
実際に出たヤバイ例は元論文Table17へ
27
28
29
30
31
DEEP LEARNING JP
[DL Papers]
SCIBENCH: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models
Keno Harada, D1, the University of Tokyo
http://deeplearning.jp/
新しいベンチマーク SCIBENCHの提案
33
SCIBENCHでの評価と発見
34
35
DEEP LEARNING JP
[DL Papers]
Judging LLM-as-a-judge with MT-Bench and Chatbot Arena
Keno Harada, D1, the University of Tokyo
http://deeplearning.jp/
MT-BenchとChatbot Arenaの提案, LLMによる評価の分析
37
MT-Benchの例
38
既存のベンチマーク
39
LLM-as-a-Judge
40
Pairwise comparison
41
Single answer grading
42
Reference-guided grading
43
Position bias
44
Verbosity bias
45
Self-enhancement bias
46
Limited capability in grading math and reasoning questions
47
対応策
48
High agreement between GPT-4 and humans
49
RLHF: Reward Modeling
50