1 of 15

PHÂN TÍCH VÀ THIẾT KẾ THUẬT TOÁN NÂNG CAO

Giảng viên: TS. Phan Anh Cang

Học viên: Lưu Vĩnh Phúc

Mã số: 22904010

ĐẠI HỌC SƯ PHẠM KỸ THUẬT VĨNH LONG

2022

Machine Learning - Linear Regression

2 of 15

Nội dung

Machine Learning

Linear Regression

Loss function

Training

Demo

Gradient Descent

3 of 15

Machine Learning

  • Machine learning is the subfield of computer science that “gives computers the ability to learn without being explicitly programmed” (Wikipedia)

1

4 of 15

Machine Learning

2

  • Hàm ánh xạ (mapping function):

f : x y

x: dữ liệu (data), kinh nghiệm đã có� y: dự đoán, tri thức mới, kinh nghiệm mới,…

5 of 15

Supervised Learning

4

MNIST: bộ cơ sở dữ liệu của chữ số viết tay

6 of 15

Supervised Learning

4

  • Classification (Phân loại): Một bài toán được gọi là classification nếu các label của input data được chia thành một số hữu hạn nhóm.

Ví dụ: Gmail xác định xem một email có phải là spam hay không; các hãng tín dụng xác định xem một khách hàng có khả năng thanh toán nợ hay không.

7 of 15

Supervised Learning

5

  • Regression (Hồi quy): Nếu label không được chia thành các nhóm mà là một giá trị thực cụ thể.

Ví dụ: một căn nhà rộng x m2 , có y phòng ngủ và cách trung tâm thành phố z km sẽ có giá là bao nhiêu?

8 of 15

Supervised Learning

6

9 of 15

Linear Regression

7

  • Regression problem: học một hàm y = f(x), từ tập dữ liệu D = {(x1, y1), (x2, y2), …, (xM, yM)}, sao cho yi ≈ f(xi).
  • Linear model: f(x) tuyến tính được biểu diễn� f(x) = w0 + w1x1 + … + wnxn
        • w0, w1, …, wn được gọi là hệ số hồi quy/trọng số (coefficients/weights), w0 còn được gọi là “bias”.

10 of 15

Linear Regression

8

Hàm nào là tốt nhất?

Chiều cao (cm)

Cân nặng (kg)

147

49

150

50

155

52

Bài toán đặt ra là: liệu có thể dự đoán cân nặng của một người dựa vào chiều cao của họ không?

11 of 15

Loss function

9

  • MSE (measures squared error): đo sự sai khác bằng cách lấy trung bình của bình phương giữa giá trị dự đoán và giá trị thực tế.

VD: y = mx + b

 

  • Mục tiêu là tối thiểu MSE để tăng độ chính xác hiện tại.

12 of 15

Gradient Descent

10

min

-

+

 

13 of 15

Training

11

  • Training: là quá trình lặp đi lặp lại cải thiện phương trình dự đoán của bạn bằng cách lặp qua tập dữ liệu nhiều lần.
  • Update lại weight và bias với Gradient descent.
  • Việc training kết thúc khi đạt đến ngưỡng lỗi chấp nhận được hoặc những lần lặp tiếp theo không thể giảm thêm chi phí.

14 of 15

Linear Regression

13

Ưu điểm

Nhược điểm:

  • Mô hình đơn giản, dễ hiểu

  • Dễ diễn giải hệ số hồi quy

  • Nhận được kết quả tốt khi dữ liệu quan sát nhỏ

  • Nhiều cải tiến/mở rộng
  • Mô hình hơi đơn giản nên khó dự đoán chính xác với dữ liệu có miền giá trị rộng

  • Khả năng ngoại suy (extrapolation) kém

  • Nhạy cảm với dữ liệu ngoại lai (outliers) – do dùng phương pháp bình phương nhỏ nhất

15 of 15

Cảm ơn thầy và các anh chị đã lắng nghe!