Analisis Regresi
Tingkat Lanjut
Section 1 — Konsep dan Teori Analisis Regresi Tingkat Lanjut
44 slide • definisi • formulasi • contoh aplikasi • diagnostik
Benang merah section
I Gede Nyoman Mindra Jaya
S2 Statistika Terapan FMIPA Unpad
Peta Pembelajaran Section 1
SECTION 1
2
• Mulai dari regresi sebagai model distribusi kondisional, bukan sekadar garis terbaik.�• Bangun model linear dalam notasi skalar dan matriks.�• Masuk ke OLS, WLS, GLS, robust SE, dan diagnostik.�• Tutup dengan studi kasus, validasi silang, dan korelasi AR(1).
Peta besar
Contoh aplikasi
Alur kuliah: konsep → rumus → kasus → keputusan analitis.
Model
Estimasi
Diagnostik
Prediksi
Regresi yang baik itu bukan cuma “p-value menang”; ia juga lolos akal sehat diagnostik.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
02
Capaian Pembelajaran
SECTION 1
3
• Menjelaskan perbedaan korelasi, regresi, asosiasi, dan inferensi kondisional.�• Menurunkan estimator OLS dan membaca makna geometrinya.�• Memilih OLS, WLS, GLS, atau robust SE sesuai struktur error.�• Mendiagnosis multikolinearitas, outlier, leverage, dan influential points.
Kompetensi utama
Contoh aplikasi
Di akhir section, mahasiswa harus bisa menjawab: “model ini boleh dipercaya untuk apa?”
Targetnya bukan hafal rumus, tetapi tahu kapan rumus itu sah dipakai.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
03
Regresi vs Korelasi
SECTION 1
4
• Korelasi mengukur kekuatan asosiasi linear simetris antara dua variabel.�• Regresi memodelkan respons Y secara kondisional terhadap prediktor X.�• Korelasi tidak membedakan variabel respons dan prediktor; regresi membedakannya.�• Regresi dapat memasukkan kovariat, interaksi, nonlinearitas, dan struktur error.
Korelasi Pearson
Contoh aplikasi
Contoh: korelasi berat kendaraan–konsumsi BBM memberi asosiasi; regresi memperkirakan rata-rata konsumsi setelah mengontrol horsepower.
Regresi menjawab pertanyaan kondisional; korelasi hanya memberi ringkasan asosiasi.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
04
Distribusi Kondisional: Inti Regresi Modern
SECTION 1
5
• Regresi linear klasik fokus pada mean kondisional E(Y|X).�• Regresi kuantil fokus pada Qτ(Y|X), misalnya median atau kuantil tinggi.�• Model probabilistik penuh memodelkan seluruh distribusi Y|X.�• Pemilihan target bergantung pada pertanyaan ilmiah: rata-rata, risiko ekstrem, atau distribusi penuh.
Target regresi
Contoh aplikasi
Aplikasi lingkungan: PM2.5 bisa dimodelkan pada rata-rata harian atau probabilitas melampaui ambang.
Pertanyaan analitis menentukan bagian distribusi yang dimodelkan.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
05
Fungsi Regresi Populasi dan Sampel
SECTION 1
6
• Population regression function adalah hubungan target di populasi.�• Sample regression function adalah estimasi berdasarkan data yang tersedia.�• Perbedaan keduanya adalah sumber ketidakpastian statistik.�• Inferensi diperlukan karena model sampel hanya salah satu realisasi dari proses data.
Populasi vs sampel
Contoh aplikasi
Dalam survei rumah tangga, model dari sampel harus merepresentasikan pola populasi, bukan hanya pola responden.
Model sampel harus selalu dibaca bersama uncertainty-nya.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
06
Model Regresi Linear: Skalar
SECTION 1
7
• Linear berarti linear terhadap parameter β, bukan harus linear mentah terhadap x.�• Prediktor dapat berupa transformasi, polinomial, interaksi, atau basis spline.�• Error menangkap bagian respons yang tidak dijelaskan oleh mean model.�• Interpretasi β bergantung pada satuan variabel dan variabel lain yang dikontrol.
Model skalar
Contoh aplikasi
Contoh: mpg = β0 + β1 weight + β2 horsepower + ε untuk mengevaluasi efisiensi kendaraan.
Linear model itu fleksibel; yang linear adalah parameternya, bukan selalu kurvanya.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
07
Model Regresi Linear: Matriks
SECTION 1
8
• Vektor y berukuran n×1, matriks desain X berukuran n×p.�• Kolom pertama X biasanya berisi 1 untuk intersep.�• Koefisien β berukuran p×1; error ε berukuran n×1.�• Notasi matriks membuat estimator, varian, dan proyeksi jauh lebih ringkas.
Notasi dasar
Contoh aplikasi
Dalam R: lm(y ~ x1 + x2) secara implisit membentuk X dengan kolom intersep.
Notasi matriks adalah “GPS” regresi: tanpa itu, kita cepat nyasar di rumus.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
08
OLS: Fungsi Tujuan
SECTION 1
9
• Ordinary Least Squares memilih β yang meminimalkan jumlah kuadrat residu.�• Residu adalah selisih aktual dengan fitted value.�• Kuadrat memberi penalti lebih besar pada error besar.�• OLS optimal di bawah asumsi klasik tertentu, tetapi sensitif terhadap outlier ekstrem.
Least squares
Contoh aplikasi
Aplikasi: menaksir perubahan rata-rata nilai ujian terhadap jam belajar dan frekuensi latihan.
OLS bukan “selalu terbaik”; ia terbaik dalam dunia asumsi yang tepat.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
09
Normal Equation
SECTION 1
10
• Turunan fungsi tujuan terhadap β disamakan dengan nol.�• Hasilnya adalah persamaan normal Xᵀe = 0.�• Persamaan ini berarti residu ortogonal terhadap setiap kolom X.�• Jika XᵀX nonsingular, solusi OLS unik.
Fungsi tujuan
Turunan pertama
Normal equation
Normal equation adalah jantung aljabar OLS.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
10
Estimator OLS dan Fitted Value
SECTION 1
11
• Estimator eksplisit diperoleh bila XᵀX dapat diinvers.�• Fitted value adalah proyeksi y ke ruang kolom X.�• Residu adalah komponen y yang tidak dapat dijelaskan oleh X.�• Semua inferensi linear klasik dibangun dari estimator dan residual variance.
Solusi OLS
Contoh aplikasi
Aplikasi: pada model harga rumah, fitted value adalah estimasi harga rata-rata untuk karakteristik tertentu.
Estimator rapi di papan tulis; kualitasnya tetap bergantung pada desain dan asumsi.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
11
Geometri Proyeksi
SECTION 1
12
• Ruang kolom X berisi semua kombinasi linear prediktor.�• OLS mencari titik pada ruang kolom X yang paling dekat dengan y.�• Fitted vector berada di ruang kolom X; residual vector tegak lurus ruang tersebut.�• Geometri ini menjelaskan hat matrix dan leverage.
Decomposition
Contoh aplikasi
Aplikasi: saat semua prediktor kurang informatif, proyeksi tidak banyak mendekati y sehingga residual besar.
y
ŷ
e
OLS adalah proyeksi ortogonal, bukan sekadar “tarik garis manual”.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
12
Hat Matrix dan Leverage
SECTION 1
13
• Hat matrix H memetakan y menjadi fitted value ŷ.�• Diagonal hᵢᵢ mengukur posisi observasi dalam ruang prediktor.�• Leverage tinggi berarti kombinasi X observasi jauh dari pusat desain.�• Leverage bukan outlier respons; ia konsep pada ruang prediktor.
Hat matrix
Contoh aplikasi
Pada data kendaraan, mobil sangat berat dengan horsepower ekstrem dapat punya leverage tinggi meski residual kecil.
Leverage menjawab: “titik ini punya posisi X yang seberapa berkuasa?”
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
13
Residual dan Ortogonalitas
SECTION 1
14
• Residual vector adalah e = y − ŷ.�• Matriks residual maker M = I − H.�• OLS memastikan Xᵀe = 0 ketika ada intersep dan model terestimasi penuh.�• Akibatnya, rata-rata residual nol bila model memuat intersep.
Residual maker
Contoh aplikasi
Aplikasi diagnostik: pola residual terhadap fitted value menandakan mean model belum cukup.
Residual bukan sampah; justru di sana masalah model sering berteriak pelan.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
14
Asumsi Klasik dan Gauss–Markov
SECTION 1
15
• Mean error nol: E(ε|X)=0.�• Tidak ada multikolinearitas sempurna: rank(X)=p.�• Homoskedastisitas dan tidak berkorelasi: Var(ε|X)=σ²I.�• Di bawah asumsi ini, OLS adalah BLUE: best linear unbiased estimator.
Asumsi utama
Contoh aplikasi
Untuk eksperimen terkontrol, asumsi exogeneity lebih masuk akal daripada data observasional dengan confounding kuat.
BLUE bukan berarti “paling benar”; artinya paling efisien dalam kelas estimator linear tak bias.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
15
Inferensi Koefisien
SECTION 1
16
• Koefisien diuji melalui rasio estimasi terhadap standard error.�• Statistik t klasik memakai estimasi σ² dari residual sum of squares.�• Confidence interval memberi rentang nilai parameter yang kompatibel dengan data.�• P-value harus dibaca bersama efek, satuan, dan asumsi model.
Uji dan interval
Contoh aplikasi
Aplikasi kesehatan: interpretasi β sebagai perubahan rata-rata biomarker setelah kontrol umur dan jenis kelamin.
Signifikan itu bukan sinonim dari penting; efek kecil bisa sangat signifikan pada n besar.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
16
Varians–Kovarians Estimator
SECTION 1
17
• Presisi koefisien dipengaruhi oleh noise σ² dan geometri XᵀX.�• Prediktor yang hampir redundan membuat diagonal inverse membesar.�• Standard error besar berarti estimasi koefisien kurang presisi.�• Desain data yang baik sering lebih penting daripada algoritma yang lebih “wah”.
Presisi OLS
Contoh aplikasi
Contoh: income dan expenditure yang sangat berkorelasi dapat membuat masing-masing koefisien tidak stabil.
Ketidakpastian koefisien adalah cerita tentang noise dan geometri desain.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
17
Sifat Asimtotik
SECTION 1
18
• Konsistensi berarti estimator mendekati parameter saat n membesar.�• Normalitas asimtotik mendukung uji Wald dan interval kepercayaan sampel besar.�• Asimtotik butuh regularity conditions: exogeneity, moment finite, dan desain stabil.�• Sampel besar tidak memperbaiki spesifikasi model yang salah berat.
Distribusi limit
Contoh aplikasi
Pada data big data observasional, bias kecil akibat confounding bisa tetap dominan meski n sangat besar.
n besar membantu variance; bias spesifikasi tetap bandel. Statistik juga punya keras kepala.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
18
Prediksi dan Uncertainty
SECTION 1
19
• Mean prediction memperkirakan E(Y*|x*).�• Prediction interval lebih lebar karena memasukkan noise observasi baru.�• Confidence interval untuk mean tidak sama dengan prediction interval untuk individu.�• Kesalahan umum: melaporkan fitted value tanpa ketidakpastian.
Mean prediction
Contoh aplikasi
Aplikasi: memprediksi konsumsi BBM rata-rata mobil tipe tertentu berbeda dari memprediksi konsumsi satu mobil spesifik.
Prediksi yang bertanggung jawab selalu datang dengan interval.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
19
Heteroskedastisitas: Mengapa Perlu WLS/Robust?
SECTION 1
20
• Heteroskedastisitas terjadi ketika varians error berubah menurut X atau kelompok.�• Koefisien OLS dapat tetap tak bias jika mean model benar dan exogeneity berlaku.�• Namun standard error klasik menjadi salah sehingga inferensi menyesatkan.�• Solusi: WLS bila struktur varians diketahui; robust SE bila ingin koreksi kovarians.
Error variance
Contoh aplikasi
Contoh pendapatan: varians pengeluaran biasanya lebih besar pada rumah tangga berpendapatan tinggi.
Masalah heteroskedastisitas sering bukan di koefisien, tetapi di confidence yang terlalu pede.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
20
Weighted Least Squares
SECTION 1
21
• WLS memberi bobot lebih besar pada observasi yang lebih presisi.�• Jika Var(εᵢ)=σ²/wᵢ, bobot ideal proporsional terhadap inverse variance.�• WLS dapat dipahami sebagai OLS pada data yang sudah ditransformasi.�• Bobot yang salah dapat memperburuk efisiensi atau interpretasi.
Estimator WLS
Contoh aplikasi
Dalam meta-analisis, studi dengan standard error lebih kecil diberi bobot lebih besar.
WLS bukan “kasih bobot sesuka hati”; bobot harus punya alasan statistik.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
21
Generalized Least Squares
SECTION 1
22
• GLS mengizinkan covariance error tidak diagonal.�• Cocok untuk serial correlation, repeated measures, atau struktur kelompok.�• Jika Ω diketahui benar, GLS lebih efisien daripada OLS.�• Transformasi Ω⁻¹/² membuat error baru berkorelasi nol dan homogen.
Estimator GLS
Contoh aplikasi
Pada data time series ekonomi, shock bulan ini sering berkorelasi dengan bulan sebelumnya.
WLS adalah GLS versi diagonal; GLS adalah “WLS yang punya memori korelasi”.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
22
Feasible GLS: Ketika Ω Tidak Diketahui
SECTION 1
23
• Dalam praktik, Ω jarang diketahui.�• Feasible GLS mengestimasi struktur covariance dari residual atau model tambahan.�• Tahap umum: OLS awal → estimasi Ω → GLS dengan Ω̂.�• Validitas FGLS bergantung pada spesifikasi model covariance.
Estimator FGLS
Contoh aplikasi
Contoh: estimasi model AR(1) residual lalu gunakan nlme::gls(correlation = corAR1()).
OLS awal
Ω̂
GLS
FGLS bagus ketika struktur error masuk akal; berbahaya kalau Ω̂ hanya kosmetik.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
23
Robust Standard Errors: White Sandwich
SECTION 1
24
• Robust SE mempertahankan koefisien OLS tetapi mengganti matriks kovarians.�• Cocok ketika mean model benar tetapi varians error tidak homogen.�• Disebut sandwich karena “bread–meat–bread”.�• Tidak menyembuhkan endogeneity, omitted variables, atau nonlinear mean yang salah.
HC0 sandwich
Contoh aplikasi
Dalam laporan empiris, tulis eksplisit: koefisien OLS dengan heteroskedasticity-consistent SE.
Robust SE itu helm, bukan mesin baru: melindungi inferensi, bukan mengganti model.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
24
HC0–HC3: Koreksi Robust SE
SECTION 1
25
• HC0 adalah estimator sandwich dasar.�• HC1 memberi koreksi derajat bebas.�• HC2 dan HC3 mengoreksi leverage melalui hᵢᵢ.�• HC3 sering lebih stabil pada sampel kecil–sedang.
Dasar
Koreksi df
Koreksi leverage
Semakin besar leverage, semakin penting koreksi HC2/HC3.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
25
Multikolinearitas: Definisi dan Dampak
SECTION 1
26
• Multikolinearitas berarti prediktor saling berkorelasi kuat atau redundan.�• Tidak membuat OLS otomatis bias.�• Dampak utama: standard error membesar dan koefisien tidak stabil.�• R² prediktif bisa tetap tinggi meski koefisien individual sulit ditafsirkan.
Redundansi prediktor
Contoh aplikasi
Dalam data sosial ekonomi, pendidikan, pendapatan, dan jenis pekerjaan sering membawa informasi yang tumpang tindih.
Masalahnya bukan selalu prediksi; sering kali interpretasi koefisien yang goyang.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
26
Variance Inflation Factor
SECTION 1
27
• VIF mengukur kenaikan varians β̂ⱼ akibat korelasi xⱼ dengan prediktor lain.�• Rⱼ² diperoleh dari regresi xⱼ terhadap semua prediktor lain.�• VIF = 1 berarti tidak ada inflasi dari prediktor lain.�• Ambang 5 atau 10 hanya rule-of-thumb; konteks substantif tetap penting.
VIF
Contoh aplikasi
Jika VIF horsepower tinggi karena berkorelasi dengan displacement, interpretasi masing-masing efek perlu hati-hati.
VIF tinggi bukan tombol “hapus variabel”; itu alarm untuk berpikir.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
27
Condition Number dan Eigenvalue
SECTION 1
28
• Condition number membaca stabilitas numerik matriks desain.�• Nilai tinggi menunjukkan arah dalam ruang prediktor yang hampir tidak teridentifikasi.�• Eigenvalue kecil pada XᵀX membuat inverse sangat besar.�• Standardisasi prediktor membantu interpretasi condition number.
Condition number
Contoh aplikasi
Pada regresi dengan banyak variabel skala berbeda, standardisasi sebelum diagnostik sangat membantu.
VIF melihat per variabel; condition number melihat kesehatan geometri desain secara global.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
28
Diagnostik Residual
SECTION 1
29
• Residual-versus-fitted memeriksa pola mean dan varians.�• QQ-plot memeriksa bentuk distribusi residual, terutama ekor.�• Scale-location plot membantu melihat heteroskedastisitas.�• Diagnostik adalah proses membaca pola, bukan ritual klik plot empat panel.
Residual standar
Contoh aplikasi
Jika residual membentuk kurva U terhadap fitted value, mean model mungkin membutuhkan transformasi atau spline.
Plot residual adalah pemeriksaan kesehatan model. Kadang hasilnya bikin model batuk-batuk.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
29
Outlier, Leverage, dan Influence
SECTION 1
30
• Outlier: respons tidak biasa relatif terhadap model.�• High leverage: kombinasi prediktor tidak biasa.�• Influential point: observasi yang mengubah estimasi secara material.�• Satu observasi bisa punya satu, dua, atau ketiganya.
Tiga konsep
Contoh aplikasi
Titik jauh di X tetapi tepat mengikuti garis dapat high leverage namun residual kecil.
Outlier
Leverage
Influence
Jangan samakan semua titik ekstrem; diagnosisnya beda, tindakannya juga beda.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
30
Studentized Residual
SECTION 1
31
• Standardized residual memakai estimasi σ dari semua data.�• Studentized deleted residual mengevaluasi residual saat observasi i dikeluarkan.�• Residual besar menunjukkan respons tidak sesuai pola model.�• Gunakan bersama leverage dan Cook’s distance agar tidak salah diagnosis.
Deleted residual
Contoh aplikasi
Pada analisis nilai ujian, satu mahasiswa dengan skor ekstrem bisa outlier tanpa leverage jika prediktornya normal.
Residual besar menjawab: “Y-nya aneh setelah kita tahu X-nya?”
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
31
Cook’s Distance, DFFITS, dan DFBETAS
SECTION 1
32
• Cook’s distance mengukur perubahan fitted values bila observasi i dihapus.�• DFFITS fokus pada perubahan prediksi titik i.�• DFBETAS fokus pada perubahan masing-masing koefisien.�• Observasi influential harus diperiksa, bukan otomatis dibuang.
Influence metrics
Contoh aplikasi
Dalam data ekonomi regional, satu provinsi ekstrem dapat mengubah slope nasional secara kuat.
Influential point adalah “aktor utama” model; boleh tampil, tapi harus diaudit.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
32
Bias–Variance Trade-off
SECTION 1
33
• Model terlalu sederhana cenderung bias tinggi.�• Model terlalu fleksibel cenderung variance tinggi.�• Generalization error menggabungkan bias, variance, dan noise irreducible.�• Regularisasi memperkenalkan bias untuk menurunkan variance.
Decomposition
Contoh aplikasi
Model polinomial derajat tinggi bisa sangat pas pada training tetapi buruk untuk data baru.
Model terbaik bukan yang paling pintar di kelas latihan, tapi yang tidak panik saat ujian data baru.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
33
Regularisasi: Preview Ridge, Lasso, Elastic Net
SECTION 1
34
• Ridge mengecilkan koefisien melalui penalti L2.�• Lasso dapat mengecilkan sebagian koefisien tepat menjadi nol.�• Elastic Net menggabungkan L1 dan L2.�• Section ini hanya preview; pembahasan mendalam ada pada regularisasi.
Penalized least squares
Contoh aplikasi
Dalam prediksi dengan banyak kovariat berkorelasi, ridge sering stabil; lasso berguna untuk seleksi variabel.
Regularisasi adalah “rem tangan” agar model fleksibel tidak kebablasan.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
34
Nonlinearitas dengan Ekspansi Basis
SECTION 1
35
• Hubungan nonlinear dapat tetap ditulis linear terhadap parameter.�• Ganti x dengan kumpulan basis b₁(x),…,bK(x).�• Koefisien tetap diestimasi dengan kerangka linear model.�• Fleksibilitas dikontrol oleh jumlah basis atau derajat kebebasan efektif.
Basis expansion
Contoh aplikasi
Contoh: hubungan berat kendaraan dan mpg mungkin melengkung, bukan turun linear sempurna.
Nonlinear terhadap x tidak otomatis berarti nonlinear terhadap parameter.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
35
Spline: Fleksibel tetapi Terkontrol
SECTION 1
36
• Spline membagi rentang x menjadi potongan yang tersambung halus.�• Knot menentukan titik perubahan fleksibilitas lokal.�• Natural cubic spline memaksa perilaku linear di ekor sehingga lebih stabil.�• Validasi diperlukan untuk memilih kompleksitas yang tidak overfit.
Cubic spline
Contoh aplikasi
Aplikasi epidemiologi: efek umur terhadap risiko penyakit sering tidak linear dan cocok dimodelkan dengan spline.
Spline adalah jalan tengah: fleksibel, tapi tidak liar seperti polinomial global tinggi.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
36
Validasi Silang K-fold
SECTION 1
37
• Data dibagi menjadi K fold.�• Model dilatih pada K−1 fold dan diuji pada fold tersisa.�• Rata-rata error validasi memperkirakan performa out-of-sample.�• Gunakan untuk membandingkan linear, polinomial, spline, atau model regularisasi.
K-fold CV
Contoh aplikasi
Pada studi kasus mtcars, bandingkan RMSE OLS linear versus spline wt menggunakan K-fold CV.
Testing set bukan tempat “ngintip berkali-kali”; CV membantu lebih disiplin.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
37
Studi Kasus 1: mtcars — Alur Analisis
SECTION 1
38
• Definisikan respons, prediktor, dan unit observasi.�• Eksplorasi hubungan bivariat sebelum fitting.�• Estimasi OLS dan baca koefisien bersama satuan.�• Lanjutkan dengan diagnostik, robust SE, VIF, dan validasi.
Model awal
Contoh aplikasi
Pertanyaan: bagaimana berat, horsepower, dan displacement menjelaskan konsumsi bahan bakar?
EDA
OLS
Diagnostik
CV
Studi kasus yang baik punya workflow; bukan langsung lompat ke p-value seperti ninja statistik.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
38
Interpretasi Koefisien OLS pada mtcars
SECTION 1
39
• Koefisien wt: perubahan rata-rata mpg untuk kenaikan 1 unit wt, kovariat lain tetap.�• Koefisien hp dan disp harus dibaca dalam konteks korelasi antar mesin.�• Adjusted R² membantu penalti jumlah prediktor, tetapi bukan validasi out-of-sample.�• Confidence interval lebih informatif daripada hanya p-value.
Persamaan fitted
Contoh aplikasi
Jika β̂wt negatif, mobil lebih berat diasosiasikan dengan mpg lebih rendah setelah kontrol hp dan disp.
Interpretasi selalu bersyarat: “ketika kovariat lain tetap.” Itu frasa sakral regresi.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
39
Diagnostik dan Robust SE pada mtcars
SECTION 1
40
• Residual plot memeriksa nonlinearitas dan heteroskedastisitas.�• QQ-plot memeriksa apakah ekor residual ekstrem.�• VIF memeriksa redundansi wt, hp, disp.�• Bandingkan SE klasik dan HC3 untuk melihat sensitivitas inferensi.
R implementation
Contoh aplikasi
Jika signifikansi berubah dari klasik ke HC3, laporkan bahwa kesimpulan sensitif terhadap covariance estimator.
Robust SE adalah laporan kejujuran: “ketidakpastian saya mungkin lebih besar.”
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
40
Studi Kasus 2: Simulasi Heteroskedastisitas
SECTION 1
41
• Buat data dengan varians error meningkat terhadap X.�• Bandingkan OLS klasik, OLS+robust SE, dan WLS.�• Amati perubahan standard error dan interval.�• Simulasi membantu mahasiswa melihat akibat asumsi dilanggar.
Data generating process
Contoh aplikasi
Contoh praktikum: bangkitkan x uniform, error dengan sd proporsional x, lalu estimasi tiga pendekatan.
OLS
Robust SE
WLS
Simulasi itu laboratorium kecil: asumsi bisa kita rusak dengan elegan.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
41
GLS dengan Korelasi AR(1)
SECTION 1
42
• AR(1) berarti error saat ini berkorelasi dengan error sebelumnya.�• Pola ini umum pada data runtun waktu atau pengukuran berurutan.�• OLS koefisien bisa tetap konsisten dalam kondisi tertentu, tetapi SE klasik salah.�• GLS memasukkan struktur covariance serial correlation.
AR(1) covariance
Contoh aplikasi
Aplikasi: data inflasi bulanan, kualitas udara harian, atau indeks ekonomi mingguan.
Jika residual punya memori, model juga harus punya cara mengingat.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
42
Cochrane–Orcutt: Quasi-differencing
SECTION 1
43
• Cochrane–Orcutt mentransformasi model agar error AR(1) menjadi white noise.�• ρ biasanya diestimasi dari residual awal.�• Observasi pertama sering hilang atau diperlakukan khusus.�• Metode ini memberi intuisi manual untuk GLS serial correlation.
Transformasi AR(1)
Contoh aplikasi
Praktikum: estimasi OLS awal, hitung residual, estimasi ρ, transformasi data, lalu fitting ulang.
Quasi-differencing itu seperti mengurangi gema dari data time series.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
43
Penutup dan Latihan Section 1
SECTION 1
44
• Checklist model: tujuan, mean structure, covariance structure, diagnostik, validasi.�• Latihan 1: turunkan normal equation OLS dari RSS.�• Latihan 2: jelaskan bedanya outlier, leverage, dan influence dengan contoh.�• Latihan 3: analisis mtcars lengkap dengan OLS, VIF, HC3, dan K-fold CV.
Ringkasan akhir
Contoh aplikasi
Tugas akhir section: buat laporan 3–4 halaman dengan formula, output R, interpretasi, dan keputusan model.
Model yang baik tidak hanya fit; ia bisa dipertanggungjawabkan.
Analisis Regresi Tingkat Lanjut • S2 Statistika Terapan FMIPA Unpad
44