ANALISIS REGRESI
TINGKAT LANJUT
Model • Estimasi • Diagnostik • Regularisasi • Bayesian • Desain Sampling
I Gede Nyoman Mindra Jaya
1 September 2026
BENANG MERAH
S2 STATISTIKA TERAPAN FMIPA �UNIVERSITAS PADJADJARAN
Analisis Regresi Tingkat Lanjut
Peta Materi
Advanced Regression
Peta Materi: dari OLS sampai Desain Sampling
Setiap topik diarahkan pada keputusan pemodelan yang tepat, bukan sekadar “menjalankan fungsi R”.
1
Linear
Regression
2
Nonlinear
Regression
3
Robust
Regression
4
Regularisasi
& Ensemble
5
Bayesian
Regression
6
Sampling
Design
Inti kuliah: pilih model berdasarkan struktur data, asumsi, tujuan inferensi/prediksi, dan desain pengambilan sampel.
01
Konsep & Teori Regresi Linear
OLS sebagai titik awal: geometri, varians, diagnostik, dan generalisasi ke WLS/GLS.
S2 STATISTIKA TERAPAN FMIPA �UNIVERSITAS PADJADJARAN
Analisis Regresi Tingkat Lanjut
1 • Regresi Linear
Advanced Regression
Regresi ≠ Korelasi: arah pertanyaan berbeda
Korelasi mengukur asosiasi simetris; regresi memodelkan respons kondisional.
Regresi menjawab bagaimana distribusi respons berubah ketika prediktor berubah.
Korelasi tidak membedakan variabel respons dan prediktor.
Interpretasi koefisien memerlukan asumsi model dan konteks substantif.
REGRESI SEDERHANA
KORELASI PEARSON
Contoh hubungan mpg–wt pada data mtcars
Humor tipis: korelasi itu seperti melihat dua orang sering datang bareng; regresi bertanya, siapa yang benar-benar “menyetir” perubahan respons?
1 • Regresi Linear
Advanced Regression
Model Linear: struktur mean dan error
Bentuk matriks membuat asumsi, estimator, dan varian menjadi transparan.
MODEL GAUSS–MARKOV
ESTIMATOR OLS
Linearitas terhadap parameter, bukan selalu harus garis lurus terhadap x.
Eksogenitas: error tidak sistematis terhadap prediktor.
Homoskedastisitas dan independensi menjadi dasar SE klasik.
OLS adalah “baseline model”: mudah dijelaskan, cepat dihitung, tetapi sensitif terhadap asumsi yang dilanggar.
1 • OLS & Geometri
Advanced Regression
OLS sebagai proyeksi ke ruang kolom X
Prediksi OLS adalah bayangan vektor y pada ruang yang dibentang oleh prediktor.
HAT MATRIX
LEVERAGE
Nilai fitted adalah kombinasi linear dari observasi.
Leverage tinggi berarti posisi X observasi relatif ekstrem.
Observasi berpengaruh besar biasanya menggabungkan leverage tinggi dan residu besar.
Cook’s distance sebagai indikator pengaruh
1 • Inferensi OLS
Advanced Regression
Varians koefisien: bukan hanya soal σ²
Kolom X yang tidak informatif atau saling berkorelasi membuat estimasi tidak presisi.
VARIAN KLASIK
ASIMTOTIK
Presisi dipengaruhi oleh noise dan geometri desain.
Multikolinearitas memperbesar elemen diagonal invers matriks.
Asimtotik tidak menyelamatkan spesifikasi yang keliru.
Kalau X “kurang cerita”, β juga bicara pelan. Standard error naik, keyakinan turun.
1 • WLS & GLS
Advanced Regression
WLS dan GLS: ketika error tidak lagi sederhana
Gunakan bobot/korelasi error sebagai bagian dari model, bukan tambalan kosmetik.
WEIGHTED LS
GENERALIZED LS
WLS: cocok saat varians berbeda tetapi struktur bobot dapat diperkirakan.
GLS: cocok saat terdapat korelasi antarobservasi, misalnya serial correlation.
Keduanya setara dengan OLS pada data yang sudah ditransformasi.
Simulasi heteroskedastisitas: pola residu membesar
1 • Robust SE
Advanced Regression
White Sandwich SE: koefisien tetap, SE diperbaiki
Jika mean model dipercaya tetapi ragam error tidak homogen, robust SE sering menjadi pilihan praktis.
SANDWICH ESTIMATOR
Memperbaiki inferensi ketika homoskedastisitas gagal.
Tidak memperbaiki bias akibat omitted variables atau endogeneity.
HC3 sering direkomendasikan untuk sampel kecil-menengah.
OLS vs Robust pada data dengan outlier
Sandwich SE bukan “obat segala penyakit”. Ia seperti jas hujan: membantu saat heteroskedastisitas turun deras, tapi bukan helm saat endogeneity menabrak.
1 • Diagnostik
Advanced Regression
Diagnostik: VIF, leverage, Cook, dan residu
Model linear yang baik harus diperiksa, bukan dipercaya karena outputnya terlihat rapi.
VIF
COOK'S D
Residual vs fitted dan QQ-plot
VIF tinggi: koefisien sulit diinterpretasi secara individual.
Cook’s D tinggi: observasi berpotensi mengubah kesimpulan.
Plot residu mengungkap nonlinearitas, heteroskedastisitas, atau outlier.
Standardized residual dan Cook’s distance
1 • Nonlinearitas
Advanced Regression
Ekspansi basis & spline: fleksibel tetapi tetap linear pada parameter
Saat pola tidak lurus, tambahkan fungsi basis; jangan langsung panik seperti melihat error R jam 2 pagi.
BASIS / SPLINE
Polinomial global bisa tidak stabil pada batas data.
Spline memakai fleksibilitas lokal melalui knot/df.
Pilih kompleksitas dengan CV, AIC/BIC, dan pemeriksaan visual.
Perbandingan linear, polinomial, dan spline
Validasi model untuk memilih kompleksitas
1 • GLS AR(1)
Advanced Regression
GLS dengan korelasi AR(1): error punya memori
Ketika residu hari ini masih membawa cerita dari residu kemarin.
ERROR AR(1)
KOVARIANS GLS
Serial correlation membuat SE klasik sering terlalu optimistis.
GLS memodelkan kovarians error secara eksplisit.
Alternatif praktis: quasi-differencing / Cochrane–Orcutt.
ACF residu OLS vs GLS
02
Regresi Nonlinier
Model nonlinear terhadap parameter, estimasi iteratif, dan inferensi berbasis Jacobian.
2 • Regresi Nonlinier
Advanced Regression
Model nonlinear: bentuk kurva mengikuti mekanisme
Tidak semua proses cocok dipaksa linear. Biologi, farmakologi, ekonomi, dan pertumbuhan sering punya kurva alami.
MODEL UMUM
LOGISTIK
MICHAELIS–MENTEN
EKSPONENSIAL
Contoh kurva respon obat
2 • Estimasi Nonlinier
Advanced Regression
Residual, fungsi tujuan, dan Jacobian
Estimasi nonlinear mengulang proses linearisasi lokal sampai parameter stabil.
LEAST SQUARES NONLINEAR
JACOBIAN
Jacobian menerjemahkan sensitivitas kurva terhadap parameter.
Starting values sangat menentukan konvergensi.
Skala parameter yang buruk dapat memperlambat atau menggagalkan iterasi.
Data eksponensial dan kurva sejati
2 • Gauss–Newton
Advanced Regression
Gauss–Newton: linearisasi lokal
Setiap iterasi menyelesaikan least squares versi lokal dari model nonlinear.
LINEARISASI
UPDATE GN
Cepat jika starting value sudah dekat solusi.
Dapat gagal saat kurva sangat nonlinear atau matriks hampir singular.
Periksa kriteria konvergensi: perubahan parameter, SSE, atau gradien.
Hasil estimasi Gauss–Newton
2 • Levenberg–Marquardt
Advanced Regression
Levenberg–Marquardt: Gauss–Newton dengan rem
Metode ini menambahkan redaman agar langkah iterasi lebih stabil.
DAMPED UPDATE
PILIHAN REDAMAN
λ besar: langkah mirip gradient descent, lebih hati-hati.
λ kecil: langkah mendekati Gauss–Newton, lebih cepat.
Cocok untuk model nonlinear yang sensitif terhadap starting value.
Hasil estimasi Levenberg–Marquardt
2 • Inferensi Nonlinier
Advanced Regression
Inferensi nonlinear: kovarians berbasis Jacobian
Setelah konvergen, ketidakpastian parameter diperkirakan dari kurvatur lokal.
RAGAM ERROR
KOVARIANS PARAMETER
CI & AIC
Interpretasi lokal: valid saat aproksimasi normal masuk akal.
Bandingkan model dengan AIC/BIC dan validasi prediksi.
Gunakan interval prediksi untuk ketidakpastian observasi baru.
Trace test error / iterasi
03
Robust Regression
Outlier, leverage, M-estimator, LAD, dan quantile regression.
3 • Robust Regression
Advanced Regression
Mengapa robust? Karena outlier sering punya “volume suara” besar
Tujuannya bukan membuang data sembarangan, tetapi mengurangi dominasi observasi ekstrem yang tidak representatif.
M-ESTIMATOR
Verifikasi dulu: outlier bisa salah input, fenomena penting, atau kelompok berbeda.
Robust regression mengubah fungsi rugi atau bobot residual.
Hasil robust perlu dilaporkan bersama keputusan penanganan data.
OLS vs Huber vs Bisquare
3 • M-estimator
Advanced Regression
Huber dan Bisquare: dari “tegas” sampai “sangat selektif”
M-estimator mengganti kerugian kuadrat dengan fungsi yang lebih tahan residual ekstrem.
HUBER LOSS
BOBOT IRLS
Huber: masih memberi bobot pada outlier, tetapi dibatasi.
Bisquare/Tukey: outlier sangat besar dapat memperoleh bobot mendekati nol.
IRLS mengubah robust regression menjadi WLS berulang.
OLS memberi mikrofon penuh ke semua residual. Robust estimator menurunkan volume residual yang teriak terlalu keras.
3 • LAD & Quantile
Advanced Regression
LAD dan Quantile Regression
Median dan kuantil memberi pandangan lebih kaya ketika distribusi respons tidak simetris.
LAD
QUANTILE
CHECK LOSS
LAD menargetkan median kondisional.
Quantile regression memodelkan bagian bawah/tengah/atas distribusi.
Berguna ketika efek prediktor berbeda pada kelompok risiko tinggi vs rendah.
Perubahan garis untuk berbagai slope/kuantil
04
Regularisasi & Ensemble
Ridge, Lasso, Elastic Net, Random Forest, Boosting, dan XGBoost.
4 • Regularisasi
Advanced Regression
Regularisasi: mengendalikan kompleksitas model
Ketika prediktor banyak dan korelasi tinggi, penalti membantu menstabilkan estimasi.
RIDGE
LASSO
Ridge mengecilkan koefisien tanpa membuat nol persis.
Lasso dapat memilih variabel melalui koefisien nol.
λ dipilih dengan validasi silang; standardisasi prediktor wajib.
Lintasan koefisien regularisasi
4 • Ridge Regression
Advanced Regression
Ridge: bias kecil untuk varians yang jauh lebih stabil
Ridge cocok saat banyak prediktor berkorelasi dan tujuan utama adalah prediksi stabil.
SOLUSI TERTUTUP
EFEK PENALTI
Menurunkan varians ketika XᵀX hampir singular.
Koefisien tidak sparse; semua variabel tetap masuk.
Interpretasi individual menjadi lebih hati-hati karena shrinkage.
SSE ridge pada berbagai λ
4 • Lasso Regression
Advanced Regression
Lasso: regularisasi sekaligus seleksi variabel
Penalti L1 mendorong sebagian koefisien menjadi nol persis.
LASSO OBJECTIVE
CV RULE
Sangat berguna untuk prediktor banyak.
Ketika prediktor sangat berkorelasi, pilihan variabel bisa tidak stabil.
Interpretasi memerlukan validasi dan analisis sensitivitas.
Koefisien OLS vs Lasso
4 • Elastic Net
Advanced Regression
Elastic Net: kompromi L1 + L2
Menggabungkan kemampuan seleksi Lasso dan stabilitas Ridge.
ELASTIC NET
α=1 mendekati Lasso; α=0 mendekati Ridge.
Baik untuk prediktor berkorelasi dan p besar.
Pilih α dan λ melalui nested CV atau grid search.
Koefisien OLS vs Elastic Net
CV error untuk pemilihan λ
4 • Ensemble Modeling
Advanced Regression
Ensemble: banyak model lemah menjadi prediksi kuat
Bagging menurunkan varians, boosting menurunkan bias secara bertahap, stacking belajar menggabungkan model.
BAGGING
BOOSTING
STACKING
Bagging: model paralel pada bootstrap sample.
Boosting: model sekuensial belajar dari error sebelumnya.
Stacking: meta-model mengombinasikan prediksi base learners.
Decision boundary Adaboost
4 • Random Forest & XGBoost
Advanced Regression
Random Forest dan Gradient Boosting/XGBoost
Dua keluarga model machine learning yang sering menjadi pembanding kuat untuk regresi.
RANDOM FOREST
XGBOOST OBJECTIVE
Random Forest kuat untuk nonlinearitas dan interaksi tanpa banyak tuning.
Boosting sering sangat akurat tetapi sensitif terhadap tuning.
Interpretasi perlu bantuan feature importance, PDP/ICE, SHAP, atau ALE.
Feature importance pada Random Forest
05
Bayesian Regression
Likelihood, prior, posterior, MCMC, INLA, dan perbandingan dengan OLS.
5 • Bayesian Core
Advanced Regression
Bayesian: data memperbarui keyakinan
Semua inferensi ditulis sebagai distribusi posterior.
BAYES THEOREM
KERNEL POSTERIOR
Prior dapat informatif, vague, weakly informative, atau objektif.
Posterior menjadi dasar estimasi, CI/credible interval, dan prediksi.
Ketidakpastian parameter dibawa secara eksplisit ke prediksi.
Prior vs posterior pada model Poisson–Gamma
5 • Poisson–Gamma
Advanced Regression
Poisson–Gamma: contoh konjugasi yang bersih
Konjugasi membuat posterior memiliki bentuk tertutup dan mudah ditafsirkan.
LIKELIHOOD
PRIOR
POSTERIOR
Posterior mean menggabungkan informasi prior dan data.
Posterior predictive untuk observasi baru berbentuk Negative Binomial.
Contoh ideal untuk memperkenalkan logika Bayesian sebelum model regresi kompleks.
POSTERIOR MEAN
5 • Bayesian Linear Regression
Advanced Regression
Bayesian Linear Regression: prior + likelihood Gaussian
Model klasik dapat dibaca ulang sebagai posterior atas β dan σ².
LIKELIHOOD
NORMAL–INVERSE-GAMMA
MARGINAL POSTERIOR
Prior vague membuat posterior mendekati hasil OLS.
Prior informatif dapat menstabilkan estimasi pada sampel kecil.
Credible interval: probabilitas parameter berada pada rentang tertentu menurut posterior.
OLS vs Bayesian linear regression
5 • MCMC
Advanced Regression
Estimasi MCMC: simulasi dari posterior
Ketika posterior tidak tertutup, sampling digunakan untuk menghitung ringkasan inferensial.
MONTE CARLO POSTERIOR
Periksa traceplot, R-hat, effective sample size, dan autocorrelation.
Burn-in, thinning, dan jumlah iterasi bukan ritual; semuanya harus beralasan.
Posterior predictive check menguji apakah model mereplikasi pola data.
Trace dan density diagnostic
Posterior predictive interval
5 • INLA
Advanced Regression
INLA: aproksimasi cepat untuk latent Gaussian models
INLA menghindari sampling penuh dengan nested Laplace approximation.
MARGINAL POSTERIOR
NESTED APPROXIMATION
Cepat untuk GLM/GLMM Bayesian tertentu.
Sangat relevan untuk model spasial, temporal, dan spatiotemporal.
Hasil berupa marginal posterior untuk parameter dan latent effects.
MCMC seperti jalan kaki menjelajahi posterior; INLA seperti naik lift ketika bangunannya cocok. Tidak semua gedung punya lift.
5 • OLS vs Bayesian
Advanced Regression
OLS versus Bayesian: beda filosofi, sering bisa berdamai
Dengan prior sangat lemah dan likelihood Gaussian, hasil posterior dapat mendekati OLS.
OLS TARGET
BAYESIAN TARGET
OLS fokus pada estimator dan sampling distribution.
Bayesian fokus pada distribusi posterior parameter.
Pilih Bayesian ketika prior, hierarki, atau prediksi probabilistik penting.
Ilustrasi OLS vs Bayesian
06
Desain Sampling dalam Regresi
Sampling weights, design effects, power, dan clustering regression.
6 • Desain Sampling
Advanced Regression
Desain sampling menentukan cara membaca data
Data survei bukan hanya baris-baris observasi; ada probabilitas pemilihan, strata, klaster, dan bobot.
SRS
STRATIFIED
CLUSTER
SRS: setiap unit punya peluang sama.
Stratified: presisi meningkat saat strata homogen.
Cluster: biaya turun, tetapi korelasi intraklaster dapat menaikkan varians.
Data simulasi per strata dengan bobot
6 • Survey Regression
Advanced Regression
Memperhitungkan bobot dalam regresi
Jika desain sampling informatif, mengabaikan bobot dapat menghasilkan estimasi bias dan SE keliru.
WEIGHTED REGRESSION
DESIGN-BASED SE
Weighted regression memperbaiki estimasi titik sesuai populasi target.
Design-based SE memperhitungkan strata, klaster, dan FPC.
Gunakan paket survey/srvyr untuk workflow yang eksplisit.
Bobot sampling itu bukan aksesori. Ia seperti kunci ruangan populasi: tanpa kunci, kita mungkin hanya berdiri di sampel dan merasa sudah survei nasional.
6 • Ukuran Sampel
Advanced Regression
Ukuran sampel: power, efek parsial, dan design effect
Regresi yang dirancang baik menghubungkan efek minimum yang penting dengan ketelitian estimasi.
PARTIAL R²
COHEN F²
ADJUSTED N
Power analysis bergantung pada efek target, jumlah prediktor, α, dan power.
DEFF menaikkan kebutuhan sampel pada desain klaster.
Simulasi dapat memvalidasi aproksimasi rumus.
Contoh perubahan sample size / effect size
6 • Clustering Regression
Advanced Regression
Clustering Regression: segmentasi sebelum pemodelan
Ketika satu garis regresi menyembunyikan beberapa pola, klaster dapat membantu menemukan heterogenitas.
PER-KLASTER / STRATA
Regresi per strata: klaster diketahui dari desain/domain substantif.
Clustering regression: klaster dipelajari dari pola data.
Weighted clustering mempertahankan representasi populasi.
Clustering tanpa informasi strata
Satu model global kadang terlalu diplomatis: semua kelompok dirata-ratakan sampai pesannya hilang.
Workflow Praktikum
Advanced Regression
Workflow analisis: dari data sampai rekomendasi model
Urutan ini membantu mahasiswa tidak langsung “lompat ke model favorit”.
1
Eksplorasi
Plot, korelasi, struktur data
2
Model awal
OLS / GLM baseline
3
Diagnostik
Residu, VIF, influence
4
Perbaikan
WLS/GLS, robust, spline
5
Kompleksitas
Regularisasi / ensemble
6
Inferensi & Validasi
CV, AIC/BIC, posterior/design SE
Praktikum & Evaluasi
Advanced Regression
Rancangan praktikum: satu dataset, banyak sudut pandang
Mahasiswa belajar bahwa model adalah alat, bukan tujuan akhir.
Praktikum 1: OLS, diagnostik, VIF, Cook, robust SE.
Praktikum 2: nonlinear model, GN/LM, AIC, interval prediksi.
Praktikum 3: robust, quantile, Ridge/Lasso/Elastic Net.
Praktikum 4: Bayesian regression, MCMC/INLA, posterior predictive.
Praktikum 5: desain sampling, weighted regression, design-based SE.
CONTOH RUBRIK
Target proyek akhir: mahasiswa dapat menjelaskan mengapa model dipilih, bukan hanya menunjukkan bahwa kode berhasil jalan.
Contoh panel diagnostik model
Ringkasan
Advanced Regression
Take-home message
Regresi tingkat lanjut adalah seni menyeimbangkan interpretasi, prediksi, asumsi, dan desain data.
Mulai dari model sederhana, lalu tingkatkan kompleksitas hanya ketika ada alasan empiris/teoretis.
Rumus membantu melihat asumsi yang sering tersembunyi di balik tombol software.
Validasi, diagnostik, dan transparansi keputusan adalah bagian dari model—bukan lampiran belakangan.
Untuk data survei atau Bayesian/hierarkis, ketidakpastian harus dibawa sampai tahap kesimpulan.
AKHIRNYA
Kalau model sudah bagus, interpretasi tidak perlu drama. Kalau modelnya belum bagus, interpretasi biasanya mulai menulis novel.
Terima kasih
Diskusi • Pertanyaan • Praktikum