Analisis Regresi
Tingkat Lanjut
Section 6 — Desain Sampling Dalam Analisis Regresi
Dari bobot sampling, design effect, finite population correction, sampai survey regression dan clustering regression.
Ide utama
I Gede Nyoman Mindra Jaya
S2 Statistika Terapan FMIPA Unpad
Peta Pembelajaran Section 6
SECTION 6
02
S2 Statistika Terapan FMIPA Unpad
Memahami mengapa desain sampling memengaruhi regresi dan inferensi populasi.
Membedakan SRS, stratified sampling, cluster sampling, PPS, dan multi-stage sampling.
Menggunakan bobot sampling, FPC, DEFF, dan survey regression secara tepat.
Merancang ukuran sampel regresi dengan power analysis dan penyesuaian desain.
Formulasi kunci
Contoh aplikasi
Alur ini cocok untuk riset berbasis survei BPS, survei rumah tangga, sekolah, fasilitas kesehatan, atau studi sosial-ekonomi.
SRS
Strata
Cluster
PPS
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Mengapa Desain Sampling Masuk ke Regresi?
SECTION 6
03
S2 Statistika Terapan FMIPA Unpad
Regresi biasanya memodelkan hubungan kondisional, tetapi data survei sering tidak berasal dari SRS murni.
Probabilitas inklusi berbeda membuat sebagian unit mewakili populasi lebih besar.
Clustering membuat observasi dalam klaster berkorelasi sehingga ukuran sampel efektif lebih kecil.
Stratifikasi, nonresponse adjustment, dan calibration memengaruhi estimasi serta standard error.
Formulasi kunci
Contoh aplikasi
Survei tenaga kerja: responden dari daerah terpencil mungkin lebih jarang masuk sampel, sehingga bobot diperlukan agar estimasi populasi tidak bias.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Model Populasi dan Estimand
SECTION 6
04
S2 Statistika Terapan FMIPA Unpad
Populasi berhingga memiliki N unit; nilai Y dan X dapat diperlakukan tetap dalam design-based inference.
Model-based regression menulis hubungan probabilistik antara respons dan kovariat.
Estimand harus jelas: efek pada sampel, efek pada populasi target, atau efek subpopulasi.
Desain sampling menentukan siapa mewakili siapa dalam populasi target.
Formulasi kunci
Contoh aplikasi
Pada studi kemiskinan, estimand bisa berupa hubungan pendidikan–pendapatan untuk seluruh populasi provinsi, bukan hanya responden yang berhasil diwawancarai.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
OLS sebagai Titik Awal
SECTION 6
05
S2 Statistika Terapan FMIPA Unpad
OLS optimal ketika asumsi desain sederhana dan error klasik layak: independen, identik, dan homoskedastik.
Pada survei kompleks, OLS tetap bisa digunakan sebagai baseline diagnostik, tetapi bukan selalu inferensi final.
Masalah utama bukan hanya koefisien, melainkan kovarians koefisien dan target populasi.
OLS perlu dibandingkan dengan WLS dan survey regression.
Formulasi kunci
Contoh aplikasi
Dalam data administrasi sekolah yang hampir sensus, OLS mungkin cukup. Dalam data survei sekolah bertingkat, OLS standar biasanya terlalu percaya diri.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Probabilitas Inklusi dan Bobot Dasar
SECTION 6
06
S2 Statistika Terapan FMIPA Unpad
Probabilitas inklusi πᵢ adalah peluang unit i masuk sampel di bawah desain yang digunakan.
Bobot dasar wᵢ adalah invers dari peluang inklusi: unit yang sulit terpilih membawa bobot lebih besar.
Pada SRS, semua bobot sama. Pada PPS atau stratified disproportional, bobot bervariasi.
Bobot bukan kosmetik; bobot mengubah estimand menjadi lebih dekat ke populasi target.
Formulasi kunci
Contoh aplikasi
Jika πᵢ = 0.10, satu responden mewakili sekitar 10 unit populasi. Jika πᵢ = 0.50, bobotnya 2.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Weighted Least Squares dan IPW
SECTION 6
07
S2 Statistika Terapan FMIPA Unpad
WLS memberi kontribusi residual sesuai bobot sampling.
Tujuan IPW adalah mengoreksi perbedaan peluang seleksi, bukan sekadar “membesarkan sampel”.
Ketika probabilitas seleksi berkorelasi dengan Y atau X, model unweighted dapat mengubah estimand.
Untuk inference survei, WLS harus diikuti variance estimator yang sesuai desain.
Formulasi kunci
Contoh aplikasi
PPS pada rumah tangga besar: rumah tangga besar lebih mudah terpilih, sehingga unit yang kurang mudah terpilih harus diberi bobot lebih besar.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
SRS Tanpa Pengembalian dan FPC
SECTION 6
08
S2 Statistika Terapan FMIPA Unpad
Pada SRSWOR, setiap subset berukuran n memiliki peluang sama.
Probabilitas inklusi tunggal adalah n/N dan bobot sama untuk semua unit.
Finite population correction penting ketika sampling fraction n/N tidak kecil.
SRS menjadi benchmark untuk menilai dampak desain kompleks.
Formulasi kunci
Contoh aplikasi
Survei cepat pada populasi 1.000 orang dengan n=300 perlu FPC; survei n=300 dari 5 juta orang biasanya FPC ≈ 1.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Stratified Sampling
SECTION 6
09
S2 Statistika Terapan FMIPA Unpad
Populasi dibagi ke dalam strata yang saling lepas sebelum sampling.
Presisi meningkat jika unit dalam strata homogen dan antarstrata berbeda.
Alokasi sampel dapat proportional, equal, atau optimal seperti Neyman allocation.
Dalam regresi, strata dapat menjadi informasi desain, kovariat, atau efek heterogenitas.
Formulasi kunci
Contoh aplikasi
Survei provinsi: strata kota/desa atau kabupaten digunakan agar subpopulasi penting tetap terwakili.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Cluster Sampling dan Intracluster Correlation
SECTION 6
10
S2 Statistika Terapan FMIPA Unpad
Cluster sampling memilih kelompok unit, misalnya desa, sekolah, blok sensus, atau puskesmas.
Biaya lapangan turun, tetapi unit dalam cluster biasanya mirip sehingga variance naik.
ICC positif membuat ukuran sampel efektif lebih kecil daripada jumlah baris data.
Banyak cluster kecil sering lebih baik daripada sedikit cluster besar.
Formulasi kunci
Contoh aplikasi
Jika 20 siswa di sekolah yang sama sangat mirip, maka 400 siswa dari 20 sekolah bukan setara dengan 400 siswa independen.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
PPS dan Multi-stage Sampling
SECTION 6
11
S2 Statistika Terapan FMIPA Unpad
PPS memilih unit primer dengan peluang proporsional terhadap ukuran, misalnya jumlah rumah tangga atau penduduk.
Multi-stage sampling menggabungkan pemilihan wilayah, klaster, rumah tangga, lalu individu.
Probabilitas inklusi total adalah hasil perkalian peluang pada setiap tahap.
Bobot akhir sering memuat base weight, koreksi nonresponse, dan calibration.
Formulasi kunci
Contoh aplikasi
Susenas/Sakernas: unit dipilih melalui tahap wilayah dan rumah tangga; analisis regresi harus membaca variabel bobot, strata, dan PSU.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Ukuran Sampel untuk Mean: Target MoE
SECTION 6
12
S2 Statistika Terapan FMIPA Unpad
Perencanaan sampel sering dimulai dari target margin of error untuk mean atau proporsi.
Untuk SRSWOR, FPC menurunkan variance ketika n/N cukup besar.
Sy dapat berasal dari studi pendahuluan, data historis, atau rule-of-thumb.
Setelah nSRS didapat, tambahkan penyesuaian desain dan nonresponse.
Formulasi kunci
Contoh aplikasi
Target: estimasi rata-rata pengeluaran rumah tangga dengan MoE Rp50.000 pada tingkat keyakinan 95%.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Penurunan Rumus n: Langkah Inti
SECTION 6
13
S2 Statistika Terapan FMIPA Unpad
Mulai dari definisi MoE dan kuadratkan kedua sisi.
FPC memasukkan faktor (N−n)/N dalam variance mean.
Kalikan silang, kumpulkan suku yang memuat n, lalu faktorkan n.
Hasilnya memberi kebutuhan n untuk populasi berhingga.
Formulasi kunci
Contoh aplikasi
Slide ini berguna untuk menjelaskan mengapa FPC bukan “tambahan manual”, tetapi muncul langsung dari variance SRSWOR.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Rumus Ukuran Sampel SRS dengan FPC
SECTION 6
14
S2 Statistika Terapan FMIPA Unpad
Bentuk langsung menggunakan N, Sy, d, dan zα/2.
Bentuk alternatif memakai n0 sebagai ukuran sampel tanpa FPC.
Dalam praktik, lakukan pembulatan ke atas.
Jika desain bukan SRS, gunakan n ini sebagai baseline, bukan jawaban final.
Formulasi kunci
Contoh aplikasi
N=10.000, Sy=15, d=1,5, z=1,96 menghasilkan n0≈385 dan nFPC≈370.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Contoh Numerik Ukuran Sampel
SECTION 6
15
S2 Statistika Terapan FMIPA Unpad
Tanpa FPC, populasi dianggap sangat besar sehingga n0 cenderung lebih besar.
Dengan FPC, n turun karena populasi berhingga memberi informasi lebih banyak saat sampling fraction naik.
Validasi simulasi dapat mengecek apakah rata-rata MoE empiris mendekati target d.
Selalu dokumentasikan asumsi Sy, confidence level, dan target presisi.
Formulasi kunci
Contoh aplikasi
Untuk proposal survei, tampilkan tabel skenario: MoE 1%, 3%, 5% dan DEFF 1,5–2,5 agar reviewer melihat konsekuensi biaya.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Inflasi Nonresponse dan DEFF
SECTION 6
16
S2 Statistika Terapan FMIPA Unpad
Nonresponse menaikkan sampel awal agar sampel akhir tetap mencukupi.
DEFF menaikkan sampel karena desain kompleks menurunkan informasi efektif.
Kedua faktor sebaiknya dimasukkan sebelum finalisasi anggaran lapangan.
Untuk estimasi per subkelompok, hitung kebutuhan per domain, bukan hanya total.
Formulasi kunci
Contoh aplikasi
Jika nSRS=370, DEFF=1,8, dan nonresponse 10%, maka nfield≈740. Ini biasanya “momen sadar biaya” 😄.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Dampak Mengabaikan Desain Sampling
SECTION 6
17
S2 Statistika Terapan FMIPA Unpad
Bobot diabaikan: distribusi sampel dapat menggantikan distribusi populasi.
Cluster diabaikan: standard error sering terlalu kecil dan p-value terlalu optimis.
Strata diabaikan: keuntungan presisi dari desain dapat hilang.
Kesalahan interpretasi: hasil tampak valid untuk populasi, padahal hanya valid untuk sampel.
Formulasi kunci
Contoh aplikasi
Studi pendidikan: siswa dalam sekolah sama saling mirip; OLS biasa dapat mengklaim efek signifikan yang hilang saat cluster-robust/svyglm dipakai.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Bias Koefisien vs Bias Standard Error
SECTION 6
18
S2 Statistika Terapan FMIPA Unpad
Unequal probability sampling dapat menggeser koefisien bila peluang seleksi informatif.
Clustering terutama memengaruhi standard error jika mean model tetap benar.
Stratifikasi dapat menurunkan variance jika dianalisis sesuai desain.
Perlu diagnosis: perubahan koefisien besar menandakan bobot penting; perubahan SE besar menandakan desain dependence penting.
Formulasi kunci
Contoh aplikasi
Bandingkan tiga model: OLS, WLS, dan svyglm. Bila simpulan berubah, laporkan alasan desain dan bukan memilih yang “paling enak”.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Design-based vs Model-based Inference
SECTION 6
19
S2 Statistika Terapan FMIPA Unpad
Design-based: nilai populasi dianggap tetap; randomness berasal dari desain sampling.
Model-based: randomness berasal dari model probabilistik untuk Y|X.
Survey regression modern sering menggabungkan bobot desain dengan model outcome.
Kuncinya: jelaskan target estimasi dan asumsi yang dipakai.
Formulasi kunci
Contoh aplikasi
Dalam publikasi, satu paragraf “survey design and weighting” sering menentukan apakah inferensi populasi dapat dipercaya.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Survey Regression dengan svyglm
SECTION 6
20
S2 Statistika Terapan FMIPA Unpad
svyglm menggunakan design object yang berisi weights, strata, cluster/PSU, dan FPC bila tersedia.
Koefisien sering mirip dengan WLS, tetapi standard error dihitung sesuai desain.
Untuk keluarga gaussian, output menyerupai regresi linear berbobot dengan SE berbasis desain.
Untuk logit/Poisson survei, gunakan family yang sesuai dan tetap deklarasikan desain.
Formulasi kunci
Contoh aplikasi
R workflow: svydesign(ids=~psu, strata=~strata, weights=~w, data=d) lalu svyglm(y~x1+x2, design=des).
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Sandwich Variance untuk Regresi Berbobot
SECTION 6
21
S2 Statistika Terapan FMIPA Unpad
Koefisien WLS saja tidak cukup untuk inference ketika heteroskedastisitas atau desain kompleks ada.
Sandwich covariance memakai struktur bread–meat–bread.
Cluster-robust meat mengagregasi skor pada tingkat cluster/PSU.
Taylor linearization untuk survei dapat dipahami sebagai varian robust yang disesuaikan desain.
Formulasi kunci
Contoh aplikasi
Jika responden tersarang dalam desa, agregasi pada level desa lebih masuk akal daripada menganggap seluruh individu independen.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Taylor Series Linearization
SECTION 6
22
S2 Statistika Terapan FMIPA Unpad
Banyak estimator survei bukan fungsi linear sederhana dari data.
Linearization mendekati estimator dengan ekspansi Taylor orde pertama.
Setelah estimator dilinearkan, variance dihitung memakai desain sampling.
Cocok untuk mean, rasio, proporsi, dan banyak estimator regresi/glm yang smooth.
Formulasi kunci
Contoh aplikasi
svyglm umumnya menggunakan ide linearization untuk menghitung standard error model survei.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Replicate Weights
SECTION 6
23
S2 Statistika Terapan FMIPA Unpad
Metode replikasi mengulang estimasi pada banyak sampel tiruan yang meniru desain.
Contoh: jackknife, BRR, Fay BRR, bootstrap survei.
Sangat berguna untuk estimator kompleks seperti median, kuantil, dan model nonlinear.
Dataset survei besar sering menyediakan replicate weights resmi.
Formulasi kunci
Contoh aplikasi
Pada survei internasional, file data sering berisi kolom weight utama dan puluhan replicate weights; gunakan sesuai dokumentasi.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Finite Population Correction dalam SE
SECTION 6
24
S2 Statistika Terapan FMIPA Unpad
FPC menurunkan standard error ketika sampel tanpa pengembalian mengambil fraksi besar populasi.
Efek FPC kecil saat n/N sangat kecil.
Untuk desain bertingkat, FPC dapat berada pada level sampling stage tertentu.
Jangan memasukkan FPC bila desain/dokumentasi tidak mendukung.
Formulasi kunci
Contoh aplikasi
Jika N=10.000 dan n=2.000, FPC≈0,894: standard error turun sekitar 10,6% dibanding populasi tak berhingga.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Workflow R: Mendeklarasikan Desain
SECTION 6
25
S2 Statistika Terapan FMIPA Unpad
Sebelum model, buat design object: ids, strata, weights, fpc.
Gunakan nesting bila PSU tersarang dalam strata.
Periksa distribusi bobot: nilai ekstrem dapat membuat estimasi tidak stabil.
Simpan metadata desain di laporan agar analisis reproducible.
Formulasi kunci
Contoh aplikasi
Setelah design object benar, analisis mean, total, proporsi, dan regresi dapat memakai fungsi survey secara konsisten.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Studi Kasus: Populasi Sintetik
SECTION 6
26
S2 Statistika Terapan FMIPA Unpad
Bangun populasi N=10.000 dengan strata, cluster, x1, x2, dan outcome y.
Buat probabilitas seleksi yang bergantung pada kovariat untuk mensimulasikan informative sampling.
Bandingkan SRS, stratified proportional allocation, dan PPS sederhana.
Tujuan: melihat kapan bobot dan design-based SE mengubah simpulan.
Formulasi kunci
Contoh aplikasi
Simulasi seperti ini cocok untuk mengajar: mahasiswa melihat secara konkret mengapa “ambil lm() saja” kadang kurang aman.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Tiga Mekanisme Sampling dalam Contoh
SECTION 6
27
S2 Statistika Terapan FMIPA Unpad
SRS: setiap unit memiliki peluang sama.
Stratified proportional: n_h mengikuti proporsi N_h.
PPS-like: peluang seleksi meningkat ketika p_select tinggi.
Perbedaan mekanisme sampling menghasilkan distribusi X yang berbeda dalam sampel.
Formulasi kunci
Contoh aplikasi
Pada PPS, OLS dapat terlalu mewakili unit besar/lebih mudah terpilih bila bobot tidak digunakan.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
OLS vs WLS: Apa yang Dibandingkan?
SECTION 6
28
S2 Statistika Terapan FMIPA Unpad
OLS unweighted menjawab hubungan pada distribusi sampel.
WLS/IPW mencoba mengembalikan representasi ke distribusi populasi.
Jika semua bobot sama, OLS dan WLS memberi koefisien sama.
Jika bobot berasosiasi dengan X atau Y, koefisien dapat berubah.
Formulasi kunci
Contoh aplikasi
Bandingkan tanda, besaran, dan ketidakpastian. Jangan hanya membandingkan p-value; p-value itu drama kecil, estimand itu plot utamanya 😄.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Interpretasi svyglm
SECTION 6
29
S2 Statistika Terapan FMIPA Unpad
Koefisien: perubahan rata-rata respons populasi target untuk kenaikan satu unit prediktor, dengan kovariat lain tetap.
SE: ketidakpastian yang memperhitungkan bobot dan struktur desain.
Derajat bebas sering terkait jumlah PSU/strata, bukan hanya jumlah individu.
Output harus dibaca bersama dokumentasi desain survei.
Formulasi kunci
Contoh aplikasi
Dalam laporan, tulis: “Analisis menggunakan bobot sampling; SE dihitung dengan Taylor linearization, strata dan PSU sesuai metadata survei.”
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Ukuran Sampel Dalam Regresi
SECTION 6
30
S2 Statistika Terapan FMIPA Unpad
Tidak ada satu angka universal untuk regresi.
n bergantung pada effect size, jumlah prediktor, korelasi antar-X, error variance, power, dan alpha.
Untuk desain survei, n nominal harus dikoreksi DEFF dan nonresponse.
Simulasi power paling transparan ketika model kompleks atau asumsi analitik sulit.
Formulasi kunci
Contoh aplikasi
Riset tesis: tentukan minimum effect of substantive interest, bukan sekadar “berapa n minimal agar lolos seminar”.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Power untuk Koefisien βj
SECTION 6
31
S2 Statistika Terapan FMIPA Unpad
Power adalah peluang menolak H0 ketika efek benar-benar ada.
Untuk uji dua sisi, sinyal harus cukup besar dibanding standard error.
SE menurun saat n naik, tetapi multikolinearitas membuat SE tetap besar.
Power analysis perlu effect size yang realistis dan bermakna substantif.
Formulasi kunci
Contoh aplikasi
Untuk slope kecil tetapi penting secara kebijakan, n yang dibutuhkan bisa jauh lebih besar daripada rule-of-thumb 10 observasi per prediktor.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Partial R² dan Cohen’s f²
SECTION 6
32
S2 Statistika Terapan FMIPA Unpad
Partial R² mengukur tambahan variasi yang dijelaskan prediktor setelah kovariat lain dikontrol.
Cohen’s f² adalah transformasi partial R² untuk power regression.
Benchmark kecil/sedang/besar hanya panduan; konteks substantif lebih penting.
Untuk blok prediktor, gunakan u = jumlah prediktor yang diuji.
Formulasi kunci
Contoh aplikasi
Jika variabel kebijakan hanya menambah R² parsial 0,03 tetapi penting, power analysis harus menghormati efek kecil itu.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Rumus Praktis Ukuran Sampel Regresi
SECTION 6
33
S2 Statistika Terapan FMIPA Unpad
Pendekatan praktis menggunakan kuantil normal untuk α dan power.
Tambahkan p+1 untuk total prediktor dan intersep.
Formula ini aproksimasi; untuk sampel kecil gunakan noncentral F atau paket pwr.
Hasil harus dinaikkan oleh DEFF jika desain survei kompleks.
Formulasi kunci
Contoh aplikasi
Dengan α=0,05, power=0,80, f²=0,15, p=5, diperoleh sekitar n=59 sebelum penyesuaian desain.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Penyesuaian DEFF untuk Power
SECTION 6
34
S2 Statistika Terapan FMIPA Unpad
DEFF adalah rasio variance desain aktual terhadap variance SRS dengan n yang sama.
Ukuran sampel desain kira-kira DEFF kali ukuran sampel SRS.
DEFF dapat diestimasi dari survei serupa atau diasumsikan sebagai skenario konservatif.
Untuk cluster sampling, DEFF tumbuh bersama ukuran cluster rata-rata dan ICC.
Formulasi kunci
Contoh aplikasi
Jika nSRS=59 dan DEFF=2, maka ndesign≈118. Tambahkan lagi inflasi nonresponse bila perlu.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
pwr dan Simulasi Power
SECTION 6
35
S2 Statistika Terapan FMIPA Unpad
pwr.f2.test menghitung power regresi berdasarkan Cohen’s f².
Simulasi memungkinkan korelasi antar-X, distribusi nonnormal, missingness, dan desain kompleks.
Gunakan beberapa skenario agar rencana sampel tahan terhadap asumsi yang meleset.
Laporkan seed, parameter, jumlah replikasi, dan kriteria keberhasilan.
Formulasi kunci
Contoh aplikasi
Untuk proposal, lampirkan skenario n: optimistis, realistis, konservatif. Reviewer senang; anggaran mungkin sedikit panik.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Effective Sample Size
SECTION 6
36
S2 Statistika Terapan FMIPA Unpad
n nominal adalah jumlah observasi; n efektif adalah informasi yang tersedia setelah desain diperhitungkan.
Bobot ekstrem dapat menurunkan effective sample size meski n besar.
Cluster dengan ICC tinggi menurunkan informasi independen.
Gunakan ESS untuk menjelaskan mengapa SE lebih besar daripada OLS biasa.
Formulasi kunci
Contoh aplikasi
Dua survei sama-sama n=1.000 dapat memiliki presisi berbeda jika satu menggunakan bobot ekstrem dan cluster besar.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Topik Tambahan: Clustering Regression
SECTION 6
37
S2 Statistika Terapan FMIPA Unpad
Clustering regression mencari subkelompok dengan hubungan Y–X yang berbeda.
Ia dekat dengan mixture of regressions: setiap cluster memiliki parameter regresi sendiri.
Cluster dapat diketahui dari strata, ditemukan oleh algoritme, atau dimodelkan secara probabilistik.
Tantangan: jumlah cluster, local optima, identifiability, dan interpretasi label.
Formulasi kunci
Contoh aplikasi
Segmentasi pasar: kelompok pelanggan A dan B bisa memiliki slope harga–permintaan yang berbeda.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Mixture of Regressions
SECTION 6
38
S2 Statistika Terapan FMIPA Unpad
Keanggotaan cluster diperlakukan sebagai variabel laten zᵢ.
Likelihood total adalah campuran likelihood regresi per komponen.
Estimasi sering menggunakan EM, MCMC, atau optimisasi dengan banyak restart.
Label switching perlu diperhatikan pada pendekatan Bayesian mixture.
Formulasi kunci
Contoh aplikasi
Dalam data kesehatan, respons terapi dapat mengikuti pola berbeda untuk subpopulasi laten, bukan hanya satu slope global.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Regresi Per Strata Ketika Label Diketahui
SECTION 6
39
S2 Statistika Terapan FMIPA Unpad
Jika strata diketahui dan bermakna kebijakan, regresi per strata mudah ditafsirkan.
Alternatif: satu model dengan interaksi strata × prediktor.
Regresi per strata dapat tidak stabil jika n_h kecil.
Multilevel model dapat memberi partial pooling antarstrata.
Formulasi kunci
Contoh aplikasi
Kota vs desa: efek pendidikan terhadap pendapatan dapat berbeda; interaksi memberi uji formal perbedaan slope.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Clustering Regression Tanpa Label Strata
SECTION 6
40
S2 Statistika Terapan FMIPA Unpad
Ketika strata tidak diketahui, cluster dapat dicari dari pola X dan Y.
K-means pada (x,y) adalah baseline eksploratif, tetapi bukan model regresi mixture penuh.
Gunakan validasi stabilitas agar cluster bukan artefak satu inisialisasi.
Jumlah cluster harus dipilih berdasarkan teori, validasi, atau kriteria model.
Formulasi kunci
Contoh aplikasi
Dalam survei UMKM, cluster dapat merepresentasikan pola usaha mikro dan kecil yang memiliki hubungan modal–omzet berbeda.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Weighted Clustering Regression
SECTION 6
41
S2 Statistika Terapan FMIPA Unpad
Jika data berasal dari survei kompleks, bobot perlu dipertimbangkan dalam clustering dan regresi.
Weighted clustering membuat unit berpengaruh sesuai representasi populasi.
Regresi per cluster kemudian juga dapat menggunakan bobot sampling.
Interpretasi cluster tetap eksploratif; jangan menyamakan cluster laten dengan strata desain resmi tanpa validasi.
Formulasi kunci
Contoh aplikasi
Weighted clustering regression cocok untuk eksplorasi heterogenitas hubungan pada survei nasional dengan bobot tidak sama.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Contoh Aplikasi Nyata
SECTION 6
42
S2 Statistika Terapan FMIPA Unpad
Ekonomi rumah tangga: hubungan pendidikan, usia, wilayah, dan pendapatan dengan bobot survei.
Kesehatan masyarakat: outcome penyakit dan akses layanan dengan desain klaster puskesmas/desa.
Pendidikan: siswa tersarang dalam sekolah dan strata wilayah.
Official statistics: model populasi harus menjaga estimand dan ketidakpastian berbasis desain.
Formulasi kunci
Contoh aplikasi
Untuk mahasiswa, minta mereka menulis dulu desain survei sebelum menulis rumus regresi. Rumus tanpa desain itu seperti GPS tanpa peta.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Checklist Pelaporan Regresi Survei
SECTION 6
43
S2 Statistika Terapan FMIPA Unpad
Sebutkan populasi target, frame, desain sampling, strata, PSU/cluster, dan bobot.
Jelaskan apakah bobot final mencakup nonresponse dan calibration.
Laporkan metode variance estimation: Taylor, BRR, jackknife, bootstrap, atau cluster-robust.
Bandingkan analisis sensitif: unweighted, weighted, dan design-based bila relevan.
Tulis keterbatasan: nonresponse, coverage error, bobot ekstrem, atau domain kecil.
Formulasi kunci
Contoh aplikasi
Checklist ini bisa langsung dipakai sebagai template bagian “Metode Analisis Data” pada tesis atau artikel.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.
Kesimpulan Section 6
SECTION 6
44
S2 Statistika Terapan FMIPA Unpad
Desain sampling menentukan representativitas dan validitas inferensi regresi.
Bobot mengoreksi unequal inclusion probabilities; design-based SE mengoreksi struktur ketergantungan.
FPC, DEFF, dan nonresponse harus masuk dalam perencanaan ukuran sampel.
Survey regression dan weighted clustering regression memperluas regresi agar sesuai dengan data survei kompleks.
Pesan utama: jangan hanya menanyakan “model apa?”, tanyakan juga “datanya datang dari desain apa?”
Formulasi kunci
Contoh aplikasi
Section berikutnya dapat melanjutkan ke model lanjutan atau aplikasi sesuai struktur materi.
Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.