1 of 44

Analisis Regresi

Tingkat Lanjut

Section 6 — Desain Sampling Dalam Analisis Regresi

Dari bobot sampling, design effect, finite population correction, sampai survey regression dan clustering regression.

Ide utama

I Gede Nyoman Mindra Jaya

S2 Statistika Terapan FMIPA Unpad

2 of 44

Peta Pembelajaran Section 6

SECTION 6

02

S2 Statistika Terapan FMIPA Unpad

Memahami mengapa desain sampling memengaruhi regresi dan inferensi populasi.

Membedakan SRS, stratified sampling, cluster sampling, PPS, dan multi-stage sampling.

Menggunakan bobot sampling, FPC, DEFF, dan survey regression secara tepat.

Merancang ukuran sampel regresi dengan power analysis dan penyesuaian desain.

Formulasi kunci

Contoh aplikasi

Alur ini cocok untuk riset berbasis survei BPS, survei rumah tangga, sekolah, fasilitas kesehatan, atau studi sosial-ekonomi.

SRS

Strata

Cluster

PPS

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

3 of 44

Mengapa Desain Sampling Masuk ke Regresi?

SECTION 6

03

S2 Statistika Terapan FMIPA Unpad

Regresi biasanya memodelkan hubungan kondisional, tetapi data survei sering tidak berasal dari SRS murni.

Probabilitas inklusi berbeda membuat sebagian unit mewakili populasi lebih besar.

Clustering membuat observasi dalam klaster berkorelasi sehingga ukuran sampel efektif lebih kecil.

Stratifikasi, nonresponse adjustment, dan calibration memengaruhi estimasi serta standard error.

Formulasi kunci

Contoh aplikasi

Survei tenaga kerja: responden dari daerah terpencil mungkin lebih jarang masuk sampel, sehingga bobot diperlukan agar estimasi populasi tidak bias.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

4 of 44

Model Populasi dan Estimand

SECTION 6

04

S2 Statistika Terapan FMIPA Unpad

Populasi berhingga memiliki N unit; nilai Y dan X dapat diperlakukan tetap dalam design-based inference.

Model-based regression menulis hubungan probabilistik antara respons dan kovariat.

Estimand harus jelas: efek pada sampel, efek pada populasi target, atau efek subpopulasi.

Desain sampling menentukan siapa mewakili siapa dalam populasi target.

Formulasi kunci

Contoh aplikasi

Pada studi kemiskinan, estimand bisa berupa hubungan pendidikan–pendapatan untuk seluruh populasi provinsi, bukan hanya responden yang berhasil diwawancarai.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

5 of 44

OLS sebagai Titik Awal

SECTION 6

05

S2 Statistika Terapan FMIPA Unpad

OLS optimal ketika asumsi desain sederhana dan error klasik layak: independen, identik, dan homoskedastik.

Pada survei kompleks, OLS tetap bisa digunakan sebagai baseline diagnostik, tetapi bukan selalu inferensi final.

Masalah utama bukan hanya koefisien, melainkan kovarians koefisien dan target populasi.

OLS perlu dibandingkan dengan WLS dan survey regression.

Formulasi kunci

Contoh aplikasi

Dalam data administrasi sekolah yang hampir sensus, OLS mungkin cukup. Dalam data survei sekolah bertingkat, OLS standar biasanya terlalu percaya diri.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

6 of 44

Probabilitas Inklusi dan Bobot Dasar

SECTION 6

06

S2 Statistika Terapan FMIPA Unpad

Probabilitas inklusi πᵢ adalah peluang unit i masuk sampel di bawah desain yang digunakan.

Bobot dasar wᵢ adalah invers dari peluang inklusi: unit yang sulit terpilih membawa bobot lebih besar.

Pada SRS, semua bobot sama. Pada PPS atau stratified disproportional, bobot bervariasi.

Bobot bukan kosmetik; bobot mengubah estimand menjadi lebih dekat ke populasi target.

Formulasi kunci

Contoh aplikasi

Jika πᵢ = 0.10, satu responden mewakili sekitar 10 unit populasi. Jika πᵢ = 0.50, bobotnya 2.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

7 of 44

Weighted Least Squares dan IPW

SECTION 6

07

S2 Statistika Terapan FMIPA Unpad

WLS memberi kontribusi residual sesuai bobot sampling.

Tujuan IPW adalah mengoreksi perbedaan peluang seleksi, bukan sekadar “membesarkan sampel”.

Ketika probabilitas seleksi berkorelasi dengan Y atau X, model unweighted dapat mengubah estimand.

Untuk inference survei, WLS harus diikuti variance estimator yang sesuai desain.

Formulasi kunci

Contoh aplikasi

PPS pada rumah tangga besar: rumah tangga besar lebih mudah terpilih, sehingga unit yang kurang mudah terpilih harus diberi bobot lebih besar.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

8 of 44

SRS Tanpa Pengembalian dan FPC

SECTION 6

08

S2 Statistika Terapan FMIPA Unpad

Pada SRSWOR, setiap subset berukuran n memiliki peluang sama.

Probabilitas inklusi tunggal adalah n/N dan bobot sama untuk semua unit.

Finite population correction penting ketika sampling fraction n/N tidak kecil.

SRS menjadi benchmark untuk menilai dampak desain kompleks.

Formulasi kunci

Contoh aplikasi

Survei cepat pada populasi 1.000 orang dengan n=300 perlu FPC; survei n=300 dari 5 juta orang biasanya FPC ≈ 1.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

9 of 44

Stratified Sampling

SECTION 6

09

S2 Statistika Terapan FMIPA Unpad

Populasi dibagi ke dalam strata yang saling lepas sebelum sampling.

Presisi meningkat jika unit dalam strata homogen dan antarstrata berbeda.

Alokasi sampel dapat proportional, equal, atau optimal seperti Neyman allocation.

Dalam regresi, strata dapat menjadi informasi desain, kovariat, atau efek heterogenitas.

Formulasi kunci

Contoh aplikasi

Survei provinsi: strata kota/desa atau kabupaten digunakan agar subpopulasi penting tetap terwakili.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

10 of 44

Cluster Sampling dan Intracluster Correlation

SECTION 6

10

S2 Statistika Terapan FMIPA Unpad

Cluster sampling memilih kelompok unit, misalnya desa, sekolah, blok sensus, atau puskesmas.

Biaya lapangan turun, tetapi unit dalam cluster biasanya mirip sehingga variance naik.

ICC positif membuat ukuran sampel efektif lebih kecil daripada jumlah baris data.

Banyak cluster kecil sering lebih baik daripada sedikit cluster besar.

Formulasi kunci

Contoh aplikasi

Jika 20 siswa di sekolah yang sama sangat mirip, maka 400 siswa dari 20 sekolah bukan setara dengan 400 siswa independen.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

11 of 44

PPS dan Multi-stage Sampling

SECTION 6

11

S2 Statistika Terapan FMIPA Unpad

PPS memilih unit primer dengan peluang proporsional terhadap ukuran, misalnya jumlah rumah tangga atau penduduk.

Multi-stage sampling menggabungkan pemilihan wilayah, klaster, rumah tangga, lalu individu.

Probabilitas inklusi total adalah hasil perkalian peluang pada setiap tahap.

Bobot akhir sering memuat base weight, koreksi nonresponse, dan calibration.

Formulasi kunci

Contoh aplikasi

Susenas/Sakernas: unit dipilih melalui tahap wilayah dan rumah tangga; analisis regresi harus membaca variabel bobot, strata, dan PSU.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

12 of 44

Ukuran Sampel untuk Mean: Target MoE

SECTION 6

12

S2 Statistika Terapan FMIPA Unpad

Perencanaan sampel sering dimulai dari target margin of error untuk mean atau proporsi.

Untuk SRSWOR, FPC menurunkan variance ketika n/N cukup besar.

Sy dapat berasal dari studi pendahuluan, data historis, atau rule-of-thumb.

Setelah nSRS didapat, tambahkan penyesuaian desain dan nonresponse.

Formulasi kunci

Contoh aplikasi

Target: estimasi rata-rata pengeluaran rumah tangga dengan MoE Rp50.000 pada tingkat keyakinan 95%.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

13 of 44

Penurunan Rumus n: Langkah Inti

SECTION 6

13

S2 Statistika Terapan FMIPA Unpad

Mulai dari definisi MoE dan kuadratkan kedua sisi.

FPC memasukkan faktor (N−n)/N dalam variance mean.

Kalikan silang, kumpulkan suku yang memuat n, lalu faktorkan n.

Hasilnya memberi kebutuhan n untuk populasi berhingga.

Formulasi kunci

Contoh aplikasi

Slide ini berguna untuk menjelaskan mengapa FPC bukan “tambahan manual”, tetapi muncul langsung dari variance SRSWOR.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

14 of 44

Rumus Ukuran Sampel SRS dengan FPC

SECTION 6

14

S2 Statistika Terapan FMIPA Unpad

Bentuk langsung menggunakan N, Sy, d, dan zα/2.

Bentuk alternatif memakai n0 sebagai ukuran sampel tanpa FPC.

Dalam praktik, lakukan pembulatan ke atas.

Jika desain bukan SRS, gunakan n ini sebagai baseline, bukan jawaban final.

Formulasi kunci

Contoh aplikasi

N=10.000, Sy=15, d=1,5, z=1,96 menghasilkan n0≈385 dan nFPC≈370.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

15 of 44

Contoh Numerik Ukuran Sampel

SECTION 6

15

S2 Statistika Terapan FMIPA Unpad

Tanpa FPC, populasi dianggap sangat besar sehingga n0 cenderung lebih besar.

Dengan FPC, n turun karena populasi berhingga memberi informasi lebih banyak saat sampling fraction naik.

Validasi simulasi dapat mengecek apakah rata-rata MoE empiris mendekati target d.

Selalu dokumentasikan asumsi Sy, confidence level, dan target presisi.

Formulasi kunci

Contoh aplikasi

Untuk proposal survei, tampilkan tabel skenario: MoE 1%, 3%, 5% dan DEFF 1,5–2,5 agar reviewer melihat konsekuensi biaya.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

16 of 44

Inflasi Nonresponse dan DEFF

SECTION 6

16

S2 Statistika Terapan FMIPA Unpad

Nonresponse menaikkan sampel awal agar sampel akhir tetap mencukupi.

DEFF menaikkan sampel karena desain kompleks menurunkan informasi efektif.

Kedua faktor sebaiknya dimasukkan sebelum finalisasi anggaran lapangan.

Untuk estimasi per subkelompok, hitung kebutuhan per domain, bukan hanya total.

Formulasi kunci

Contoh aplikasi

Jika nSRS=370, DEFF=1,8, dan nonresponse 10%, maka nfield≈740. Ini biasanya “momen sadar biaya” 😄.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

17 of 44

Dampak Mengabaikan Desain Sampling

SECTION 6

17

S2 Statistika Terapan FMIPA Unpad

Bobot diabaikan: distribusi sampel dapat menggantikan distribusi populasi.

Cluster diabaikan: standard error sering terlalu kecil dan p-value terlalu optimis.

Strata diabaikan: keuntungan presisi dari desain dapat hilang.

Kesalahan interpretasi: hasil tampak valid untuk populasi, padahal hanya valid untuk sampel.

Formulasi kunci

Contoh aplikasi

Studi pendidikan: siswa dalam sekolah sama saling mirip; OLS biasa dapat mengklaim efek signifikan yang hilang saat cluster-robust/svyglm dipakai.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

18 of 44

Bias Koefisien vs Bias Standard Error

SECTION 6

18

S2 Statistika Terapan FMIPA Unpad

Unequal probability sampling dapat menggeser koefisien bila peluang seleksi informatif.

Clustering terutama memengaruhi standard error jika mean model tetap benar.

Stratifikasi dapat menurunkan variance jika dianalisis sesuai desain.

Perlu diagnosis: perubahan koefisien besar menandakan bobot penting; perubahan SE besar menandakan desain dependence penting.

Formulasi kunci

Contoh aplikasi

Bandingkan tiga model: OLS, WLS, dan svyglm. Bila simpulan berubah, laporkan alasan desain dan bukan memilih yang “paling enak”.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

19 of 44

Design-based vs Model-based Inference

SECTION 6

19

S2 Statistika Terapan FMIPA Unpad

Design-based: nilai populasi dianggap tetap; randomness berasal dari desain sampling.

Model-based: randomness berasal dari model probabilistik untuk Y|X.

Survey regression modern sering menggabungkan bobot desain dengan model outcome.

Kuncinya: jelaskan target estimasi dan asumsi yang dipakai.

Formulasi kunci

Contoh aplikasi

Dalam publikasi, satu paragraf “survey design and weighting” sering menentukan apakah inferensi populasi dapat dipercaya.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

20 of 44

Survey Regression dengan svyglm

SECTION 6

20

S2 Statistika Terapan FMIPA Unpad

svyglm menggunakan design object yang berisi weights, strata, cluster/PSU, dan FPC bila tersedia.

Koefisien sering mirip dengan WLS, tetapi standard error dihitung sesuai desain.

Untuk keluarga gaussian, output menyerupai regresi linear berbobot dengan SE berbasis desain.

Untuk logit/Poisson survei, gunakan family yang sesuai dan tetap deklarasikan desain.

Formulasi kunci

Contoh aplikasi

R workflow: svydesign(ids=~psu, strata=~strata, weights=~w, data=d) lalu svyglm(y~x1+x2, design=des).

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

21 of 44

Sandwich Variance untuk Regresi Berbobot

SECTION 6

21

S2 Statistika Terapan FMIPA Unpad

Koefisien WLS saja tidak cukup untuk inference ketika heteroskedastisitas atau desain kompleks ada.

Sandwich covariance memakai struktur bread–meat–bread.

Cluster-robust meat mengagregasi skor pada tingkat cluster/PSU.

Taylor linearization untuk survei dapat dipahami sebagai varian robust yang disesuaikan desain.

Formulasi kunci

Contoh aplikasi

Jika responden tersarang dalam desa, agregasi pada level desa lebih masuk akal daripada menganggap seluruh individu independen.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

22 of 44

Taylor Series Linearization

SECTION 6

22

S2 Statistika Terapan FMIPA Unpad

Banyak estimator survei bukan fungsi linear sederhana dari data.

Linearization mendekati estimator dengan ekspansi Taylor orde pertama.

Setelah estimator dilinearkan, variance dihitung memakai desain sampling.

Cocok untuk mean, rasio, proporsi, dan banyak estimator regresi/glm yang smooth.

Formulasi kunci

Contoh aplikasi

svyglm umumnya menggunakan ide linearization untuk menghitung standard error model survei.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

23 of 44

Replicate Weights

SECTION 6

23

S2 Statistika Terapan FMIPA Unpad

Metode replikasi mengulang estimasi pada banyak sampel tiruan yang meniru desain.

Contoh: jackknife, BRR, Fay BRR, bootstrap survei.

Sangat berguna untuk estimator kompleks seperti median, kuantil, dan model nonlinear.

Dataset survei besar sering menyediakan replicate weights resmi.

Formulasi kunci

Contoh aplikasi

Pada survei internasional, file data sering berisi kolom weight utama dan puluhan replicate weights; gunakan sesuai dokumentasi.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

24 of 44

Finite Population Correction dalam SE

SECTION 6

24

S2 Statistika Terapan FMIPA Unpad

FPC menurunkan standard error ketika sampel tanpa pengembalian mengambil fraksi besar populasi.

Efek FPC kecil saat n/N sangat kecil.

Untuk desain bertingkat, FPC dapat berada pada level sampling stage tertentu.

Jangan memasukkan FPC bila desain/dokumentasi tidak mendukung.

Formulasi kunci

Contoh aplikasi

Jika N=10.000 dan n=2.000, FPC≈0,894: standard error turun sekitar 10,6% dibanding populasi tak berhingga.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

25 of 44

Workflow R: Mendeklarasikan Desain

SECTION 6

25

S2 Statistika Terapan FMIPA Unpad

Sebelum model, buat design object: ids, strata, weights, fpc.

Gunakan nesting bila PSU tersarang dalam strata.

Periksa distribusi bobot: nilai ekstrem dapat membuat estimasi tidak stabil.

Simpan metadata desain di laporan agar analisis reproducible.

Formulasi kunci

Contoh aplikasi

Setelah design object benar, analisis mean, total, proporsi, dan regresi dapat memakai fungsi survey secara konsisten.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

26 of 44

Studi Kasus: Populasi Sintetik

SECTION 6

26

S2 Statistika Terapan FMIPA Unpad

Bangun populasi N=10.000 dengan strata, cluster, x1, x2, dan outcome y.

Buat probabilitas seleksi yang bergantung pada kovariat untuk mensimulasikan informative sampling.

Bandingkan SRS, stratified proportional allocation, dan PPS sederhana.

Tujuan: melihat kapan bobot dan design-based SE mengubah simpulan.

Formulasi kunci

Contoh aplikasi

Simulasi seperti ini cocok untuk mengajar: mahasiswa melihat secara konkret mengapa “ambil lm() saja” kadang kurang aman.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

27 of 44

Tiga Mekanisme Sampling dalam Contoh

SECTION 6

27

S2 Statistika Terapan FMIPA Unpad

SRS: setiap unit memiliki peluang sama.

Stratified proportional: n_h mengikuti proporsi N_h.

PPS-like: peluang seleksi meningkat ketika p_select tinggi.

Perbedaan mekanisme sampling menghasilkan distribusi X yang berbeda dalam sampel.

Formulasi kunci

Contoh aplikasi

Pada PPS, OLS dapat terlalu mewakili unit besar/lebih mudah terpilih bila bobot tidak digunakan.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

28 of 44

OLS vs WLS: Apa yang Dibandingkan?

SECTION 6

28

S2 Statistika Terapan FMIPA Unpad

OLS unweighted menjawab hubungan pada distribusi sampel.

WLS/IPW mencoba mengembalikan representasi ke distribusi populasi.

Jika semua bobot sama, OLS dan WLS memberi koefisien sama.

Jika bobot berasosiasi dengan X atau Y, koefisien dapat berubah.

Formulasi kunci

Contoh aplikasi

Bandingkan tanda, besaran, dan ketidakpastian. Jangan hanya membandingkan p-value; p-value itu drama kecil, estimand itu plot utamanya 😄.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

29 of 44

Interpretasi svyglm

SECTION 6

29

S2 Statistika Terapan FMIPA Unpad

Koefisien: perubahan rata-rata respons populasi target untuk kenaikan satu unit prediktor, dengan kovariat lain tetap.

SE: ketidakpastian yang memperhitungkan bobot dan struktur desain.

Derajat bebas sering terkait jumlah PSU/strata, bukan hanya jumlah individu.

Output harus dibaca bersama dokumentasi desain survei.

Formulasi kunci

Contoh aplikasi

Dalam laporan, tulis: “Analisis menggunakan bobot sampling; SE dihitung dengan Taylor linearization, strata dan PSU sesuai metadata survei.”

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

30 of 44

Ukuran Sampel Dalam Regresi

SECTION 6

30

S2 Statistika Terapan FMIPA Unpad

Tidak ada satu angka universal untuk regresi.

n bergantung pada effect size, jumlah prediktor, korelasi antar-X, error variance, power, dan alpha.

Untuk desain survei, n nominal harus dikoreksi DEFF dan nonresponse.

Simulasi power paling transparan ketika model kompleks atau asumsi analitik sulit.

Formulasi kunci

Contoh aplikasi

Riset tesis: tentukan minimum effect of substantive interest, bukan sekadar “berapa n minimal agar lolos seminar”.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

31 of 44

Power untuk Koefisien βj

SECTION 6

31

S2 Statistika Terapan FMIPA Unpad

Power adalah peluang menolak H0 ketika efek benar-benar ada.

Untuk uji dua sisi, sinyal harus cukup besar dibanding standard error.

SE menurun saat n naik, tetapi multikolinearitas membuat SE tetap besar.

Power analysis perlu effect size yang realistis dan bermakna substantif.

Formulasi kunci

Contoh aplikasi

Untuk slope kecil tetapi penting secara kebijakan, n yang dibutuhkan bisa jauh lebih besar daripada rule-of-thumb 10 observasi per prediktor.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

32 of 44

Partial R² dan Cohen’s f²

SECTION 6

32

S2 Statistika Terapan FMIPA Unpad

Partial R² mengukur tambahan variasi yang dijelaskan prediktor setelah kovariat lain dikontrol.

Cohen’s f² adalah transformasi partial R² untuk power regression.

Benchmark kecil/sedang/besar hanya panduan; konteks substantif lebih penting.

Untuk blok prediktor, gunakan u = jumlah prediktor yang diuji.

Formulasi kunci

Contoh aplikasi

Jika variabel kebijakan hanya menambah R² parsial 0,03 tetapi penting, power analysis harus menghormati efek kecil itu.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

33 of 44

Rumus Praktis Ukuran Sampel Regresi

SECTION 6

33

S2 Statistika Terapan FMIPA Unpad

Pendekatan praktis menggunakan kuantil normal untuk α dan power.

Tambahkan p+1 untuk total prediktor dan intersep.

Formula ini aproksimasi; untuk sampel kecil gunakan noncentral F atau paket pwr.

Hasil harus dinaikkan oleh DEFF jika desain survei kompleks.

Formulasi kunci

Contoh aplikasi

Dengan α=0,05, power=0,80, f²=0,15, p=5, diperoleh sekitar n=59 sebelum penyesuaian desain.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

34 of 44

Penyesuaian DEFF untuk Power

SECTION 6

34

S2 Statistika Terapan FMIPA Unpad

DEFF adalah rasio variance desain aktual terhadap variance SRS dengan n yang sama.

Ukuran sampel desain kira-kira DEFF kali ukuran sampel SRS.

DEFF dapat diestimasi dari survei serupa atau diasumsikan sebagai skenario konservatif.

Untuk cluster sampling, DEFF tumbuh bersama ukuran cluster rata-rata dan ICC.

Formulasi kunci

Contoh aplikasi

Jika nSRS=59 dan DEFF=2, maka ndesign≈118. Tambahkan lagi inflasi nonresponse bila perlu.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

35 of 44

pwr dan Simulasi Power

SECTION 6

35

S2 Statistika Terapan FMIPA Unpad

pwr.f2.test menghitung power regresi berdasarkan Cohen’s f².

Simulasi memungkinkan korelasi antar-X, distribusi nonnormal, missingness, dan desain kompleks.

Gunakan beberapa skenario agar rencana sampel tahan terhadap asumsi yang meleset.

Laporkan seed, parameter, jumlah replikasi, dan kriteria keberhasilan.

Formulasi kunci

Contoh aplikasi

Untuk proposal, lampirkan skenario n: optimistis, realistis, konservatif. Reviewer senang; anggaran mungkin sedikit panik.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

36 of 44

Effective Sample Size

SECTION 6

36

S2 Statistika Terapan FMIPA Unpad

n nominal adalah jumlah observasi; n efektif adalah informasi yang tersedia setelah desain diperhitungkan.

Bobot ekstrem dapat menurunkan effective sample size meski n besar.

Cluster dengan ICC tinggi menurunkan informasi independen.

Gunakan ESS untuk menjelaskan mengapa SE lebih besar daripada OLS biasa.

Formulasi kunci

Contoh aplikasi

Dua survei sama-sama n=1.000 dapat memiliki presisi berbeda jika satu menggunakan bobot ekstrem dan cluster besar.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

37 of 44

Topik Tambahan: Clustering Regression

SECTION 6

37

S2 Statistika Terapan FMIPA Unpad

Clustering regression mencari subkelompok dengan hubungan Y–X yang berbeda.

Ia dekat dengan mixture of regressions: setiap cluster memiliki parameter regresi sendiri.

Cluster dapat diketahui dari strata, ditemukan oleh algoritme, atau dimodelkan secara probabilistik.

Tantangan: jumlah cluster, local optima, identifiability, dan interpretasi label.

Formulasi kunci

Contoh aplikasi

Segmentasi pasar: kelompok pelanggan A dan B bisa memiliki slope harga–permintaan yang berbeda.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

38 of 44

Mixture of Regressions

SECTION 6

38

S2 Statistika Terapan FMIPA Unpad

Keanggotaan cluster diperlakukan sebagai variabel laten zᵢ.

Likelihood total adalah campuran likelihood regresi per komponen.

Estimasi sering menggunakan EM, MCMC, atau optimisasi dengan banyak restart.

Label switching perlu diperhatikan pada pendekatan Bayesian mixture.

Formulasi kunci

Contoh aplikasi

Dalam data kesehatan, respons terapi dapat mengikuti pola berbeda untuk subpopulasi laten, bukan hanya satu slope global.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

39 of 44

Regresi Per Strata Ketika Label Diketahui

SECTION 6

39

S2 Statistika Terapan FMIPA Unpad

Jika strata diketahui dan bermakna kebijakan, regresi per strata mudah ditafsirkan.

Alternatif: satu model dengan interaksi strata × prediktor.

Regresi per strata dapat tidak stabil jika n_h kecil.

Multilevel model dapat memberi partial pooling antarstrata.

Formulasi kunci

Contoh aplikasi

Kota vs desa: efek pendidikan terhadap pendapatan dapat berbeda; interaksi memberi uji formal perbedaan slope.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

40 of 44

Clustering Regression Tanpa Label Strata

SECTION 6

40

S2 Statistika Terapan FMIPA Unpad

Ketika strata tidak diketahui, cluster dapat dicari dari pola X dan Y.

K-means pada (x,y) adalah baseline eksploratif, tetapi bukan model regresi mixture penuh.

Gunakan validasi stabilitas agar cluster bukan artefak satu inisialisasi.

Jumlah cluster harus dipilih berdasarkan teori, validasi, atau kriteria model.

Formulasi kunci

Contoh aplikasi

Dalam survei UMKM, cluster dapat merepresentasikan pola usaha mikro dan kecil yang memiliki hubungan modal–omzet berbeda.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

41 of 44

Weighted Clustering Regression

SECTION 6

41

S2 Statistika Terapan FMIPA Unpad

Jika data berasal dari survei kompleks, bobot perlu dipertimbangkan dalam clustering dan regresi.

Weighted clustering membuat unit berpengaruh sesuai representasi populasi.

Regresi per cluster kemudian juga dapat menggunakan bobot sampling.

Interpretasi cluster tetap eksploratif; jangan menyamakan cluster laten dengan strata desain resmi tanpa validasi.

Formulasi kunci

Contoh aplikasi

Weighted clustering regression cocok untuk eksplorasi heterogenitas hubungan pada survei nasional dengan bobot tidak sama.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

42 of 44

Contoh Aplikasi Nyata

SECTION 6

42

S2 Statistika Terapan FMIPA Unpad

Ekonomi rumah tangga: hubungan pendidikan, usia, wilayah, dan pendapatan dengan bobot survei.

Kesehatan masyarakat: outcome penyakit dan akses layanan dengan desain klaster puskesmas/desa.

Pendidikan: siswa tersarang dalam sekolah dan strata wilayah.

Official statistics: model populasi harus menjaga estimand dan ketidakpastian berbasis desain.

Formulasi kunci

Contoh aplikasi

Untuk mahasiswa, minta mereka menulis dulu desain survei sebelum menulis rumus regresi. Rumus tanpa desain itu seperti GPS tanpa peta.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

43 of 44

Checklist Pelaporan Regresi Survei

SECTION 6

43

S2 Statistika Terapan FMIPA Unpad

Sebutkan populasi target, frame, desain sampling, strata, PSU/cluster, dan bobot.

Jelaskan apakah bobot final mencakup nonresponse dan calibration.

Laporkan metode variance estimation: Taylor, BRR, jackknife, bootstrap, atau cluster-robust.

Bandingkan analisis sensitif: unweighted, weighted, dan design-based bila relevan.

Tulis keterbatasan: nonresponse, coverage error, bobot ekstrem, atau domain kecil.

Formulasi kunci

Contoh aplikasi

Checklist ini bisa langsung dipakai sebagai template bagian “Metode Analisis Data” pada tesis atau artikel.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.

44 of 44

Kesimpulan Section 6

SECTION 6

44

S2 Statistika Terapan FMIPA Unpad

Desain sampling menentukan representativitas dan validitas inferensi regresi.

Bobot mengoreksi unequal inclusion probabilities; design-based SE mengoreksi struktur ketergantungan.

FPC, DEFF, dan nonresponse harus masuk dalam perencanaan ukuran sampel.

Survey regression dan weighted clustering regression memperluas regresi agar sesuai dengan data survei kompleks.

Pesan utama: jangan hanya menanyakan “model apa?”, tanyakan juga “datanya datang dari desain apa?”

Formulasi kunci

Contoh aplikasi

Section berikutnya dapat melanjutkan ke model lanjutan atau aplikasi sesuai struktur materi.

Desain sampling menentukan siapa mewakili siapa; regresi menentukan hubungan apa yang diestimasi.