Inferencia causal · Cap. 3: Describir variables
01
INFERENCIA CAUSAL II
Describir variables
antes de explicar el mundo
Basado en The Effect, capítulo 3 · Seminario de Investigación Económica
UASD
Inferencia causal · Cap. 3: Describir variables
02
El error silencioso
Creer que una variable es solo una columna en Excel.
Una variable no es una columna.
Es una forma comprimida de mirar el mundo.
La clase de hoy parece “estadística básica”. No lo es. Es el piso mínimo para no decir disparates causales después.
Inferencia causal · Cap. 3: Describir variables
03
Ruta de la clase
Lo que deben poder hacer al final.
Distinguir tipos de variables sin confundir escala con significado.
Leer una distribución como una historia: centro, dispersión, asimetría y colas.
Elegir entre media, mediana, desviación estándar e IQR según el problema.
Entender por qué la muestra observada no es “la verdad”, sino una pista sobre ella.
Conectar descripción de variables con inferencia y diseño de investigación.
Inferencia causal · Cap. 3: Describir variables
04
¿Por qué esto después de hablar de preguntas?
Porque toda pregunta empírica termina aterrizando en variables.
Investigamos cuando convertimos una curiosidad en observaciones estructuradas.
Esas observaciones toman forma de variables: ingreso, edad, informalidad, precio, mortalidad, educación.
Describir bien una variable es aprender qué tipo de evidencia tienes entre manos.
Inferencia causal · Cap. 3: Describir variables
05
Variable
Una serie de observaciones de la misma medición.
Ingreso mensual de 433 hogares.
Número de fusiones por año en Francia.
Nivel educativo alcanzado.
Provincia de residencia.
Texto de un titular de periódico.
La pregunta no es solo “¿qué número tengo?”. La pregunta seria es: ¿qué tipo de cosa estoy observando y qué resumen respeta su naturaleza?
Inferencia causal · Cap. 3: Describir variables
06
Cinco tipos de variables
No todas se describen igual.
Continuas
pueden tomar valores dentro de un rango
Conteo
cuentan ocurrencias
Ordinales
tienen orden, pero no distancia clara
Categóricas/binarias
clasifican en grupos
Cualitativas
texto/detalle no numérico
Inferencia causal · Cap. 3: Describir variables
07
Continuas y de conteo
Parecen numéricas, pero no funcionan igual.
Continua
Ingreso, precio, edad exacta, productividad.
Puede existir 20,000.25 entre 20,000 y 20,001.
Conteo
Número de hijos, homicidios, fusiones, llamadas al 911.
No puede ser negativo ni fraccionario.
El tipo de variable ya te está diciendo qué gráficos y modelos tienen sentido.
Inferencia causal · Cap. 3: Describir variables
08
Ordinal, categórica y binaria
Orden no es lo mismo que distancia.
Ordinal: “bajo, medio, alto”. Sabemos el orden, no cuánto separa cada nivel.
Categórica: provincia, sector económico, color de flor. Las categorías son distintas, no “más” o “menos”.
Binaria: sí/no. Es especial porque aparece naturalmente en tratamientos: recibió política / no recibió política.
Inferencia causal · Cap. 3: Describir variables
09
Variables cualitativas
Cuando el dato viene cargado de significado.
Ejemplo: titulares de prensa, respuestas abiertas, sentencias, narrativas de entrevistas.
Para analizarlas cuantitativamente, muchas veces se transforman: “¿menciona al presidente?” sí/no; “¿cuántas veces aparece inflación?” conteo.
El problema no es convertir texto en números.
El problema es perder el significado en el camino.
Inferencia causal · Cap. 3: Describir variables
10
Distribución
Cómo se reparten los valores de una variable.
Una distribución responde: ¿qué valores aparecen y con qué frecuencia?
Para variables categóricas u ordinales: tabla de frecuencia o gráfico de barras.
Para continuas: histogramas, densidades y áreas bajo la curva.
Después resumimos: centro, variación, asimetría y colas.
Inferencia causal · Cap. 3: Describir variables
11
Figura 3.1: frecuencia y barras
La distribución completa de una variable categórica.
Cada barra representa una categoría.
La altura dice cuántas observaciones caen ahí.
Si hay pocas categorías, la barra muestra casi todo lo que hay que saber.
Inferencia causal · Cap. 3: Describir variables
12
Figura 3.2: histograma
Cuando la variable es continua, agrupamos en intervalos.
No preguntamos por un valor exacto.
Preguntamos por rangos: 20k–40k, 40k–80k, etc.
La forma del histograma revela concentración y colas.
Inferencia causal · Cap. 3: Describir variables
13
Figura 3.3: de bins a densidad
El histograma se vuelve más fino hasta parecer una curva.
Idea clave: mientras los intervalos se estrechan y hay suficientes datos, la distribución empieza a parecer una curva continua.
Esa curva nos permite hablar de probabilidades como áreas bajo la distribución.
Inferencia causal · Cap. 3: Describir variables
14
Figura 3.4: área bajo la curva
La probabilidad vive debajo de la densidad.
El área sombreada representa un rango de valores.
El porcentaje del área total equivale a la probabilidad de caer en ese rango.
No es altura: es área. Ese detalle evita muchas malas interpretaciones.
Inferencia causal · Cap. 3: Describir variables
15
Resumir una distribución
Porque mirar toda la curva a veces es demasiado.
Centro
Media, mediana, percentiles.
Variación
Rango, varianza, desviación estándar, IQR.
Forma
Asimetría, colas, concentración.
Un buen resumen no reemplaza la distribución.
La comprime sin traicionarla.
Inferencia causal · Cap. 3: Describir variables
16
La media
El valor representativo… cuando los valores extremos no mandan demasiado.
Datos: 2, 5, 5, 6
(2 + 5 + 5 + 6) / 4 = 4.5
La media resume la distribución en un solo número.
Pesa cada valor por la frecuencia con que aparece.
Representa valores, no necesariamente una observación típica.
Advertencia: si hay datos muy sesgados, la media puede contar una historia técnicamente correcta pero socialmente engañosa.
Inferencia causal · Cap. 3: Describir variables
17
Figura 3.5: percentiles y mediana
Un percentil ubica observaciones, no solo valores.
Percentil 5: 5% de observaciones quedan por debajo.
Mediana: percentil 50; la observación del medio.
Cuando hay mucha asimetría, la mediana suele representar mejor lo “típico”.
Inferencia causal · Cap. 3: Describir variables
18
Media vs. mediana
El ejemplo que nunca falla: riqueza.
Media: sube muchísimo si entra una persona extremadamente rica.
Mediana: apenas cambia, porque una observación extrema cuenta como una observación más.
La media pregunta: ¿cuánto hay en promedio?
La mediana pregunta: ¿cómo luce alguien típico?
Inferencia causal · Cap. 3: Describir variables
19
Mínimo, máximo y rango
Útiles, pero frágiles.
Mínimo: valor más bajo observado.
Máximo: valor más alto observado.
Rango: máximo menos mínimo.
El rango muestra amplitud, pero puede ser dominado por un solo valor extremo.
Por eso el rango puede ser informativo en variables acotadas, pero peligroso en riqueza, ingreso, tamaño de empresa o descargas digitales.
Inferencia causal · Cap. 3: Describir variables
20
Figura 3.6: variación
Dos variables pueden tener centro parecido y comportarse distinto.
Curva alta y estrecha: poca variación.
Curva baja y ancha: mucha variación.
La dispersión dice cuán “predecible” es una observación alrededor del centro.
Inferencia causal · Cap. 3: Describir variables
21
Varianza
Promedio de las distancias cuadradas respecto a la media.
1. Calcular la media.
2. Restar la media a cada observación.
3. Elevar esas diferencias al cuadrado.
4. Sumarlas.
5. Dividir por n − 1 en la muestra.
Por qué importa: penaliza mucho las observaciones lejanas al centro. Por eso captura dispersión, pero queda en unidades cuadradas.
Inferencia causal · Cap. 3: Describir variables
22
Figura 3.7: desviación estándar
Volvemos a las unidades originales.
La desviación estándar es la raíz de la varianza.
Permite decir cuán lejos está una observación en términos comparables.
“0.38 desviaciones estándar por encima de la media” dice más que una diferencia bruta aislada.
Inferencia causal · Cap. 3: Describir variables
23
Figura 3.8: IQR
La dispersión de la mitad central de la muestra.
IQR = percentil 75 − percentil 25.
Cubre el 50% central de las observaciones.
Es menos sensible a colas y valores extremos que el rango o la varianza.
Inferencia causal · Cap. 3: Describir variables
24
Figura 3.9: asimetría
Cuando la distribución se inclina hacia una cola.
Ingreso personal suele tener cola derecha pesada.
Muchas observaciones bajas o medias; pocas observaciones enormes.
En datos económicos, esto es la regla, no la excepción.
Inferencia causal · Cap. 3: Describir variables
25
Figura 3.10: logaritmos
Una transformación puede domesticar una cola derecha.
El log reduce el peso relativo de valores enormes.
Diferencias pequeñas en logs se interpretan aproximadamente como porcentajes.
Cuidado: log(0) no existe; con ceros o negativos hay que pensar mejor.
Inferencia causal · Cap. 3: Describir variables
26
Muestra observada vs. distribución teórica
La estadística nace porque la muestra no es la verdad completa.
Dato observado
Lo que realmente medimos.
Estimación
Nuestra mejor inferencia desde la muestra.
Verdad teórica
La distribución de la población o proceso que generó los datos.
No queremos saber solo qué pasó en la muestra.
Queremos aprender algo sobre el mundo que la produjo.
Inferencia causal · Cap. 3: Describir variables
27
Notación sin trauma
Las letras cuentan una historia.
x: datos observados.
x̄: cálculo hecho con datos observados.
µ: verdad poblacional que no conocemos.
µ̂: estimación de esa verdad.
σ: desviación estándar verdadera; σ̂: su estimación.
En castellano: una cosa es lo que viste, otra lo que calculaste, otra lo que es verdad, y otra tu mejor aproximación a esa verdad.
Inferencia causal · Cap. 3: Describir variables
28
Figura 3.11: más datos, mejor aproximación
Pero solo a la distribución de donde salió la muestra.
Con 10 observaciones, la distribución observada puede ser ruidosa.
Con 100 mejora. Con 1,000 se acerca mucho más.
Pero si la muestra viene de un grupo sesgado, más datos no arreglan la población equivocada.
Inferencia causal · Cap. 3: Describir variables
29
Figura 3.12: normal y log-normal
Dos distribuciones teóricas que aparecen mucho.
Normal: simétrica, colas parecidas, útil en promedios y fenómenos con restricciones físicas.
Log-normal: sesgada a la derecha; al tomar log puede parecer normal.
Muchas variables económicas viven entre estas dos intuiciones.
Inferencia causal · Cap. 3: Describir variables
30
Pruebas de hipótesis
No prueban que tienes razón. Intentan descartar una versión de la verdad.
Elegir una descripción de la distribución teórica: por ejemplo, la media.
Determinar cómo se comportaría esa descripción en muestras aleatorias.
Calcular la misma descripción en tus datos.
Preguntar qué tan raro sería observar algo así si la hipótesis nula fuera cierta.
Si es demasiado raro, rechazamos esa hipótesis nula.
Inferencia causal · Cap. 3: Describir variables
31
Ejemplo del baloncesto
Media observada: 102 puntos; hipótesis nula: µ = 90.
Datos: N = 100, media = 102, desviación estándar ≈ 30.
Si µ = 90, el error estándar sería 30 / √100 = 3.
102 está 12 puntos por encima de 90:
cuatro errores estándar.
Conclusión: sería muy raro observar una media tan lejana si la verdadera media fuera 90. Eso permite rechazar esa hipótesis, no declarar “verdad absoluta”.
Inferencia causal · Cap. 3: Describir variables
32
La lección que importa
Describir variables no es trámite. Es disciplina intelectual.
Antes de explicar relaciones, hay que conocer las variables.
Antes de interpretar una media, hay que mirar la distribución.
Antes de usar logs, hay que entender ceros, colas y significado.
Antes de hablar de significancia, hay que saber qué hipótesis teórica estás intentando descartar.
Cuando entiendes tus variables, tu modelo deja de ser una caja negra.
Inferencia causal · Cap. 3: Describir variables
33
Puente a la próxima clase
De describir variables a describir relaciones.
Hoy preguntamos: ¿cómo se comporta una variable?
Luego preguntaremos: ¿qué me dice una variable sobre otra?
Ahí empieza el terreno donde la correlación se vuelve tentadora… y donde la causalidad se vuelve peligrosa si no pensamos con cuidado.