1 of 33

Inferencia causal · Cap. 3: Describir variables

01

INFERENCIA CAUSAL II

Describir variables

antes de explicar el mundo

Basado en The Effect, capítulo 3 · Seminario de Investigación Económica

UASD

2 of 33

Inferencia causal · Cap. 3: Describir variables

02

El error silencioso

Creer que una variable es solo una columna en Excel.

Una variable no es una columna.

Es una forma comprimida de mirar el mundo.

La clase de hoy parece “estadística básica”. No lo es. Es el piso mínimo para no decir disparates causales después.

3 of 33

Inferencia causal · Cap. 3: Describir variables

03

Ruta de la clase

Lo que deben poder hacer al final.

Distinguir tipos de variables sin confundir escala con significado.

Leer una distribución como una historia: centro, dispersión, asimetría y colas.

Elegir entre media, mediana, desviación estándar e IQR según el problema.

Entender por qué la muestra observada no es “la verdad”, sino una pista sobre ella.

Conectar descripción de variables con inferencia y diseño de investigación.

4 of 33

Inferencia causal · Cap. 3: Describir variables

04

¿Por qué esto después de hablar de preguntas?

Porque toda pregunta empírica termina aterrizando en variables.

Investigamos cuando convertimos una curiosidad en observaciones estructuradas.

Esas observaciones toman forma de variables: ingreso, edad, informalidad, precio, mortalidad, educación.

Describir bien una variable es aprender qué tipo de evidencia tienes entre manos.

5 of 33

Inferencia causal · Cap. 3: Describir variables

05

Variable

Una serie de observaciones de la misma medición.

Ingreso mensual de 433 hogares.

Número de fusiones por año en Francia.

Nivel educativo alcanzado.

Provincia de residencia.

Texto de un titular de periódico.

La pregunta no es solo “¿qué número tengo?”. La pregunta seria es: ¿qué tipo de cosa estoy observando y qué resumen respeta su naturaleza?

6 of 33

Inferencia causal · Cap. 3: Describir variables

06

Cinco tipos de variables

No todas se describen igual.

Continuas

pueden tomar valores dentro de un rango

Conteo

cuentan ocurrencias

Ordinales

tienen orden, pero no distancia clara

Categóricas/binarias

clasifican en grupos

Cualitativas

texto/detalle no numérico

7 of 33

Inferencia causal · Cap. 3: Describir variables

07

Continuas y de conteo

Parecen numéricas, pero no funcionan igual.

Continua

Ingreso, precio, edad exacta, productividad.

Puede existir 20,000.25 entre 20,000 y 20,001.

Conteo

Número de hijos, homicidios, fusiones, llamadas al 911.

No puede ser negativo ni fraccionario.

El tipo de variable ya te está diciendo qué gráficos y modelos tienen sentido.

8 of 33

Inferencia causal · Cap. 3: Describir variables

08

Ordinal, categórica y binaria

Orden no es lo mismo que distancia.

Ordinal: “bajo, medio, alto”. Sabemos el orden, no cuánto separa cada nivel.

Categórica: provincia, sector económico, color de flor. Las categorías son distintas, no “más” o “menos”.

Binaria: sí/no. Es especial porque aparece naturalmente en tratamientos: recibió política / no recibió política.

9 of 33

Inferencia causal · Cap. 3: Describir variables

09

Variables cualitativas

Cuando el dato viene cargado de significado.

Ejemplo: titulares de prensa, respuestas abiertas, sentencias, narrativas de entrevistas.

Para analizarlas cuantitativamente, muchas veces se transforman: “¿menciona al presidente?” sí/no; “¿cuántas veces aparece inflación?” conteo.

El problema no es convertir texto en números.

El problema es perder el significado en el camino.

10 of 33

Inferencia causal · Cap. 3: Describir variables

10

Distribución

Cómo se reparten los valores de una variable.

Una distribución responde: ¿qué valores aparecen y con qué frecuencia?

Para variables categóricas u ordinales: tabla de frecuencia o gráfico de barras.

Para continuas: histogramas, densidades y áreas bajo la curva.

Después resumimos: centro, variación, asimetría y colas.

11 of 33

Inferencia causal · Cap. 3: Describir variables

11

Figura 3.1: frecuencia y barras

La distribución completa de una variable categórica.

Cada barra representa una categoría.

La altura dice cuántas observaciones caen ahí.

Si hay pocas categorías, la barra muestra casi todo lo que hay que saber.

12 of 33

Inferencia causal · Cap. 3: Describir variables

12

Figura 3.2: histograma

Cuando la variable es continua, agrupamos en intervalos.

No preguntamos por un valor exacto.

Preguntamos por rangos: 20k–40k, 40k–80k, etc.

La forma del histograma revela concentración y colas.

13 of 33

Inferencia causal · Cap. 3: Describir variables

13

Figura 3.3: de bins a densidad

El histograma se vuelve más fino hasta parecer una curva.

Idea clave: mientras los intervalos se estrechan y hay suficientes datos, la distribución empieza a parecer una curva continua.

Esa curva nos permite hablar de probabilidades como áreas bajo la distribución.

14 of 33

Inferencia causal · Cap. 3: Describir variables

14

Figura 3.4: área bajo la curva

La probabilidad vive debajo de la densidad.

El área sombreada representa un rango de valores.

El porcentaje del área total equivale a la probabilidad de caer en ese rango.

No es altura: es área. Ese detalle evita muchas malas interpretaciones.

15 of 33

Inferencia causal · Cap. 3: Describir variables

15

Resumir una distribución

Porque mirar toda la curva a veces es demasiado.

Centro

Media, mediana, percentiles.

Variación

Rango, varianza, desviación estándar, IQR.

Forma

Asimetría, colas, concentración.

Un buen resumen no reemplaza la distribución.

La comprime sin traicionarla.

16 of 33

Inferencia causal · Cap. 3: Describir variables

16

La media

El valor representativo… cuando los valores extremos no mandan demasiado.

Datos: 2, 5, 5, 6

(2 + 5 + 5 + 6) / 4 = 4.5

La media resume la distribución en un solo número.

Pesa cada valor por la frecuencia con que aparece.

Representa valores, no necesariamente una observación típica.

Advertencia: si hay datos muy sesgados, la media puede contar una historia técnicamente correcta pero socialmente engañosa.

17 of 33

Inferencia causal · Cap. 3: Describir variables

17

Figura 3.5: percentiles y mediana

Un percentil ubica observaciones, no solo valores.

Percentil 5: 5% de observaciones quedan por debajo.

Mediana: percentil 50; la observación del medio.

Cuando hay mucha asimetría, la mediana suele representar mejor lo “típico”.

18 of 33

Inferencia causal · Cap. 3: Describir variables

18

Media vs. mediana

El ejemplo que nunca falla: riqueza.

Media: sube muchísimo si entra una persona extremadamente rica.

Mediana: apenas cambia, porque una observación extrema cuenta como una observación más.

La media pregunta: ¿cuánto hay en promedio?

La mediana pregunta: ¿cómo luce alguien típico?

19 of 33

Inferencia causal · Cap. 3: Describir variables

19

Mínimo, máximo y rango

Útiles, pero frágiles.

Mínimo: valor más bajo observado.

Máximo: valor más alto observado.

Rango: máximo menos mínimo.

El rango muestra amplitud, pero puede ser dominado por un solo valor extremo.

Por eso el rango puede ser informativo en variables acotadas, pero peligroso en riqueza, ingreso, tamaño de empresa o descargas digitales.

20 of 33

Inferencia causal · Cap. 3: Describir variables

20

Figura 3.6: variación

Dos variables pueden tener centro parecido y comportarse distinto.

Curva alta y estrecha: poca variación.

Curva baja y ancha: mucha variación.

La dispersión dice cuán “predecible” es una observación alrededor del centro.

21 of 33

Inferencia causal · Cap. 3: Describir variables

21

Varianza

Promedio de las distancias cuadradas respecto a la media.

1. Calcular la media.

2. Restar la media a cada observación.

3. Elevar esas diferencias al cuadrado.

4. Sumarlas.

5. Dividir por n − 1 en la muestra.

Por qué importa: penaliza mucho las observaciones lejanas al centro. Por eso captura dispersión, pero queda en unidades cuadradas.

22 of 33

Inferencia causal · Cap. 3: Describir variables

22

Figura 3.7: desviación estándar

Volvemos a las unidades originales.

La desviación estándar es la raíz de la varianza.

Permite decir cuán lejos está una observación en términos comparables.

“0.38 desviaciones estándar por encima de la media” dice más que una diferencia bruta aislada.

23 of 33

Inferencia causal · Cap. 3: Describir variables

23

Figura 3.8: IQR

La dispersión de la mitad central de la muestra.

IQR = percentil 75 − percentil 25.

Cubre el 50% central de las observaciones.

Es menos sensible a colas y valores extremos que el rango o la varianza.

24 of 33

Inferencia causal · Cap. 3: Describir variables

24

Figura 3.9: asimetría

Cuando la distribución se inclina hacia una cola.

Ingreso personal suele tener cola derecha pesada.

Muchas observaciones bajas o medias; pocas observaciones enormes.

En datos económicos, esto es la regla, no la excepción.

25 of 33

Inferencia causal · Cap. 3: Describir variables

25

Figura 3.10: logaritmos

Una transformación puede domesticar una cola derecha.

El log reduce el peso relativo de valores enormes.

Diferencias pequeñas en logs se interpretan aproximadamente como porcentajes.

Cuidado: log(0) no existe; con ceros o negativos hay que pensar mejor.

26 of 33

Inferencia causal · Cap. 3: Describir variables

26

Muestra observada vs. distribución teórica

La estadística nace porque la muestra no es la verdad completa.

Dato observado

Lo que realmente medimos.

Estimación

Nuestra mejor inferencia desde la muestra.

Verdad teórica

La distribución de la población o proceso que generó los datos.

No queremos saber solo qué pasó en la muestra.

Queremos aprender algo sobre el mundo que la produjo.

27 of 33

Inferencia causal · Cap. 3: Describir variables

27

Notación sin trauma

Las letras cuentan una historia.

x: datos observados.

x̄: cálculo hecho con datos observados.

µ: verdad poblacional que no conocemos.

µ̂: estimación de esa verdad.

σ: desviación estándar verdadera; σ̂: su estimación.

En castellano: una cosa es lo que viste, otra lo que calculaste, otra lo que es verdad, y otra tu mejor aproximación a esa verdad.

28 of 33

Inferencia causal · Cap. 3: Describir variables

28

Figura 3.11: más datos, mejor aproximación

Pero solo a la distribución de donde salió la muestra.

Con 10 observaciones, la distribución observada puede ser ruidosa.

Con 100 mejora. Con 1,000 se acerca mucho más.

Pero si la muestra viene de un grupo sesgado, más datos no arreglan la población equivocada.

29 of 33

Inferencia causal · Cap. 3: Describir variables

29

Figura 3.12: normal y log-normal

Dos distribuciones teóricas que aparecen mucho.

Normal: simétrica, colas parecidas, útil en promedios y fenómenos con restricciones físicas.

Log-normal: sesgada a la derecha; al tomar log puede parecer normal.

Muchas variables económicas viven entre estas dos intuiciones.

30 of 33

Inferencia causal · Cap. 3: Describir variables

30

Pruebas de hipótesis

No prueban que tienes razón. Intentan descartar una versión de la verdad.

Elegir una descripción de la distribución teórica: por ejemplo, la media.

Determinar cómo se comportaría esa descripción en muestras aleatorias.

Calcular la misma descripción en tus datos.

Preguntar qué tan raro sería observar algo así si la hipótesis nula fuera cierta.

Si es demasiado raro, rechazamos esa hipótesis nula.

31 of 33

Inferencia causal · Cap. 3: Describir variables

31

Ejemplo del baloncesto

Media observada: 102 puntos; hipótesis nula: µ = 90.

Datos: N = 100, media = 102, desviación estándar ≈ 30.

Si µ = 90, el error estándar sería 30 / √100 = 3.

102 está 12 puntos por encima de 90:

cuatro errores estándar.

Conclusión: sería muy raro observar una media tan lejana si la verdadera media fuera 90. Eso permite rechazar esa hipótesis, no declarar “verdad absoluta”.

32 of 33

Inferencia causal · Cap. 3: Describir variables

32

La lección que importa

Describir variables no es trámite. Es disciplina intelectual.

Antes de explicar relaciones, hay que conocer las variables.

Antes de interpretar una media, hay que mirar la distribución.

Antes de usar logs, hay que entender ceros, colas y significado.

Antes de hablar de significancia, hay que saber qué hipótesis teórica estás intentando descartar.

Cuando entiendes tus variables, tu modelo deja de ser una caja negra.

33 of 33

Inferencia causal · Cap. 3: Describir variables

33

Puente a la próxima clase

De describir variables a describir relaciones.

Hoy preguntamos: ¿cómo se comporta una variable?

Luego preguntaremos: ¿qué me dice una variable sobre otra?

Ahí empieza el terreno donde la correlación se vuelve tentadora… y donde la causalidad se vuelve peligrosa si no pensamos con cuidado.