Conoce la estadística inferencial

CONOCE LA ESTADÍSTICA INFERENCIAL


ÍNDICE

1- Introducción        3

2- La distribución de densidad de probabilidad y la distribución normal        3

La muestra y la población        3

La distribución de densidad de probabilidad        4

La distribución Normal        6

¿Cómo utilizar la distribución Normal con datos reales?        8

Take away        9

3- Los tipos de funciones de probabilidad y la generación de muestras aleatorias        10

Los dos tipos de funciones        10

Distribuciones continuas – densidad de probabilidad        11

Distribuciones discretas – funciones de probabilidad        12

La esencia de una muestra: generación de muestras aleatorias        14

Take away        15

4- Los intervalos de confianza y su utilidad        16

Intervalos de confianza        16

Take away        20


1- Introducción

En esta lección vas a ver los conceptos fundamentales de la estadística inferencial. Más adelante en el bloque 5 entenderás y aplicarás técnicas para comparar medias y proporciones, asociar medidas y proporciones, y trabajarás con los modelos lineales generalizados. Para conseguirlo es importante nutrir las bases de los conceptos más relevantes que vas a utilizar.

Vas a descubrir:

2- La distribución de densidad de probabilidad y la distribución normal

La muestra y la población

La muestra y la población son los dos conceptos clave de la estadística inferencial. Hasta ahora hemos visto la estadística descriptiva, que es la rama de la estadística encargada de resumir/traducir una base de datos en gráficos y características numéricas (centralidad y dispersión) que se puedan interpretar. En cambio, la estadística inferencial es la rama de la estadística encargada de extraer conclusiones generales a partir de casos particulares. En nuestro caso, disponemos de una base de datos de una muestra poblacional y ese es nuestro caso particular, a partir del cual pretendemos inferir conclusiones generales de la población.

Un dibujo de una niña

Descripción generada automáticamente con confianza media

De esta manera, la estadística inferencial pretende obtener conclusiones del conjunto poblacional en base al estudio de la muestra.

La distribución de densidad de probabilidad

A continuación, veremos que es una distribución de densidad de probabilidad, nos centraremos en la distribución más famosa (la distribución normal), pero también mencionaremos otras.

El histograma de densidad es un histograma en el que la suma del área de las barras es igual a 1. Es decir, que al medir el área de todas las barras y sumarlas, el resultado es 1. En este caso, la altura del histograma no depende del rango de clases ya que el eje vertical está en densidad de frecuencia, y la suma de las áreas de todas las barras siempre será 1 (independientemente de que haya más o menos rangos). La altura (en densidad de frecuencia) multiplicada por la amplitud de la clase, es el área de una barra (base x altura). Aunque haya más clases, la altura se mantiene constante.

Gráfico, Histograma

Descripción generada automáticamente

Vamos a comprobar esto con un pequeño ejemplo. En la siguiente imagen se observan dos histogramas. A la izquierda el correspondiente a la variable altura de una muestra de 100 personas, y a la derecha el correspondiente a una muestra de 1000 personas. La forma es muy parecida, aunque en el de la derecha se intuye una forma más fina.

Gráfico, Histograma

Descripción generada automáticamente

Si seguimos cogiendo más personas y aumentando la muestra, como por ejemplo 10.000 o 100.000 personas, podremos hacer un histograma mucho más continuo y fino.

Gráfico, Histograma

Descripción generada automáticamente

Nos estamos acercando al concepto de densidad de probabilidad. Una muestra muy muy grande se acerca a la información de toda la población, cuanto más se acerque el número de individuos de la muestra al número de individuos de la población, mejor la representará. La información de 1.000.000 de individuos está cerca de toda la población.

El histograma de densidad es parecido a la distribución de densidad de probabilidad. Cuando nuestra muestra tiende a infinito, este histograma se comporta como una función continua. En este caso, es una distribución normal cuya centralidad es la media de la población (μ) y una dispersión que es la desviación estándar poblacional (σ) (poblacional porque hablamos de una muestra infinitamente grande, que representa a la población).

Gráfico, Histograma

Descripción generada automáticamente

De esta manera, el contorno del histograma de densidad de una muestra muy muy grande es la distribución de densidad de probabilidad. El área total de esta función es 1, y… ¡es sinónimo de probabilidad!

La distribución Normal

Profundizaremos más en este concepto con ayuda de la distribución normal, que es la más famosa y tiene gran utilidad. Como hemos visto, tenemos dos parámetros importantes en una distribución de densidad de probabilidad, la media de la población (μ) y la desviación estándar de la población (σ) (medidas de centralidad y dispersión respectivamente).

La forma de montaña simétrica es la distribución normal. Muchas de las variables cuantitativas que medimos tienen este tipo de distribución, como por ejemplo la altura o peso de la población, y por eso recibe el nombre de distribución normal y es tan famosa y utilizada. El contorno de esta distribución es una función de densidad de probabilidad. Está función se puede expresar mediante una fórmula matemática conocida, que se muestra a continuación. Esta fue ideada por un matemático llamado Gauss (por eso también se habla de “campana de Gauss”).

Gráfico, Histograma

Descripción generada automáticamenteDiagrama

Descripción generada automáticamente

El área que se genera debajo de la curva es la probabilidad. Si quiero saber cuál es la probabilidad de escoger una persona de esta población al azar, y que su altura esté entre 1,6 y 1,8 metros, basta con calcular el área debajo de la curva que se genera al delimitar el contorno el histograma con los extremos del rango de alturas. Es la integral de la función de densidad de probabilidad desde un extremo al otro. Por eso se llama densidad de probabilidad. En este ejemplo, al limitar la función desde una altura a otra, se genera un área con un valor de 0,56. Lo que quiere decir que 56 de cada 100 personas de la población, se encuentran en una altura entre los 160 y 180 cm. Si escojo a una persona al azar de esta población tengo un 56% de probabilidad de que su altura esté entre 160 y 180 cm. Este es el concepto de probabilidad, y la podemos obtener a partir de la integral de la distribución de densidad de probabilidad (pero no te preocupes, esto lo puede hacer un software, no hace falta calcularlo a mano, ¡ni con tablas!).

Gráfico, Histograma

Descripción generada automáticamente

La distribución normal es una función simétrica, que tiene un boxplot completamente simétrico. Si nos fijamos, veremos que, en una distribución normal perfecta, la media será siempre igual a la media (cuartil 2), el cuartil 1 estará siempre en -0,67 σ, el cuartil 3 estará siempre a 0,67 σ, etc. Estas reglas siempre se cumplen.

Gráfico, Histograma

Descripción generada automáticamente

¿Cómo utilizar la distribución Normal con datos reales?

La media

Siempre que la población se comporte como una distribución normal se cumple que:

De esta manera, en la siguiente población, cuya media es 66,5 y desviación estándar 18 kg, se cumple que:

Gráfico, Histograma

Descripción generada automáticamente

Como venimos viendo, hay dos conceptos importantes: la centralidad y la dispersión. Al igual que pasaba con los histogramas, pasa con la distribución normal: la centralidad sitúa la distribución en el eje horizontal y la dispersión indica lo ancha o estrecha que es la distribución. A mayor variabilidad, mayor es el ancho de la distribución y más bajita será. A continuación, vemos dos distribuciones normales: f1 es más baja que f2 porque tiene una desviación estándar mayor (sombreada).  

Diagrama

Descripción generada automáticamente

Take away

Lo más importante de la lección:

3- Los tipos de funciones de probabilidad y la generación de muestras aleatorias

En esta lección veremos las distribuciones de probabilidad más comunes. Ya hemos visto la distribución normal que es una función continua en forma de campana que podrías dibujar con el lápiz. Esta distribución es continua y por eso hablamos de densidad de probabilidad. Pero hay más distribuciones de probabilidad, dependiendo del tipo de variable que tengamos. Si tenemos una variable que es cualitativa o discreta, la distribución de probabilidad que emplearemos será de proporciones, en lugar de densidad.

Los dos tipos de funciones

De esta manera, podemos definir dos tipos de distribuciones, según el tipo de variable:

Gráfico, Gráfico de dispersión

Descripción generada automáticamente

Gráfico, Gráfico de líneas

Descripción generada automáticamente

Estos son los dos tipos de distribuciones principales, la discreta y la continua. A continuación, vamos a profundizar un poco más en ambos conceptos.

Distribuciones continuas – densidad de probabilidad

Dentro de las distribuciones continuas, que son densidades de probabilidad, encontramos distintos tipos:

Gráfico, Diagrama, Histograma

Descripción generada automáticamente

Gráfico, Diagrama, Histograma

Descripción generada automáticamente

Al final esto son funciones matemáticas que más o menos representan los histogramas de nuestras muestras. Esto es muy potente, porque si podemos representar mediante una función matemática un histograma de unos datos que tenemos, seremos mucho más eficaces para calcular probabilidades. Por eso existen tantos tipos de densidades de probabilidad, aquí hemos visto cuatro, pero existen más.

Distribuciones discretas – funciones de probabilidad

Dentro de las distribuciones discretas, que son funciones de probabilidad, encontramos distintos tipos:

Gráfico, Gráfico de dispersión

Descripción generada automáticamenteGráfico, Gráfico de dispersión

Descripción generada automáticamente

Distribución PERSONALIZADA: por último, podemos personalizar nuestra distribución. En este caso, tenemos una variable de contaje que va del 1 al 10 (por ejemplo, las notas de un examen). Vemos que lo más probable es obtener un 6 (50%) o alrededor de 6.

Tabla

Descripción generada automáticamenteGráfico, Histograma

Descripción generada automáticamente

La esencia de una muestra: generación de muestras aleatorias

Par practicar todo esto, hablaremos de la esencia de la muestra, la generación de números y muestras aleatorias. Es decir, a partir de distribuciones de probabilidad, podemos generar muestras. Esto es muy potente porque nos ayudará a entender las distribuciones de densidad de probabilidad y el concepto de muestra y población. Podemos obtener muestras a partir de una distribución continua (de densidades) o a partir de una distribución discreta (de proporciones).

Cuando recogemos datos, partimos de una población que tiene una distribución de densidad de probabilidad que imaginemos que es normal. Mediante un muestreo de esa población obtendremos datos de una variable, por ejemplo, del peso de la población (kg). Ese conjunto de datos constituye la muestra y pueden ser representados mediante técnicas de estadística descriptiva, donde intentaremos ver si la muestra sigue una distribución normal, que indicará que la población también lo hace. Esto da lugar a la inferencia que es el paso en el que, sin saber nada de la población a priori, intentamos inferir información de la misma a partir de la muestra, por ejemplo: que distribución sigue la población, donde está la media poblacional, etc.

  Diagrama

Descripción generada automáticamente

Lo que vamos a trabajar ahora es la parte de arriba de este gráfico, a partir de funciones de densidad conocidas vamos a obtener muestras, de esta forma entenderemos mucho mejor el concepto de población y el de muestra.

Take away

Lo más importante de la lección:

4- Los intervalos de confianza y su utilidad

En esta lección veremos que es un intervalo de confianza y como se puede utilizar.

Intervalos de confianza

Vamos a introducir este concepto a través de un ejemplo. Trataremos datos de una variable continua que expresa el índice de discapacidad: Oswestry Disability Index (ODI). Cuanto mayor es este índice, mayor es la discapacidad que sufren los pacientes a causa del dolor de espalda.

En base a nuestros datos podemos representar la distribución de la variable y construir un histograma. Vemos que este histograma sigue más o menos una distribución normal (es casi simétrica con forma de montaña), de lo que deducimos que el 95% de la muestra se encuentra entre la media ± 2 veces la desviación estándar.

Tabla

Descripción generada automáticamente con confianza baja

Gráfico, Histograma

Descripción generada automáticamente

Texto

Descripción generada automáticamente

De esta manera, en nuestro caso obtenemos un promedio de la muestra de 64,16 y una desviación estándar de 14,11. Podemos afirmar que el 95% de la muestra estará entre 35,94 (media – 2 veces la desviación estándar = 64,16 – 2*14,11) y 92,38 (media + 2 veces la desviación estándar = 64,16 + 2*14,11).

Es decir, a partir de la información de la muestra consideramos que la distribución de la variable es más o menos normal y por eso podemos aplicar esta regla y asumir que el 95% de los individuos de la muestra se encuentran en ese rango de valores.

Pero podemos ir un paso más allá. Tenemos la descripción de nuestros datos, hemos trabajado con la centralidad y la dispersión de la muestra, hemos trabajado con un gráfico de distribución, etc. Ahora lo que queremos es pasar de la información de los datos que tenemos en la muestra a información de la población, de individuos de los que no tenemos datos.

¿Es posible, a partir de la información de la muestra, determinar aspectos de la población completa?, ¿podemos saber dónde está la media de toda la población a partir de los datos de una pequeña parte de ella (muestra)?

Diagrama

Descripción generada automáticamente

Esto es lo que se consigue utilizando los intervalos de confianza. Se consiguen unos rangos que nos permiten saber dónde se encuentra la media de la población. En este sentido, se ha demostrado que la distribución de las medias de las muestras posibles de una población sigue una distribución normal.

Veamos un ejemplo para entenderlo un poco mejor. Imaginemos que partimos de una población de la que se van extrayendo diferentes muestras aleatorias de 200 pacientes y vamos calculando el promedio de cada una de estas muestras.

Diagrama

Descripción generada automáticamente

Estas medias pueden dar lugar a una nueva variable que se llame “media de la muestra”, donde cada muestra de 200 pacientes aportaría un valor diferente (promedia de la muestra 1 sería el valor 1, promedio de la muestra 2 sería el valor 2, etc.). Si analizamos la distribución de esta nueva variable (media de la muestra, representada a continuación) veremos cómo sigue una distribución normal. Se ha demostrado que esto ocurre siempre, independientemente de la distribución de la población (da igual que sea uniforme, exponencial, etc.), la distribución de las medias muestrales siempre sigue una distribución normal. La gracia de todo esto es que la media de esta distribución (de la variable media muestral) es más o menos igual a la media poblacional, y que la desviación estándar es el error estándar de la media poblacional.

Gráfico, Histograma

Descripción generada automáticamente

Esto es muy potente porque nos permite, a partir de una muestra, saber dónde está la media de la población. La media de esta distribución (media muestral) coincidiría con la media poblacional ( = μ) y la dispersión (σ), que es el error estándar (EE), es la desviación estándar de la muestra entre la raíz cuadrada del número de observaciones de la muestra (Sx/√n).

Gráfico, Histograma

Descripción generada automáticamente

Aquí ya podemos trabajar con las reglas que conocemos. Podemos definir el intervalo de confianza de la media de la población al 95% a partir de la media de la muestra ± 1,96 veces el error estándar. Esto es extremadamente potente porque permite saber dónde está la media de la población a partir de los datos de la muestra. Puede ser calculado con una confianza del 95% a partir de la media de la muestra ± 1,96 veces el error estándar o con una confianza del 99% utilizando la media de la muestra ± 2,33 veces el error estándar.

Aplicando estas reglas en el ejemplo anterior, en el cual la media muestral era 64,16 y la desviación estándar 14,11, podemos afirmar que:

Texto, Carta

Descripción generada automáticamente

Texto, Carta

Descripción generada automáticamenteTexto, Carta

Descripción generada automáticamente

Escala de tiempo

Descripción generada automáticamente

Take away

Lo más importante de la lección: