Domina los conceptos del análisis

DOMINA LOS CONCEPTOS DEL ANÁLISIS


ÍNDICE

1- Introducción        3

2- ¿Qué es una hipótesis y como contestarla?        3

El contraste de hipótesis        3

¿Qué es una hipótesis?        3

Preguntas vs hipótesis        3

Un símil ¿Tengo fiebre?        3

Un ejemplo real de un contraste de hipótesis en investigación – recuperación LCA futbolistas profesionales        3

Definir el objetivo – la muestra y la población diana        4

Definir la pregunta de investigación        4

Los datos de mi investigación        4

Definimos la hipótesis        4

Calculamos el test estadístico (p-valor)        4

La metodología paso a paso        4

Take away        4

3- La Esencia de los Modelos Estadísticos        5

Inferir un modelo        5

¿Qué es un modelo predictivo?        5

¿Para qué sirve?        5

Utilidad nº1: La Estimación        5

Utilidad nº2: Relacionar        5

Los dos grandes retos de los modelos        5

Take away        5


1- Introducción

Hasta ahora, hemos trabajado conceptos de descripción y de inferencia. Y son completamente esenciales para poder describir y analizar datos con facilidad.

En este apartado seguimos con aspectos muy importantes de la inferencia. En esta lección vas a aprender una metodología para contestar hipótesis. También verás qué son los modelos estadísticos y sus aspectos clave.

A continuación, vas a descubrir:

2- ¿Qué es una hipótesis y como contestarla?

En esta lección veremos principalmente cuatro aspectos:

El contraste de hipótesis

El contraste de hipótesis es un camino de diferentes pasos que iremos comentando a lo largo de la lección.

¿Qué es una hipótesis?

Lo primero es entender que es una hipótesis, las preguntas que podemos contestar con un contraste de hipótesis. Al final lo que queremos son conclusiones generales de la población a partir de los datos que tenemos (la muestra). La cuestión aquí es hacerse preguntas que se puedan contestar.

La estadística no es una rama de las matemáticas, no es una ciencia exacta, sino que es interpretativa. Con los resultados que obtenemos, buscamos contestar las preguntas de manera interpretativa. La estadística nace para aportar respuestas a partir de datos (que vienen de la experimentación). Una hipótesis es una pregunta que puede tener como respuesta un SI o un NO (VERDADERO o FALSO).

Preguntas vs hipótesis

Ejemplos de preguntas:

Ejemplos de hipótesis:

El contraste de hipótesis nos va a permitir responder a estas preguntas. Consiste en una metodología, es un sistema que sirve para contestar preguntas de investigaciones en base a datos reales (experiencia) que permitan un SI o un NO como respuesta.

Un símil ¿Tengo fiebre?

Para dejar más claro el concepto de contraste de hipótesis utilizaremos un símil. Imagínate que tienes un mal estar general, dolor de cabeza, fríos y calores, la cabeza ardiendo, etc. Entonces sospechas que a lo mejor tienes fiebre.

Texto

Descripción generada automáticamenteTexto

Descripción generada automáticamenteTexto

Descripción generada automáticamente


En este caso, la hipótesis de investigación sería ¿tengo fiebre? Que solo admite como respuesta un SI o un NO, o es VERDADERO o es FALSO. De esta manera:

Imagen que contiene Diagrama

Descripción generada automáticamente

Para poder contestar la pregunta necesitamos un indicador, un número. En el caso de la fiebre el indicador que se utiliza es el termómetro, que mide la temperatura. Para contestar una hipótesis de investigación se utiliza un test estadístico cuya respuesta evalúa la probabilidad de error, de que se esté confundiendo (p-valor). En nuestro caso, si ponemos el termómetro y tenemos más de 37 decimos que nuestra hipótesis de investigación (H1 – que tengo fiebre) es cierta, si tenemos menos de 37 decimos que la hipótesis nula (H0 – NO tengo fiebre) es la cierta.

Un ejemplo real de un contraste de hipótesis en investigación – recuperación LCA futbolistas profesionales

Veremos un ejemplo real para entender el contraste de hipótesis y los pasos que se van siguiendo.

En este caso queremos comparar dos protocolos de rehabilitación para ver que tratamiento es más efectivo en jugadores profesionales que tras una operación del ligamiento cruzado interior utilizando autoinjertos de tendón patelar.

Los protocolos son dos, uno AGRESIVO (para que se recuperen más rápido) y otro NO AGRESVIO (tratamiento convencional). La pregunta que nos hacemos es, ¿cuál de ellos es mejor? ¿cómo lo podemos saber?

Definir el objetivo – la muestra y la población diana

En este punto, es importante definir la problemática que queremos resolver y el objetivo de nuestro análisis, a partir de lo cual será posible definir una población diana y el tipo de muestra necesaria.

En este caso hablamos de una lesión con consecuencias importantes para el futbolista y es una de las lesiones graves más recurrentes.

Mejorar la recuperación en jugadores profesionales de futbol utilizando autoinjertos de tendón patelar.

Todos los futbolistas profesionales con lesión de LCA que se han operado utilizando autoinjerto.

Dos grupos de futbolistas, control (con un tratamiento convencional) e investigación (con un tratamiento agresivo o novedoso) preferiblemente con diferentes rangos de edad y pesos diferentes.

Definir la pregunta de investigación

El primer paso es definir la hipótesis. La pregunta como investigador sería… ¿el protocolo agresivo es mejor que el convencional?, o dicho de otra manera… ¿el grupo experimental presenta mejoras con respecto al control? Esto podemos pasarlo a clave de variables, ¿qué variables nos definen mejor la recuperación? Quizá son variables que tienen que ver con la estabilidad de la rodilla. Hay un test (IKDC) que nos permite evaluar qué grado de estabilidad tiene la rodilla, a mayor grado, menor estabilidad. Otra opción es medir los milímetros que se desplaza la tibia con un aparato de medida.

La muestra consistirá en dos grupos de 30 jugadores operados cada uno. Un grupo será el control “no agresivo”, sobre el que se aplicará un tratamiento convencional y el otro grupo será el experimental, donde se aplicará un protocolo nuevo “agresivo”.

Los datos de mi investigación

De esta manera, tenemos una variable cualitativa que es el grado que mide la estabilidad de la rodilla y va desde grado 1 hasta grado 3 (mayor grado, menor estabilidad de rodilla) y una variable cuantitativa donde estamos midiendo en milímetros el desplazamiento de la tibia. Así conseguimos la siguiente tabla de datos, diferentes pacientes que pueden ser del grupo control o del grupo experimental y tenemos la estabilidad de la rodilla medida con dos variables diferentes, una cualitativa (IKDC) y otra cuantitativa (kt1000).

Interfaz de usuario gráfica, Aplicación

Descripción generada automáticamenteTabla

Descripción generada automáticamenteInterfaz de usuario gráfica

Descripción generada automáticamente

Definimos la hipótesis

Para simplificar vamos a trabajar solo con la variable cuantitativa, que mide la estabilidad de la rodilla en milímetros (mm).  

La Hipótesis de Investigación sería 🡪 H1: El protocolo Experimental (agresivo) aumenta la estabilidad en la rodilla en comparación con el protocolo Control (NO agresivo).

La Hipótesis Nula sería 🡪 H0: El protocolo Experimental (agresivo) NO aumenta la estabilidad en la rodilla en comparación con el protocolo Control (NO agresivo).

La hipótesis de investigación es el caso raro, o el que queremos demostrar. La hipótesis nula es simplemente la negación de la anterior. Esto podemos reescribirlo en clave a la variable que vamos a utilizar para comprobar esta hipótesis, de esta manera tendríamos que:

Calculamos el test estadístico (p-valor)

El siguiente paso es definir un margen de error y calcular el p-valor. Ya hemos definido las hipótesis de investigación y ahora vamos a utilizar una calculadora/software que nos permita calcular el p-valor, el cual nos permitirá decidir con que hipótesis nos quedamos, si con H1 o con H0.

Tabla

Descripción generada automáticamente

Interfaz de usuario gráfica, Texto, Aplicación, Chat o mensaje de texto

Descripción generada automáticamenteInterfaz de usuario gráfica, Texto, Aplicación, Chat o mensaje de texto

Descripción generada automáticamente

El p-valor es el resultado de un test estadístico y mide la probabilidad de error al aceptar una hipótesis de investigación cuando esta es falsa. El p-valor tiene valores entre 0 y 1, donde 0 es ninguna probabilidad y 1 es un error seguro. De esta manera, un test estadístico es un pequeño cálculo que a partir de los datos nos va a dar un p-valor, una probabilidad de error. En este caso el test estadístico nos ha dado un p-valor de 0,01 (1%), esto significa que 1 de cada 100 veces podemos estar cometiendo un error si aceptamos esta hipótesis de investigación. Contestaríamos a nuestra hipótesis con la fórmula siguiente:

Texto

Descripción generada automáticamente

El error es muy pequeño, por lo que puedo decir que la H1 es cierta, solo tengo un 1% de probabilidad de fallar. Cuanto más pequeño sea el p-valor menos error tendrás al aceptar la H1.

El margen de error es el que nos marca cuando aceptar H1 o cuando aceptar el H0. Normalmente en la práctica es el 0,05 (5%), es decir que si el p-valor es más pequeño que 0,05 se acepta la H1 o hipótesis de investigación, si el p-valor es mayor que 0,05 se rechaza H1. Esto se llama el nivel de significación y se representa con la letra griega alfa. Si la muestra tiene muy pocos datos, se suele utilizar el 0,01 (1%).

Escala de tiempo

Descripción generada automáticamente

La metodología paso a paso

Los pasos que hemos seguido para construir este contraste de hipótesis han sido:

  1. Definir las hipótesis (H1 y H0).
  2. Definir el margen de error, el alfa del que acabamos de hablar (es decir, que margen de error vamos a aceptar, normalmente en base al tamaño de la muestra).
  3. Calcular el p-valor seleccionando el test estadístico que mejor se adapte a nuestro caso.
  4. Contestar la hipótesis, si la H1 es cierta o no.
  5. Finalmente concluimos combinando la información obtenida durante la etapa de la descripción y los resultados obtenidos en la estadística inferencial.

Imagen que contiene Diagrama

Descripción generada automáticamente

Al final tenemos una plantilla de contraste de hipótesis que podemos seguir paso a paso para resolver cualquier caso de este estilo:

  1. Definir H1: pregunta de investigación o hipótesis alternativa (caso extraño de diferencias) 🡪 Ej: el HT1000 es diferente en el protocolo AGRESIVO que en el protocolo NO AGRESIVO.
  2. Definir H0: hipótesis nula (contraria a la hipótesis de investigación) (hipótesis normal o de igualdad) 🡪 Ej: el HT1000 es igual en el protocolo AGRESIVO que en el protocolo NO AGRESIVO.
  3. Escoger el tipo de test 🡪 Ej: para esta pregunta estamos comparando dos grupos, por lo tanto, T-TEST para medidas dependientes.
  4. Escoger el nivel de significación (la probabilidad de error que admitamos a la pregunta de investigación) 🡪 Ej: normalmente el 5% (con muestras muy pequeñas se utiliza el 1%).
  5. Cálculo de p-valor (se calcula el test estadístico con un software) (el p-valor es el nivel de error de la hipótesis de investigación o H1) 🡪 Ej: 0,012 o 1,2%.
  6. Respuesta (aplica la siguiente fórmula = “Con una probabilidad de error del” + p-valor + H1) 🡪 Ej: con una probabilidad de error del 1,2% el HT1000 es diferente en el protocolo AGRESIVO que en el protocolo NO AGRESIVO.

Take away

Lo más importante de la lección:

3- La Esencia de los Modelos Estadísticos

En esta lección veremos la esencia de los modelos y las claves para entender qué son y para que se utilizan.

Inferir un modelo

Inferir es trasladar la información de los datos a una función matemática. Para entender esto veremos un ejemplo sencillo.

Como siempre partimos de una base de datos que viene de una muestra. En este caso, estudiamos la altura de las personas que forman nuestra (variable cuantitativa). Queremos inferir cual sería la distribución normal de la población de esta muestra. ¿Cómo serían los parámetros de esta distribución normal? La distribución normal era una función matemática que representaba el histograma de densidad y que contaba con dos parámetros, la media y la desviación estándar. Inferir es calcular este modelo matemático a partir de los datos que tenemos. De alguna forma consiste en trasladar la información que tenemos de los datos a una información de toda la población (información del modelo). En este caso, el modelo que queremos obtener es una distribución normal que describa nuestros datos, para lo cual debemos calcular sus parámetros. Finalmente podríamos ver si ese modelo está explicando bien los datos, o si el modelo de una distribución diferente es mejor que la normal.

Esto es un modelo estadístico, a partir de los datos de la muestra que hemos observado obtenemos la función matemática que describe la distribución normal de toda la población. Es importante este concepto de inferencia, trasladar los datos de una muestra a una función matemática que describa la población.

¿Qué es un modelo predictivo?

Un modelo es una función matemática que a partir de unos datos de entrada (variables de entrada) obtienes los datos de las variables de salida (o respuesta).

Por ejemplo, el caso de la edad de los pacientes y su frecuencia cardiaca máxima (caso que se vio en el pre-training). Teníamos la variable de salida (frecuencia cardiaca máxima), que también se llama variable respuesta o dependiendo de las variables de entrada. Las variables de entrada (edad de los pacientes en este caso) se llaman también variables de estudio o independientes. Un modelo es la función matemática que te explica estos datos. En este caso es una línea recta con pendiente negativa que describe la frecuencia cardiaca máxima en función de la edad de los pacientes. Hemos calculado dos modelos, uno para mujeres y otro para hombres.

Gráfico, Gráfico de dispersión

Descripción generada automáticamente

Un modelo tiene tres partes bien diferenciadas:

El cálculo del modelo lo hace el software tratando de minimizar el error.

Interfaz de usuario gráfica, Texto

Descripción generada automáticamente

En este caso, a partir de los datos que hemos obtenido de los pacientes en relación a su edad (variable X) y su frecuencia cardiaca máxima (variable Y), podemos calcular la función matemática que mejor explica dichos datos (su relación). Se trata de dibujar matemáticamente una recta que siga la nube de puntos del diagrama de dispersión.

En este caso, el modelo es una recta (que es el modelo más sencillo):

y = a ∙ x + b

Diagrama

Descripción generada automáticamente con confianza baja

La inferencia es el cálculo de este modelo.

¿Para qué sirve?

Utilidad nº1: La Estimación

Con el modelo que hemos calculado podemos estimar la frecuencia cardiaca máxima sin necesidad de medirla (el modelo siempre tiene un error). Por ejemplo, si pongo 32 años, la frecuencia cardiaca máxima es:

Frecuencia Cardiaca Máxima = - 0,72 ∙ 32 + 209,6 = 186,56

186,56 pulsaciones por minuto no es la frecuencia cardiaca máxima de todas las personas con 32 años, este modelo tiene un error de predicción (hay puntos que están lejos de la recta), pero con este modelo podemos tener una estimación sin necesidad de medir la variable de salida.

Todos los modelos tienen un error de predicción, pero podemos conocerlo. El error es la distancia que tenemos desde los puntos que observamos (frecuencia cardiaca máxima real) de la frecuencia cardiaca máxima que muestra el modelo (que estaría sobre la recta). Por ejemplo, si el valor real de la frecuencia cardiaca máxima de una persona de 32 años fuese de 145 y el inferido por el modelo fuese 186,56, el error sería:

observado – esperado = 145 – 186,56 = -41,56

-41,56 es el residuo o error para este caso. En algunos casos será negativo, pero cuando el valor real sea mayor que el predicho tendremos valores positivos.

El software trata de crear el modelo que más se ajuste a los datos, minimizando el error total, que es la suma de todas las distancias de los puntos a la recta.

Utilidad nº2: Relacionar

Podemos utilizar el modelo para explicar lo que está pasando con la frecuencia cardiaca máxima y la edad. Un modelo puede explicar relaciones causa-efecto. El modelo lineal del ejemplo es la línea naranja del gráfico, es una recta con pendiente negativa ya que el valor del coeficiente a es -0,72 que significa que, a mayor edad, menor frecuencia cardiaca máxima. A mayor edad el corazón es más débil y la frecuencia cardiaca máxima que puede alcanzar es menor.

Además, en este estudio se han calculado dos modelos, uno para los datos de hombre y otro para mujeres. Así, también podemos comparar los modelos y ver la influencia de la edad con la frecuencia cardiaca máxima en función del sexo.

Frecuencia Cardiaca Máxima = - 0,72 ∙ Edad + 209,6 🡪 Para Hombres

Frecuencia Cardiaca Máxima = - 0,65 ∙ Edad + 207,2 = 186,56 🡪 Para Mujeres

El coeficiente b podríamos decir que es un valor promedio y es mayor en hombres que en mujeres en este ejemplo.

Los dos grandes retos de los modelos

Hay dos grandes retos en los modelos predictivos:

  1. El primero es ¿qué modelo es el que mejor explica los datos? ¿qué tipo de función matemática es la más adecuada?
  2. El segundo es ¿qué variables son las más representativas? ¿qué variables introduzco en el modelo? Es decir, de todas las variables que se han medido, ¿cuáles son las más adecuadas para explicar un fenómeno observado?

El camino para responder a estas preguntas se basa en probar varios modelos y escoger el mejor. Es necesario tener un criterio para decidir si el modelo es válido. Una vez decidido que mejor es el que mejor explica los datos, se probará ese mismo modelo con distintas variables. En este punto es necesario un criterio para comparar los modelos y escoger el mejor, el que incluya las variables más representativas.

Take away

Lo más importante de la lección: