UE4-
Statistiques
15/04/19
Nassima
Tania
Lina
Séances du 22, 25 et 27 août
Léna BSR P2 Med
Nina MANICKI P2 Médecine
Sommaire:
2) Lois de distribution
3) Les intervalles de confiance
4) Principes généraux des tests statistiques
Un caractère est qualitatif s’il peut se présenter sous plusieurs aspects ou suivant plusieurs modalités. On va donc dénombrer l’effectif de chaque classe.
Un individu appartient à une classe et une seulement !
Exemples :
La couleur des yeux La glycémie L’âge des enfants
b) Ordinale
Il est possible qu’il existe entre les diverses classes une relation d’ordre, telle que “plus grave”, ou “plus grand”... On vient à faire un classement.
Un individu est toujours affecté à une seule classe !
Exemples :
La couleur des yeux La glycémie L’âge des enfants
c) Quantitatif
Une variable quantitative prend pour valeur un nombre résultant de la mesure, avec une unité, du caractère chez chaque individu. Elle peut donc évoluer selon l’individu et le temps.
Elle est de deux types :
Exemples :
La couleur des yeux La glycémie L’âge des enfants
d) Caractérisation des données qualitatives et ordinales unidimensionnelles
Fréquence absolue : nombre d’individus par classe.
Fréquence relative : rapport de son effectif au nombre total d’individus de la série des mesures.
d) Caractérisation des données qualitatives et ordinales unidimensionnelles
Fréquence cumulée : utilisées pour les données ordinales qui présentent des classes ordonnées. Addition d’un effectif avec celui de la classe précédente.
d) Caractérisation des données qualitatives et ordinales unidimensionnelles
Le mode : classe qui contient le plus grand nombre de sujets ; c’est le mode ou classe modale. Le mode est la classe (catégorie) qui offre la plus grande fréquence. Il peut y avoir plusieurs modes.
e) Représentations graphiques
Pour la donnée qualitative Pour la donnée ordinale
f) Caractérisation des données quantitatives à une dimension
f) Caractérisation des données quantitatives à une dimension
Le polygone des fréquences ?
Le contour polygonal joignant les milieux des bases supérieures des rectangles s’appelle le polygone des fréquences.
Augmentation du
nombre de classe
à l’infini.
L’ensemble des classes et leur fréquence constitue une distribution de fréquences.
f) Quand on parle de données quantitatives… Paramètres de tendance centrale et de position.
La moyenne : rapport de la somme des mesures au nombre de mesures effectuées.
La médiane : valeur qui laisse de part et d’autre un nombre égal d’observations.
Le mode (rappel) : valeur dominante, valeur de la variable dont la fréquence est maximale.
f) Quand on parle de données quantitatives… Paramètres de tendance centrale et de position.
Les quantiles : valeurs de la variable qui divisent l’échantillon ordonné en groupes d’effectifs égaux.
Les quartiles :
Les percentiles : Les percentiles définissent 100 groupes d’effectifs correspondants chacun à 1 % de l’effectif de l’échantillon. Le 50ème percentile est à la médiane.
g) Paramètres de dispersion
Variance : La variance est définie comme la moyenne arithmétique des carrés des écarts à la moyenne de l’échantillon.
Écart-type : Afin de disposer d’un indice de dispersion qui s’exprime dans la même unité que la grandeur mesurée, on considère, en général, la racine carrée de la variance : l’écart-type.
g) Paramètres de dispersion
Étendue : On définit l’étendue e d’une série de mesures comme la différence entre la plus grande et la plus petite valeur de la série.
L’intervalle inter-quartile représente 50 % des observations centrées en probabilité sur la médiane. Ses bornes sont Q1 et Q3.
h) Caractérisation des données quantitatives à deux dimensions
On caractérise la dispersion des points de coordonnées (xi , yi) par la moyenne du produit des écarts, pour chaque point, entre ses coordonnées et leurs valeurs moyennes.
Le coefficient de corrélation, noté r, est une grandeur qui reflète la dispersion des couples (xi , yi) en fonction de la dispersion observée pour chacune des deux séries de mesures X et Y.
2) Lois de distribution
b) Variables aléatoires continues
La surface délimitée par la courbe de densité et l’axe des X sans bornes vaut 1 (la somme de toutes les probabilités élémentaires vaut 1 :
c) La loi Normale
La loi normale sert à déterminer la probabilité de piocher, au hasard dans cette loi, telle ou telle valeur, ou la probabilité de tomber entre telle et telle valeur.
La distribution Normale, ou de Laplace Gauss, ne dépend que de 2 paramètres :
Notre loi normale a une
moyenne de 0 et un
écart-type de 1.
c) La loi Normale
Propriétés importantes :
→ Continue
→ Symétrique par rapport à la moyenne
→ Passe par un maximum pour son mode
→ Médiane égale à la moyenne
Comment centrer réduire ?
c) La loi Normale
c) La loi Normale
Elle permet de déterminer la probabilité pour que Z dépasse une certaine valeur N.
Le tableau permet de lire cette valeur pour une valeur d’alpha déterminée.
c) La loi Normale : lire la table
Loi de student
Médiane= mode=Moyenne
Loi de student
Exemple sur la loi de : Student
Loi de Student
On cherche la probabilité que X ≥ +1,886:
Cette probabilité correspond à la surface rouge à droite soit alpha/2
Etape 1: on dessine la courbe et on place le -1,886 et le + 1,886 à la limites des deux surfaces alpha/2
Etape 2: on cherche dans le tableau de la loi de student , à 2 ddl, 1,886
Etape 3: on trouve que pour 1,886 le risque alpha est de 0,20 or nous on veut la proba que X ≥ + 1,886 donc alpha/2 (ATTENTION!!!!)
Etape 4: calculer 0,20/2 (=alpha/2) = 0,10
Réponse : donc la proba est de 0,10
Maintenant ça c’est pour le groupe de lundi :
Bien sur si on avait demandé de chercher la probabilité que X ≥ 1,886 en valeur absolue
alors ici la probabilité correspond aux DEUX surfaces rouges que l’on voit sur la courbe soit alpha(donc pas de division par 2).
Ainsi la probabilité que X ≥ 1,886 en valeur absolue
sera de 0,20 (mais c’est moins demandé au concours on vous demandera plus si c’est ≥ + 1,886 pour voir si vous oubliez pas de diviser par DEUX)
Loi de Student
Pour aller plus loin:
Si on vous demande cette fois ci l’inverse c’est à dire la probabilité que X <+1,886 alors :
En regardant la courbe on voit que c’est la surface hachurée en gris soit 1-alpha + l’aire rouge (à gauche) alpha/2
Donc que la proba est de 0,90 (car 1-0,20=0,80 et 0,20/2=0,10 donc 0,80+0,10=0,90)
ATTENTION si on avait demandé la proba que X<1,886 en valeur absolue
alors là on ne considère que la surface hachurée en gris donc la proba est de 1-alpha soit 0,80 ici
Loi du chi-deux
Loi du chi-deux
Exemple:
Soit X une variable qui suit une loi du chi-deux à 4 ddl.
On cherche la probabilité(P) que X≥ 18,47.
Propositions:
A)P= 0,30 B)P=0,01 C)P=0,001
Réponse: pour 4 ddl on a α= 0,001. on trouve P=0,001.
α= risque de se tromper et que notre valeur ne soit pas dans notre estimation
Quelques QCMs !
Quelques QCMs !
→ VRAI : On est affilié à une seule classe.
→ VRAI : C’est comme ça qu’on représente les données qualitatives !
→ FAUX : Elle est de 7, 12.
→ VRAI : Le nombre est pair.
→ Faux : C’est 4.
Quelques QCMs !
Quelques QCMs !
→ FAUX : Quantitative car elle peut prendre chaque nombre de son intervalle.
→ FAUX : Ordinale car on peut les classer.
→ VRAI : Grâce.
Intervalles de confiance et principes généraux des tests statistiques
Estimation intervalle de confiance
Les paramètres d’une population sont inconnus donc on fait des estimations.
θ^ θ
θ^ : estimation(valeur calculée)
θ: vraie valeur inconnue
n: effectif de l’échantillon
n grand
n petit
Estimation par intervalle de confiance
Grâce au tableau de la loi Normale:
x̄: estimation de la moyenne dans la population
Nα:valeur lue dans la table de la loi normal au risque α choisi
Sm: écart type de l’échantillon
Les bornes de l’intervalle de confiance pour le risque α :
Estimation par intervalle de confiance
Grâce au tableau de la loi Student à v= n-1 ddl:
Les bornes de l’intervalle de confiance pour le risque α :
Tα: valeur lue dans la table de la loi de student au risque α choisi.
Estimation par intervalle de confiance
f: estimation de la fréquence du paramètre dans la population
Sf: écart type de l’échantillon
Suit une loi Normale (si n grand et f pas proche de 0 ou 1):
Les bornes de l’intervalle de confiance pour le risque α :
Estimation par intervalle de confiance
Exemple :
On considère des étudiants en première année de médecine à Marseille on prend un échantillon de 30(n=30) étudiants. Parmi eux 15 sont myopes!! et Sf= 0,09
la 3ème
0,5 (nombre myopes/n)
Estimation ponctuelle par intervalle de confiance
Exemple :
On considère des étudiants en première année de médecine à Marseille on prend un échantillon de 30(n=30) étudiants. Parmi eux 15 sont myopes!! et Sf= 0,09
Fréquence= 0,5
Réponse : 0,5 ± 1,96×0,09
× = .
Principes généraux des tests statistiques
Principes généraux des tests statistique
Rejet de H0 si:
résultat de la statistique du test(en valeur absolue ) ≥ Vs (en valeur absolue)
Conservation H0 si:
résultat de la statistique du test(en valeur absolue ) < Vs (en valeur absolue)
Principes généraux des tests statistiques
Principes généraux des tests statistiques
Principes généraux des tests statistiques
Merci pour votre attention