1 of 48

UE4-

Statistiques

15/04/19

Nassima

Tania

Lina

Séances du 22, 25 et 27 août

Léna BSR P2 Med

Nina MANICKI P2 Médecine

2 of 48

Sommaire:

  1. Statistiques descriptives

2) Lois de distribution

3) Les intervalles de confiance

4) Principes généraux des tests statistiques

3 of 48

  1. Stats descriptives

4 of 48

  1. Qualitatives

Un caractère est qualitatif s’il peut se présenter sous plusieurs aspects ou suivant plusieurs modalités. On va donc dénombrer l’effectif de chaque classe.

Un individu appartient à une classe et une seulement !

Exemples :

La couleur des yeux La glycémie L’âge des enfants

5 of 48

b) Ordinale

Il est possible qu’il existe entre les diverses classes une relation d’ordre, telle que “plus grave”, ou “plus grand”... On vient à faire un classement.

Un individu est toujours affecté à une seule classe !

Exemples :

La couleur des yeux La glycémie L’âge des enfants

6 of 48

c) Quantitatif

Une variable quantitative prend pour valeur un nombre résultant de la mesure, avec une unité, du caractère chez chaque individu. Elle peut donc évoluer selon l’individu et le temps.

Elle est de deux types :

  • Discrète Prend des valeurs définies
  • Continue Prend toutes les valeurs de son intervalle

Exemples :

La couleur des yeux La glycémie L’âge des enfants

7 of 48

d) Caractérisation des données qualitatives et ordinales unidimensionnelles

Fréquence absolue : nombre d’individus par classe.

Fréquence relative : rapport de son effectif au nombre total d’individus de la série des mesures.

8 of 48

d) Caractérisation des données qualitatives et ordinales unidimensionnelles

Fréquence cumulée : utilisées pour les données ordinales qui présentent des classes ordonnées. Addition d’un effectif avec celui de la classe précédente.

9 of 48

d) Caractérisation des données qualitatives et ordinales unidimensionnelles

Le mode : classe qui contient le plus grand nombre de sujets ; c’est le mode ou classe modale. Le mode est la classe (catégorie) qui offre la plus grande fréquence. Il peut y avoir plusieurs modes.

10 of 48

e) Représentations graphiques

Pour la donnée qualitative Pour la donnée ordinale

11 of 48

f) Caractérisation des données quantitatives à une dimension

12 of 48

f) Caractérisation des données quantitatives à une dimension

Le polygone des fréquences ?

Le contour polygonal joignant les milieux des bases supérieures des rectangles s’appelle le polygone des fréquences.

Augmentation du

nombre de classe

à l’infini.

L’ensemble des classes et leur fréquence constitue une distribution de fréquences.

13 of 48

f) Quand on parle de données quantitatives… Paramètres de tendance centrale et de position.

La moyenne : rapport de la somme des mesures au nombre de mesures effectuées.

La médiane : valeur qui laisse de part et d’autre un nombre égal d’observations.

  • Si effectif impair : (n = 2k + 1)
  • Si effectif pair : (n = 2k)

Le mode (rappel) : valeur dominante, valeur de la variable dont la fréquence est maximale.

14 of 48

f) Quand on parle de données quantitatives… Paramètres de tendance centrale et de position.

Les quantiles : valeurs de la variable qui divisent l’échantillon ordonné en groupes d’effectifs égaux.

Les quartiles :

Les percentiles : Les percentiles définissent 100 groupes d’effectifs correspondants chacun à 1 % de l’effectif de l’échantillon. Le 50ème percentile est à la médiane.

15 of 48

g) Paramètres de dispersion

Variance : La variance est définie comme la moyenne arithmétique des carrés des écarts à la moyenne de l’échantillon.

Écart-type : Afin de disposer d’un indice de dispersion qui s’exprime dans la même unité que la grandeur mesurée, on considère, en général, la racine carrée de la variance : l’écart-type.

16 of 48

g) Paramètres de dispersion

Étendue : On définit l’étendue e d’une série de mesures comme la différence entre la plus grande et la plus petite valeur de la série.

L’intervalle inter-quartile représente 50 % des observations centrées en probabilité sur la médiane. Ses bornes sont Q1 et Q3.

17 of 48

h) Caractérisation des données quantitatives à deux dimensions

On caractérise la dispersion des points de coordonnées (xi , yi) par la moyenne du produit des écarts, pour chaque point, entre ses coordonnées et leurs valeurs moyennes.

Le coefficient de corrélation, noté r, est une grandeur qui reflète la dispersion des couples (xi , yi) en fonction de la dispersion observée pour chacune des deux séries de mesures X et Y.

18 of 48

2) Lois de distribution

19 of 48

  1. Lire un tableau de variable discrète

20 of 48

b) Variables aléatoires continues

La surface délimitée par la courbe de densité et l’axe des X sans bornes vaut 1 (la somme de toutes les probabilités élémentaires vaut 1 :

21 of 48

c) La loi Normale

La loi normale sert à déterminer la probabilité de piocher, au hasard dans cette loi, telle ou telle valeur, ou la probabilité de tomber entre telle et telle valeur.

La distribution Normale, ou de Laplace Gauss, ne dépend que de 2 paramètres :

  • la moyenne
  • l’écart-type

Notre loi normale a une

moyenne de 0 et un

écart-type de 1.

22 of 48

c) La loi Normale

Propriétés importantes :

  • Elle est totalement dépendante de sa moyenne et de son écart-type.
  • La fonction de densité est :

Continue

Symétrique par rapport à la moyenne

Passe par un maximum pour son mode

Médiane égale à la moyenne

Comment centrer réduire ?

23 of 48

c) La loi Normale

24 of 48

c) La loi Normale

Elle permet de déterminer la probabilité pour que Z dépasse une certaine valeur N.

Le tableau permet de lire cette valeur pour une valeur d’alpha déterminée.

25 of 48

c) La loi Normale : lire la table

26 of 48

Loi de student

  • Dépend que de son degré de liberté (ddl)
  • Symétrique par rapport à sa moyenne 0.

Médiane= mode=Moyenne

  • Plus le ddl tend vers l’infini plus la loi de student tend vers une loi Normale.

27 of 48

Loi de student

Exemple sur la loi de : Student

  • Soit X une variable aléatoire suivant une loi de student à 2 ddl:
  • Donner la probabilité que X≥ 1,886.

28 of 48

Loi de Student

On cherche la probabilité que X+1,886:

Cette probabilité correspond à la surface rouge à droite soit alpha/2

Etape 1: on dessine la courbe et on place le -1,886 et le + 1,886 à la limites des deux surfaces alpha/2

Etape 2: on cherche dans le tableau de la loi de student , à 2 ddl, 1,886

Etape 3: on trouve que pour 1,886 le risque alpha est de 0,20 or nous on veut la proba que X + 1,886 donc alpha/2 (ATTENTION!!!!)

Etape 4: calculer 0,20/2 (=alpha/2) = 0,10

Réponse : donc la proba est de 0,10

Maintenant ça c’est pour le groupe de lundi :

Bien sur si on avait demandé de chercher la probabilité que X 1,886 en valeur absolue

alors ici la probabilité correspond aux DEUX surfaces rouges que l’on voit sur la courbe soit alpha(donc pas de division par 2).

Ainsi la probabilité que X 1,886 en valeur absolue

sera de 0,20 (mais c’est moins demandé au concours on vous demandera plus si c’est ≥ + 1,886 pour voir si vous oubliez pas de diviser par DEUX)

29 of 48

Loi de Student

Pour aller plus loin:

Si on vous demande cette fois ci l’inverse c’est à dire la probabilité que X <+1,886 alors :

En regardant la courbe on voit que c’est la surface hachurée en gris soit 1-alpha + l’aire rouge (à gauche) alpha/2

Donc que la proba est de 0,90 (car 1-0,20=0,80 et 0,20/2=0,10 donc 0,80+0,10=0,90)

ATTENTION si on avait demandé la proba que X<1,886 en valeur absolue

alors là on ne considère que la surface hachurée en gris donc la proba est de 1-alpha soit 0,80 ici

30 of 48

Loi du chi-deux

  • Dépend que de son degré de liberté(ddl).
  • Plus le ddl tend vers 0 plus elle est asymétrique.
  • Toujours dans une intervalle.

31 of 48

Loi du chi-deux

Exemple:

Soit X une variable qui suit une loi du chi-deux à 4 ddl.

On cherche la probabilité(P) que X 18,47.

Propositions:

A)P= 0,30 B)P=0,01 C)P=0,001

Réponse: pour 4 ddl on a α= 0,001. on trouve P=0,001.

α= risque de se tromper et que notre valeur ne soit pas dans notre estimation

32 of 48

Quelques QCMs !

  1. La couleur des yeux est une donnée qualitative.

  • . Ce tableau peut être représenté par un par un camembert.

  • Dans cette suite de nombres (6, 5, 8, 9, 10, 3, 4, 12), la moyenne est 9.

  • Dans cette même suite de nombres, la médiane est 7.

  • Le premier quartile est 5.

33 of 48

Quelques QCMs !

  • La couleur des yeux est une donnée qualitative.

VRAI : On est affilié à une seule classe.

  • Ce tableau peut être représenté par un camembert.

VRAI : C’est comme ça qu’on représente les données qualitatives !

  • Dans cette suite de nombres (6, 5, 8, 9, 10, 3, 4, 12), la moyenne est 9.

FAUX : Elle est de 7, 12.

  • Dans cette même suite de nombres, la médiane est 7.

VRAI : Le nombre est pair.

  • Le premier quartile est 5.

Faux : C’est 4.

34 of 48

Quelques QCMs !

  1. La Glycémie est une donnée quantitative discrète.

  • Les différents stades d’une maladie sont une donnée quantitative discrète.

  • Une distribution peut être centrée réduite pour être replacée dans une table de loi normale.

  • La loi Normale est indépendante de son écart-type.

  • La probabilité que X soit supérieur à 1,64 est de 10%.

35 of 48

Quelques QCMs !

  • La Glycémie est une donnée quantitative discrète.

→ FAUX : Quantitative car elle peut prendre chaque nombre de son intervalle.

  • Les différents stades d’une maladie sont une donnée quantitative discrète.

→ FAUX : Ordinale car on peut les classer.

  • Une distribution peut être centrée réduite pour être replacée dans une table de loi normale.

→ VRAI : Grâce.

  • La loi Normale est indépendante de son écart-type.

  • La probabilité que X soit supérieur à 1,64 est de 10%.

36 of 48

Intervalles de confiance et principes généraux des tests statistiques

37 of 48

Estimation intervalle de confiance

Les paramètres d’une population sont inconnus donc on fait des estimations.

θ^ θ

θ^ : estimation(valeur calculée)

θ: vraie valeur inconnue

n: effectif de l’échantillon

  • Intervalle de confiance(IC):

  • Centré sur l’estimation du paramètre.

  • Plus IC est grand plus le risque α de se tromper et que la valeur ne soit pas dedans est est petit.
  • Plus n est grand plus on est précis donc plus l’IC est étroit.

n grand

n petit

38 of 48

Estimation par intervalle de confiance

  • Calcul de l’intervalle de confiance d’une moyenne pour les petits échantillons n<(ou=) 30:

Grâce au tableau de la loi Normale:

x̄: estimation de la moyenne dans la population

Nα:valeur lue dans la table de la loi normal au risque α choisi

Sm: écart type de l’échantillon

Les bornes de l’intervalle de confiance pour le risque α :

39 of 48

Estimation par intervalle de confiance

  • Calcul de l’intervalle de confiance d’une moyenne pour les grands échantillons n>(ou=) 30:

Grâce au tableau de la loi Student à v= n-1 ddl:

Les bornes de l’intervalle de confiance pour le risque α :

Tα: valeur lue dans la table de la loi de student au risque α choisi.

40 of 48

Estimation par intervalle de confiance

  • Intervalle de confiance d’une proportion:

f: estimation de la fréquence du paramètre dans la population

Sf: écart type de l’échantillon

Suit une loi Normale (si n grand et f pas proche de 0 ou 1):

Les bornes de l’intervalle de confiance pour le risque α :

41 of 48

Estimation par intervalle de confiance

Exemple :

On considère des étudiants en première année de médecine à Marseille on prend un échantillon de 30(n=30) étudiants. Parmi eux 15 sont myopes!! et Sf= 0,09

  • Quelle formule prendre?
  • Quelle est la fréquence?

la 3ème

0,5 (nombre myopes/n)

42 of 48

Estimation ponctuelle par intervalle de confiance

Exemple :

On considère des étudiants en première année de médecine à Marseille on prend un échantillon de 30(n=30) étudiants. Parmi eux 15 sont myopes!! et Sf= 0,09

Fréquence= 0,5

  • Donnez l’intervalle de confiance à 95% de la moyenne?

Réponse : 0,5 ± 1,96×0,09

× = .

43 of 48

Principes généraux des tests statistiques

  • H0= Hypothèse selon laquelle la moyenne théorique (dans “la vraie vie”) est égale à la moyenne attendue.
  • résultat de la statistique du test: µ-a
  • Vs= valeur seuil

44 of 48

Principes généraux des tests statistique

Rejet de H0 si:

résultat de la statistique du test(en valeur absolue ) Vs (en valeur absolue)

Conservation H0 si:

résultat de la statistique du test(en valeur absolue ) < Vs (en valeur absolue)

45 of 48

Principes généraux des tests statistiques

  • Risque de 1ère espèce(ou risque d'erreur alpha)
  • risque de rejeter H0 alors qu’elle est vraie

  • donc accepter HA hypothèse alternative alors qu’elle est fausse

46 of 48

Principes généraux des tests statistiques

  • Risque de 2ème espèce ou risque d'erreur beta

  • risque d’accepter H0 alors que celle ci est fausse

  • donc de rejeter Ha alors qu’elle est vraie

47 of 48

Principes généraux des tests statistiques

  • La puissance d’un test 1-beta

  • capacité de ce test à montrer une différence quand elle existe
  • capacité du test à rejeter H0 quand elle est fausse

48 of 48

Merci pour votre attention