Interprétation de résultats statistiques

Introduction

INTERPRÉTATION DES RÉSULTATS
Analyser et comprendre les données

Découvrez comment extraire du sens des données statistiques

Données
Graphiques
Analyse

Contexte et motivation

Pourquoi interpréter les résultats ?

SITUATION PROBLÉMATIQUE
Exemple introductif

Un sondage révèle que 65% des élèves mangent des fruits au moins une fois par semaine. Un autre sondage montre que 70% des élèves mangent des légumes au moins une fois par semaine. Ces chiffres sont-ils significatifs ? Que signifie cette différence de 5 points ? Quelle conclusion peut-on en tirer ?

Comment déterminer si une moyenne de 12/20 est satisfaisante ? Quelle signification donner à une médiane de 10 ? Comment interpréter un écart-type de 3 ?

L'interprétation des résultats est essentielle pour en tirer des conclusions pertinentes.

L'interprétation permet de donner du sens aux calculs statistiques
Importance de l'interprétation
  • Extraire des informations pertinentes des données
  • Prendre des décisions éclairées
  • Identifier les tendances et les anomalies
  • Valider ou infirmer des hypothèses
  • Communiquer les résultats de manière efficace

Interprétation des mesures de tendance centrale

Moyenne, médiane, mode

SIGNIFICATION DES INDICATEURS
Interprétation de la moyenne

La moyenne est la valeur centrale qui équilibre la série. Elle représente la valeur "type" d'une série.

Interprétation : "En moyenne, une personne de la population a une valeur de X".

Attention : la moyenne est sensible aux valeurs extrêmes.

Exemple : si la moyenne des salaires est de 2500€ mais que certains gagnent 10000€, la majorité gagne probablement moins que la moyenne.

La médiane est la valeur centrale qui divise la série en deux parties égales
Interprétation de la médiane

La médiane est la valeur telle que 50% des individus ont une valeur inférieure et 50% ont une valeur supérieure.

Interprétation : "50% des individus ont une valeur inférieure à la médiane".

Elle est robuste face aux valeurs extrêmes.

Elle est souvent plus représentative que la moyenne dans les distributions asymétriques.

Interprétation des mesures de dispersion

Étendue, écart-type, variance

ÉVALUATION DE LA DISPERSION
Interprétation de l'écart-type

L'écart-type mesure la dispersion des valeurs autour de la moyenne.

Un écart-type faible indique que les valeurs sont regroupées autour de la moyenne.

Un écart-type élevé indique une grande dispersion des valeurs.

Interprétation : "Les valeurs diffèrent en moyenne de σ unités par rapport à la moyenne".

Environ 68% des valeurs sont dans l'intervalle [moyenne - écart-type, moyenne + écart-type].

Interprétation de l'écart interquartile

L'écart interquartile (Q₃ - Q₁) mesure la dispersion des 50% des valeurs centrales.

Il est plus robuste que l'écart-type car il n'est pas influencé par les valeurs extrêmes.

Interprétation : "La moitié centrale des données est étalée sur un intervalle de EI unités".

Il est particulièrement utile pour comparer des séries de données.

Interprétation des graphiques

Lecture des diagrammes

ANALYSE VISUELLE
Histogrammes

La forme de l'histogramme indique la distribution des données :

  • Symétrique : moyenne ≈ médiane
  • Asymétrique à droite : moyenne > médiane
  • Asymétrique à gauche : moyenne < médiane
  • Étalée : grande dispersion
  • Concentrée : petite dispersion

Les pics indiquent les valeurs les plus fréquentes.

Boîtes à moustaches

Elles montrent la médiane, les quartiles, et les valeurs extrêmes.

La longueur de la boîte indique l'écart interquartile.

Les moustaches montrent l'étendue des données non aberrantes.

Les points à l'extérieur des moustaches sont des valeurs aberrantes.

Comparaison de plusieurs boîtes permet d'analyser les différences de distribution.

Interprétation des probabilités

Comprendre les chances

SIGNIFICATION DES PROBABILITÉS
Probabilité d'un événement

La probabilité d'un événement indique la "chance" qu'il se produise.

Une probabilité de 0.2 signifie que l'événement se produit 20% du temps.

Une probabilité de 0.5 signifie que l'événement se produit 50% du temps (hasard pur).

Une probabilité proche de 1 indique un événement presque certain.

Une probabilité proche de 0 indique un événement presque impossible.

PROBABILITÉS CONDITIONNELLES
Interprétation

P(A|B) signifie "la probabilité de A sachant que B s'est produit".

Cela indique comment la connaissance de B modifie la probabilité de A.

Si P(A|B) > P(A), alors B augmente la probabilité de A.

Si P(A|B) < P(A), alors B diminue la probabilité de A.

Si P(A|B) = P(A), alors A et B sont indépendants.

Applications concrètes

Utilisations pratiques

DOMAINES D'APPLICATION
Domaines d'utilisation
  • 1 Médecine (analyse des résultats de tests)
  • 2 Qualité industrielle (contrôle de fabrication)
  • 3 Finance (analyse des risques)
  • 4 Marketing (analyse de comportement client)
  • 5 Éducation (analyse des résultats scolaires)
Exemple : Contrôle qualité

Une usine de fabrication de pièces métalliques a une moyenne de 10.0 cm avec un écart-type de 0.1 cm. Cela signifie que la plupart des pièces (environ 95%) ont une longueur comprise entre 9.8 cm et 10.2 cm (moyenne ± 2 écart-types).

Si l'écart-type augmente, cela indique une dégradation de la qualité. Si la moyenne change, cela indique un problème de réglage de la machine.

Les statistiques permettent d'identifier ces changements et de prendre des mesures correctives.

Exercice d'application

Problème complet

ÉNONCÉ
Question

Voici les résultats d'un test de satisfaction sur 100 clients :

Score 1 2 3 4 5
Effectif 5 10 30 40 15

1. Calculer la moyenne et interpréter.

2. Calculer la médiane et interpréter.

3. Calculer l'écart-type et interpréter.

4. Quel est le pourcentage de clients très satisfaits (score ≥ 4) ?

5. Interpréter l'ensemble des résultats.

Solution de l'exercice

Correction détaillée

QUESTION 1 : CALCUL DE LA MOYENNE
Méthode de calcul

\(\bar{x} = \frac{1×5 + 2×10 + 3×30 + 4×40 + 5×15}{100}\)

\(\bar{x} = \frac{5 + 20 + 90 + 160 + 75}{100} = \frac{350}{100} = 3.5\)

Moyenne = 3.5

Interprétation : En moyenne, les clients attribuent un score de 3.5 sur 5 à la satisfaction. Cela indique un niveau de satisfaction modérément élevé.

QUESTION 2 : CALCUL DE LA MÉDIANE
Détermination de la médiane

Effectif total : 100, donc la médiane est la moyenne des 50ème et 51ème valeurs.

Effectifs cumulés : 5, 15, 45, 85, 100

La 50ème et la 51ème valeurs appartiennent à la classe de score 4.

Médiane = 4

Interprétation : 50% des clients attribuent un score inférieur ou égal à 4, et 50% attribuent un score supérieur ou égal à 4. La médiane est plus élevée que la moyenne, ce qui indique une distribution asymétrique vers la gauche.

Suite de la solution

Correction détaillée (suite)

QUESTION 3 : CALCUL DE L'ÉCART-TYPE
Calcul de la variance puis de l'écart-type

Calculons d'abord \(\overline{x^2}\) : \(\overline{x^2} = \frac{1^2×5 + 2^2×10 + 3^2×30 + 4^2×40 + 5^2×15}{100}\)

\(\overline{x^2} = \frac{5 + 40 + 270 + 640 + 375}{100} = \frac{1330}{100} = 13.3\)

\(V = \overline{x^2} - (\bar{x})^2 = 13.3 - (3.5)^2 = 13.3 - 12.25 = 1.05\)

\(\sigma = \sqrt{1.05} \approx 1.02\)

Écart-type ≈ 1.02

Interprétation : Les scores diffèrent en moyenne de 1.02 points par rapport à la moyenne de 3.5. Cela indique une dispersion modérée des réponses.

QUESTION 4 : POURCENTAGE DE TRÈS SATISFAITS
Calcul du pourcentage

Les clients très satisfaits ont un score ≥ 4, soit les scores 4 et 5.

Effectif des très satisfaits : 40 + 15 = 55

Pourcentage : (55/100) × 100% = 55%

55% des clients sont très satisfaits

Suite de la solution exercice

Correction détaillée (suite)

QUESTION 5 : INTERPRÉTATION GLOBALE
Analyse complète des résultats

Voici l'interprétation globale des résultats :

  • La moyenne de 3.5/5 indique un niveau de satisfaction modérément élevé
  • La médiane de 4/5 est supérieure à la moyenne, ce qui suggère que la distribution est asymétrique avec plus de scores élevés
  • L'écart-type de 1.02 montre une dispersion modérée des réponses
  • 55% des clients sont très satisfaits (score ≥ 4), ce qui est un bon résultat
  • Seulement 15% des clients sont peu satisfaits (score ≤ 2)

Conclusion : l'entreprise a un bon niveau de satisfaction client, mais pourrait améliorer davantage pour augmenter la proportion de clients très satisfaits.

Deuxième exercice

Problème complet

ÉNONCÉ
Question

Un test médical a une sensibilité de 95% et une spécificité de 90%. La prévalence de la maladie dans la population est de 1%. On sélectionne une personne au hasard.

1. Calculer la probabilité que le test soit positif.

2. Sachant que le test est positif, quelle est la probabilité que la personne soit malade ?

3. Interpréter le résultat.

4. Calculer la probabilité que la personne soit saine sachant que le test est négatif.

Solution du deuxième exercice

Correction détaillée

DÉFINITION DES ÉVÉNEMENTS
Identification des données

Soit M l'événement "la personne est malade", T l'événement "le test est positif".

P(M) = 0.01 (prévalence de 1%)

P(T|M) = 0.95 (sensibilité de 95%)

P(T^c|M^c) = 0.90 (spécificité de 90%)

Donc P(T|M^c) = 1 - 0.90 = 0.10

QUESTION 1 : PROBABILITÉ DE TEST POSITIF
Utilisation de la formule des probabilités totales

Par la formule des probabilités totales :

P(T) = P(T|M) × P(M) + P(T|M^c) × P(M^c)

P(T) = 0.95 × 0.01 + 0.10 × 0.99 = 0.0095 + 0.099 = 0.1085

P(T) = 0.1085 = 10.85%

Donc la probabilité que le test soit positif est de 10.85%.

Suite de la solution exercice 2

Correction détaillée (suite)

QUESTION 2 : PROBABILITÉ D'ÊTRE MALADE SACHANT TEST POSITIF
Utilisation de la formule de Bayes

Par la formule de Bayes :

P(M|T) = [P(T|M) × P(M)] / P(T)

P(M|T) = (0.95 × 0.01) / 0.1085 = 0.0095 / 0.1085 ≈ 0.0876

P(M|T) ≈ 0.0876 = 8.76%

Donc la probabilité d'être malade sachant que le test est positif est d'environ 8.76%.

QUESTION 3 : INTERPRÉTATION
Analyse du résultat

Ce résultat est surprenant : même avec un test fiable à 95%, seulement 8.76% des personnes avec un test positif sont réellement malades !

Cela est dû à la faible prévalence de la maladie (1%) : il y a plus de faux positifs que de vrais positifs.

Ce paradoxe montre l'importance de l'interprétation des résultats statistiques dans un contexte médical.

QUESTION 4 : PROBABILITÉ D'ÊTRE SAINE SACHANT TEST NÉGATIF
Calcul de P(M^c|T^c)

P(M^c|T^c) = [P(T^c|M^c) × P(M^c)] / P(T^c)

P(T^c) = 1 - P(T) = 1 - 0.1085 = 0.8915

P(M^c) = 1 - P(M) = 0.99

P(M^c|T^c) = (0.90 × 0.99) / 0.8915 = 0.891 / 0.8915 ≈ 0.9994

P(M^c|T^c) ≈ 0.9994 = 99.94%

Résumé

Points clés

CONCEPTS FONDAMENTAUX
Interprétation des indicateurs
  • Moyenne : valeur centrale qui équilibre la série
  • Médiane : valeur qui divise la série en deux parties égales
  • Mode : valeur la plus fréquente
  • Écart-type : mesure de la dispersion autour de la moyenne
  • Écart interquartile : mesure de la dispersion des 50% centrales
Interprétation des graphiques
  • Histogramme : forme de la distribution
  • Boîte à moustaches : médiane, quartiles, valeurs extrêmes
  • Nuage de points : relation entre deux variables
Interprétation des probabilités
  • P(A) : fréquence de A sur un grand nombre d'épreuves
  • P(A|B) : influence de B sur la probabilité de A
  • P(A ∩ B) : probabilité que A et B se produisent ensemble
L'interprétation correcte des résultats est essentielle pour tirer des conclusions pertinentes !

Conclusion

Félicitations !

FÉLICITATIONS !
MAÎTRISE DE L'INTERPRÉTATION DES RÉSULTATS
Vous comprenez maintenant comment analyser les données statistiques !

Continuez à pratiquer pour renforcer vos compétences

Compris
Retenu
Appliqué