Interprétation de résultats statistiques
Introduction
Découvrez comment extraire du sens des données statistiques
Contexte et motivation
Pourquoi interpréter les résultats ?
Un sondage révèle que 65% des élèves mangent des fruits au moins une fois par semaine. Un autre sondage montre que 70% des élèves mangent des légumes au moins une fois par semaine. Ces chiffres sont-ils significatifs ? Que signifie cette différence de 5 points ? Quelle conclusion peut-on en tirer ?
Comment déterminer si une moyenne de 12/20 est satisfaisante ? Quelle signification donner à une médiane de 10 ? Comment interpréter un écart-type de 3 ?
L'interprétation des résultats est essentielle pour en tirer des conclusions pertinentes.
- Extraire des informations pertinentes des données
- Prendre des décisions éclairées
- Identifier les tendances et les anomalies
- Valider ou infirmer des hypothèses
- Communiquer les résultats de manière efficace
Interprétation des mesures de tendance centrale
Moyenne, médiane, mode
La moyenne est la valeur centrale qui équilibre la série. Elle représente la valeur "type" d'une série.
Interprétation : "En moyenne, une personne de la population a une valeur de X".
Attention : la moyenne est sensible aux valeurs extrêmes.
Exemple : si la moyenne des salaires est de 2500€ mais que certains gagnent 10000€, la majorité gagne probablement moins que la moyenne.
La médiane est la valeur telle que 50% des individus ont une valeur inférieure et 50% ont une valeur supérieure.
Interprétation : "50% des individus ont une valeur inférieure à la médiane".
Elle est robuste face aux valeurs extrêmes.
Elle est souvent plus représentative que la moyenne dans les distributions asymétriques.
Interprétation des mesures de dispersion
Étendue, écart-type, variance
L'écart-type mesure la dispersion des valeurs autour de la moyenne.
Un écart-type faible indique que les valeurs sont regroupées autour de la moyenne.
Un écart-type élevé indique une grande dispersion des valeurs.
Interprétation : "Les valeurs diffèrent en moyenne de σ unités par rapport à la moyenne".
Environ 68% des valeurs sont dans l'intervalle [moyenne - écart-type, moyenne + écart-type].
L'écart interquartile (Q₃ - Q₁) mesure la dispersion des 50% des valeurs centrales.
Il est plus robuste que l'écart-type car il n'est pas influencé par les valeurs extrêmes.
Interprétation : "La moitié centrale des données est étalée sur un intervalle de EI unités".
Il est particulièrement utile pour comparer des séries de données.
Interprétation des graphiques
Lecture des diagrammes
La forme de l'histogramme indique la distribution des données :
- Symétrique : moyenne ≈ médiane
- Asymétrique à droite : moyenne > médiane
- Asymétrique à gauche : moyenne < médiane
- Étalée : grande dispersion
- Concentrée : petite dispersion
Les pics indiquent les valeurs les plus fréquentes.
Elles montrent la médiane, les quartiles, et les valeurs extrêmes.
La longueur de la boîte indique l'écart interquartile.
Les moustaches montrent l'étendue des données non aberrantes.
Les points à l'extérieur des moustaches sont des valeurs aberrantes.
Comparaison de plusieurs boîtes permet d'analyser les différences de distribution.
Interprétation des probabilités
Comprendre les chances
La probabilité d'un événement indique la "chance" qu'il se produise.
Une probabilité de 0.2 signifie que l'événement se produit 20% du temps.
Une probabilité de 0.5 signifie que l'événement se produit 50% du temps (hasard pur).
Une probabilité proche de 1 indique un événement presque certain.
Une probabilité proche de 0 indique un événement presque impossible.
P(A|B) signifie "la probabilité de A sachant que B s'est produit".
Cela indique comment la connaissance de B modifie la probabilité de A.
Si P(A|B) > P(A), alors B augmente la probabilité de A.
Si P(A|B) < P(A), alors B diminue la probabilité de A.
Si P(A|B) = P(A), alors A et B sont indépendants.
Applications concrètes
Utilisations pratiques
- 1 Médecine (analyse des résultats de tests)
- 2 Qualité industrielle (contrôle de fabrication)
- 3 Finance (analyse des risques)
- 4 Marketing (analyse de comportement client)
- 5 Éducation (analyse des résultats scolaires)
Une usine de fabrication de pièces métalliques a une moyenne de 10.0 cm avec un écart-type de 0.1 cm. Cela signifie que la plupart des pièces (environ 95%) ont une longueur comprise entre 9.8 cm et 10.2 cm (moyenne ± 2 écart-types).
Si l'écart-type augmente, cela indique une dégradation de la qualité. Si la moyenne change, cela indique un problème de réglage de la machine.
Les statistiques permettent d'identifier ces changements et de prendre des mesures correctives.
Exercice d'application
Problème complet
Voici les résultats d'un test de satisfaction sur 100 clients :
| Score | 1 | 2 | 3 | 4 | 5 |
|---|---|---|---|---|---|
| Effectif | 5 | 10 | 30 | 40 | 15 |
1. Calculer la moyenne et interpréter.
2. Calculer la médiane et interpréter.
3. Calculer l'écart-type et interpréter.
4. Quel est le pourcentage de clients très satisfaits (score ≥ 4) ?
5. Interpréter l'ensemble des résultats.
Solution de l'exercice
Correction détaillée
\(\bar{x} = \frac{1×5 + 2×10 + 3×30 + 4×40 + 5×15}{100}\)
\(\bar{x} = \frac{5 + 20 + 90 + 160 + 75}{100} = \frac{350}{100} = 3.5\)
Interprétation : En moyenne, les clients attribuent un score de 3.5 sur 5 à la satisfaction. Cela indique un niveau de satisfaction modérément élevé.
Effectif total : 100, donc la médiane est la moyenne des 50ème et 51ème valeurs.
Effectifs cumulés : 5, 15, 45, 85, 100
La 50ème et la 51ème valeurs appartiennent à la classe de score 4.
Interprétation : 50% des clients attribuent un score inférieur ou égal à 4, et 50% attribuent un score supérieur ou égal à 4. La médiane est plus élevée que la moyenne, ce qui indique une distribution asymétrique vers la gauche.
Suite de la solution
Correction détaillée (suite)
Calculons d'abord \(\overline{x^2}\) : \(\overline{x^2} = \frac{1^2×5 + 2^2×10 + 3^2×30 + 4^2×40 + 5^2×15}{100}\)
\(\overline{x^2} = \frac{5 + 40 + 270 + 640 + 375}{100} = \frac{1330}{100} = 13.3\)
\(V = \overline{x^2} - (\bar{x})^2 = 13.3 - (3.5)^2 = 13.3 - 12.25 = 1.05\)
\(\sigma = \sqrt{1.05} \approx 1.02\)
Interprétation : Les scores diffèrent en moyenne de 1.02 points par rapport à la moyenne de 3.5. Cela indique une dispersion modérée des réponses.
Les clients très satisfaits ont un score ≥ 4, soit les scores 4 et 5.
Effectif des très satisfaits : 40 + 15 = 55
Pourcentage : (55/100) × 100% = 55%
Suite de la solution exercice
Correction détaillée (suite)
Voici l'interprétation globale des résultats :
- La moyenne de 3.5/5 indique un niveau de satisfaction modérément élevé
- La médiane de 4/5 est supérieure à la moyenne, ce qui suggère que la distribution est asymétrique avec plus de scores élevés
- L'écart-type de 1.02 montre une dispersion modérée des réponses
- 55% des clients sont très satisfaits (score ≥ 4), ce qui est un bon résultat
- Seulement 15% des clients sont peu satisfaits (score ≤ 2)
Conclusion : l'entreprise a un bon niveau de satisfaction client, mais pourrait améliorer davantage pour augmenter la proportion de clients très satisfaits.
Deuxième exercice
Problème complet
Un test médical a une sensibilité de 95% et une spécificité de 90%. La prévalence de la maladie dans la population est de 1%. On sélectionne une personne au hasard.
1. Calculer la probabilité que le test soit positif.
2. Sachant que le test est positif, quelle est la probabilité que la personne soit malade ?
3. Interpréter le résultat.
4. Calculer la probabilité que la personne soit saine sachant que le test est négatif.
Solution du deuxième exercice
Correction détaillée
Soit M l'événement "la personne est malade", T l'événement "le test est positif".
P(M) = 0.01 (prévalence de 1%)
P(T|M) = 0.95 (sensibilité de 95%)
P(T^c|M^c) = 0.90 (spécificité de 90%)
Donc P(T|M^c) = 1 - 0.90 = 0.10
Par la formule des probabilités totales :
P(T) = P(T|M) × P(M) + P(T|M^c) × P(M^c)
P(T) = 0.95 × 0.01 + 0.10 × 0.99 = 0.0095 + 0.099 = 0.1085
Donc la probabilité que le test soit positif est de 10.85%.
Suite de la solution exercice 2
Correction détaillée (suite)
Par la formule de Bayes :
P(M|T) = [P(T|M) × P(M)] / P(T)
P(M|T) = (0.95 × 0.01) / 0.1085 = 0.0095 / 0.1085 ≈ 0.0876
Donc la probabilité d'être malade sachant que le test est positif est d'environ 8.76%.
Ce résultat est surprenant : même avec un test fiable à 95%, seulement 8.76% des personnes avec un test positif sont réellement malades !
Cela est dû à la faible prévalence de la maladie (1%) : il y a plus de faux positifs que de vrais positifs.
Ce paradoxe montre l'importance de l'interprétation des résultats statistiques dans un contexte médical.
P(M^c|T^c) = [P(T^c|M^c) × P(M^c)] / P(T^c)
P(T^c) = 1 - P(T) = 1 - 0.1085 = 0.8915
P(M^c) = 1 - P(M) = 0.99
P(M^c|T^c) = (0.90 × 0.99) / 0.8915 = 0.891 / 0.8915 ≈ 0.9994
Résumé
Points clés
- Moyenne : valeur centrale qui équilibre la série
- Médiane : valeur qui divise la série en deux parties égales
- Mode : valeur la plus fréquente
- Écart-type : mesure de la dispersion autour de la moyenne
- Écart interquartile : mesure de la dispersion des 50% centrales
- Histogramme : forme de la distribution
- Boîte à moustaches : médiane, quartiles, valeurs extrêmes
- Nuage de points : relation entre deux variables
- P(A) : fréquence de A sur un grand nombre d'épreuves
- P(A|B) : influence de B sur la probabilité de A
- P(A ∩ B) : probabilité que A et B se produisent ensemble
Conclusion
Félicitations !
Continuez à pratiquer pour renforcer vos compétences