Exercice 39 / 100

Statistiques descriptives

Calculez mean, median, std, min, max d'une série de données

Les statistiques descriptives résument les caractéristiques principales d'un ensemble de données. NumPy fournit les fonctions de base.

Indicateurs de tendance centrale

np.mean(data) → moyenne arithmétique (sensible aux outliers) np.median(data) → médiane (valeur du milieu une fois trié)

Si tes données contiennent des valeurs extrêmes (un milliardaire dans des salaires), préfère la médiane.

La moyenne se laisse tirer par une valeur extrême alors que la médiane reste au milieu : c'est pour cela qu'on préfère la médiane sur des données à outliers

Indicateurs de dispersion

np.std(data) → écart-type (racine de la variance) np.var(data) → variance np.min(data) / np.max(data) np.ptp(data) → étendue (max - min) np.percentile(data, 25) → premier quartile np.percentile(data, 75) → troisième quartile np.percentile(data, [25, 50, 75]) → les trois d'un coup

iqr (interquartile range) = Q3 - Q1, utilisé pour détecter les outliers.

Formatage avec f-strings

f'{valeur:.2f}' → 2 décimales (3.14159 → '3.14') f'{valeur:.0%}' → pourcentage entier (0.87 → '87%') f'{valeur:,.0f}' → séparateur de milliers (1234567 → '1,234,567') f'{valeur:>10}' → aligné à droite sur 10 caractères

Exemple complet

import numpy as np data = [23, 45, 12, 67, 34, 89, 11, 56, 43, 78]
print(f'Moyenne: {np.mean(data):.2f}') print(f'Médiane: {np.median(data):.2f}') print(f'Écart-type: {np.std(data):.2f}') print(f'Min: {min(data)}, Max: {max(data)}')

NumPy a deux conventions pour l'écart-type :

np.std(data) divise par n (population)

np.std(data, ddof=1) divise par n-1 (échantillon — recommandé pour des données expérimentales)

exercise.py

Envie d'aller plus loin ? Découvrez nos formations certifiées Bac+2 à Bac+5 →