Deux écarts types pour une même série
Exercice · niveau 2 · mathématiques (ECT 1re année), chapitre 13 — Informatique et algorithmique · Statistiques et tableaux
Énoncé
Soit la série statistique , , , , . Calculer à la main sa moyenne, sa variance empirique et son écart type. Que rendent np.std et l'écart type de pandas sur cette série, et pourquoi diffèrent-ils ?
Corrigé
À la main. La moyenne vaut .
Les écarts à la moyenne sont , , , , ; leurs carrés valent , , , , , de somme .
La variance empirique, telle que la définit le programme, divise cette somme par l'effectif :
En Python.
import numpy as np
import pandas as pd
x = np.array([4, 7, 9, 10, 15])
print(np.mean(x), np.var(x), np.std(x))
# 9.0 13.2 3.63318042491699
print(pd.Series(x).std())
# 4.06201920231798
Pourquoi deux valeurs. La somme des carrés des écarts est la même, ; seul le diviseur change. numpy divise par et rend ; pandas divise par et rend . L'écart entre les deux atteint ici , sur la même série.
Le programme définissant les paramètres empiriques avec , la valeur attendue est celle de numpy.
Le point à retenir. Un indicateur n'est pas défini par la fonction qui le calcule. Avant de recopier un nombre affiché, on vérifie la convention de la bibliothèque — et l'écart entre les deux conventions grandit d'autant plus que l'échantillon est petit.
Les autres exercices de ce chapitre Le cours du chapitre
Un blocage sur cet exercice ? Le tuteur d'Adloun guide par questions, sans donner la réponse.