Statistiques
On dispose d'une liste de \( n \) paires de valeurs
\[ (x_1, y_1), (x_2, y_2), ..., (x_n, y_n) \]Pour déterminer si les valeurs des \( X \) sont corrélées aux valeurs de \( Y \), on effectue les calculs suivants:
- estimateur de la moyenne de \( X: \) \[ \overline{x} = \frac{x_1+x_2+...+x_n}{n} \]
- estimateur de la moyenne de \( Y: \) \[ \overline{y} = \frac{y_1+y_2+...+y_n}{n} \]
- estimateur de la variance de \( X: \qquad \) \( var(X) = \) \[ \frac{(x_1-\overline{x})^2 + (x_2-\overline{x})^2 + ... + (x_n-\overline{x})^2}{n} \]
- estimateur de la variance de \( Y: \qquad \) \( var(Y) = \) \[ \frac{(y_1-\overline{y})^2 + (y_2-\overline{y})^2 + ... + (y_n-\overline{y})^2}{n} \]
- estimateur de la covariance de \( X, Y: \qquad \) \( cov(X, Y) = \) \[ \small \frac{(x_1-\overline{x})\cdot(y_1-\overline{y}) + ... + (x_n-\overline{x})\cdot(y_n-\overline{y})} {n} \]
- estimateur de l'écart-type de \( X: \) \[ \hat{\sigma}_X = \sqrt{ var(X) } \]
- estimateur de l'écart-type de \( Y: \) \[ \hat{\sigma}_Y = \sqrt{ var(Y) } \]
Corrélation
- estimateur du coefficient de corrélation linéaire \( X, Y: \) \[ \hat{r} = \frac{cov(X, Y)}{\hat{\sigma}_X \cdot \hat{\sigma}_Y} \]
Régressions linéaires et ajustements
- régression linéaire \( \Delta y = \beta_1\cdot \Delta x \) où \[ \beta_1 = \frac{cov(X, Y)}{var(X)} \]
- ajustement affine \( y = \beta_0 + \beta_1\cdot x \) où \[ \beta_0 = \overline{y} - \beta_1\cdot \overline{x}\]
- régression linéaire \( \Delta x = \beta'_1\cdot \Delta y \) où \[ \beta'_1 = \frac{cov(X, Y)}{var(Y)} \]
- ajustement affine \( x = \beta'_0 + \beta'_1\cdot y \) où \[ \beta'_0 = \overline{x} - \beta'_1\cdot \overline{y}\]
Interprétation du coefficient de corrélation
Le nombre \( \hat{r} \) est compris entre -1 et 1.
- Si \( \hat{r} \) est compris entre 0.5 et 1, alors \( X, Y \) sont fortement corrélés positivement: l'augmentation de \( X \) va de pair avec l'augmentation de \( Y \), et réciproquement. Graphiquement se dégage une tendance générale manifestée par une droite ascendante autour de laquelle les points du nuage sont plus ou moins regroupés. La valeur exigée pour une bonne corrélation dépend du contexte.
- Si \( \hat{r} \) est compris entre -1 et -0.5, alors \( X, Y \) sont fortement corrélés négativement: l'augmentation de \( X \) va de pair avec la diminution de \( Y \), et réciproquement. Graphiquement se dégage une tendance générale manifestée par une droite descendante autour de laquelle sont plus ou moins regroupés les points du nuage. La valeur exigée pour une bonne corrélation dépend du contexte.
- Si \( \hat{r} \) est compris entre -0.5 et 0.5, alors \( X, Y \) sont faiblement, peu ou pas corrélés: une variation de \( X \) ne permet pas de prévoir la variation correspondante de \( Y \), et réciproquement. Typiquement, les points du nuage sont dispersés, aucune tendance générale ne se dégage, et il se peut que \( X, Y \) soient indépendants. Mais d'autres situations sont possibles: si les points dessinent une courbe, il peut s'agir d'une relation non linéaire. On ne peut pas tirer de conclusion uniquement à partir de la valeur de \( \hat{r} \).
La valeur de la corrélation se juge aussi, et même surtout, par l'observation du graphique du nuage de points.
Attention: une corrélation entre \( X, Y \) n'indique pas une relation de causalité.
Interprétation des régressions linéaires
Les régressions linéaires sont des droites ajustées par la méthode des moindres carrés. Elles permettent de faire une estimation de Y à partir de X, ou une estimation de X à partir de Y.
Le calculateur produit un graphique qui permet de les visualiser.
Pour conserver les données, on peut, avec un copier/coller, les enregistrer dans un fichier texte.