Adloun

Analyse de l'information chiffrée

Cours complet · enseignement scientifique (première), chapitre 15 · première, enseignement scientifique

Travailler ce chapitre sur Adloun Exercices corrigés de ce chapitre

15.1 Introduction : un chiffre tout seul ne dit rien

Vous avez entendu cent fois des phrases de ce genre, à la radio, dans un journal, sur un réseau social :

Aucune de ces phrases ne parle d'un seul nombre : chacune croise deux informations — le sexe et le temps de travail, l'année et un niveau mesuré, la masse d'une voiture et ses émissions. Un chiffre isolé, « 28 % », ne veut rien dire ; c'est le rapprochement de deux caractères qui produit du sens, et parfois de la polémique.

Jusqu'ici vous avez surtout appris à résumer un caractère : une moyenne, une médiane, des quartiles. C'est utile, mais c'est court, car les questions qui intéressent un citoyen sont presque toujours des questions de lien : le diplôme protège-t-il du chômage ? la mer monte-t-elle, et de combien en 2050 ?

Ce chapitre apprend donc à faire trois choses, et rien de plus :

Il n'y a dans tout cela aucune formule à apprendre par cœur. Il y a des gestes à acquérir, un vocabulaire précis, et surtout une exigence : dire de quoi on parle. C'est la partie du programme la plus directement utile dans la vie ; c'est aussi celle où l'on se fait le plus facilement manipuler.

Définition 15.1Vocabulaire de départ

On étudie une population (des personnes, des voitures, des années…). Chaque élément de la population est un individu. Ce que l'on observe sur chaque individu est un caractère.

  • Un caractère est qualitatif si ses valeurs sont des catégories, sur lesquelles on ne calcule pas : le sexe, la couleur, le mode de transport, le diplôme le plus élevé.
  • Un caractère est quantitatif si ses valeurs sont des nombres sur lesquels un calcul a un sens : une masse en kilogrammes, une température en degrés, une année, un salaire en euros.

Lorsqu'on observe deux caractères sur les mêmes individus, on parle de série statistique double, et l'étude qu'on en fait s'appelle une analyse bivariée.

iRemarqueUn caractère quantitatif peut être regroupé en classes

L'âge est quantitatif. Mais si l'on range les individus en trois tranches — moins de 25 ans, de 25 à 49 ans, 50 ans et plus — on l'a transformé en un caractère à trois catégories, que l'on traitera comme un caractère qualitatif. Ce regroupement en classes est très fréquent : il fait perdre du détail, mais il rend le tableau lisible.

iRemarqueL'avertissement à ne jamais oublier : un lien n'est pas une cause

En été, les ventes de glaces augmentent ; en été, le nombre de noyades augmente aussi. Les deux caractères varient donc ensemble. Faut-il en conclure que manger une glace fait se noyer ? Évidemment non : les deux dépendent d'une même troisième cause, la chaleur, qui envoie les gens à la fois vers les glaciers et vers l'eau.

Retenez-le une fois pour toutes : constater que deux caractères varient ensemble ne prouve jamais que l'un provoque l'autre. Tout ce chapitre fabrique des liens ; c'est votre esprit critique, pas la statistique, qui décidera de ce qu'ils signifient.

15.2 Croiser deux caractères qualitatifs : le tableau croisé d'effectifs

15.2.1 Ranger les individus dans un tableau

Reprenons la première phrase. Un échantillon de 2 000 personnes ayant un emploi a été tiré au sort dans les données de l'enquête Emploi de l'Insee. Sur chacune, on a noté deux caractères qualitatifs : le sexe (deux catégories) et le temps de travail (temps complet ou temps partiel). Voici le résultat.

Temps completTemps partielTotal
Hommes966841 050
Femmes684266950
Total1 6503502 000
Définition 15.2Tableau croisé d'effectifs

Un tableau croisé d'effectifs range les individus selon deux caractères qualitatifs : une catégorie du premier par ligne, une catégorie du second par colonne. Dans chaque case intérieure on écrit le nombre d'individus, appelé effectif, qui possèdent à la fois la catégorie de la ligne et celle de la colonne.

La dernière colonne et la dernière ligne contiennent les effectifs marginaux : ce sont les totaux par ligne et par colonne, c'est-à-dire les effectifs de chaque caractère pris séparément. La case du coin est l'effectif total.

Le tableau se vérifie tout seul : la somme des totaux de lignes et la somme des totaux de colonnes doivent donner le même nombre, l'effectif total. Ici et . Si les deux sommes ne coïncident pas, il y a une erreur quelque part.

Méthode : Compléter un tableau croisé d'effectifs

Un tableau croisé se complète en n'utilisant que des additions et des soustractions.

  • Repérer les cases connues et l'effectif total.
  • Compléter d'abord toute ligne ou toute colonne à laquelle il ne manque qu'une seule case : la case manquante est le total moins les autres.
  • Recommencer : chaque case complétée en libère de nouvelles.
  • Vérifier à la fin que les deux sommes marginales redonnent l'effectif total.
Exemple 15.3Un tableau à trous

Dans un lycée de 800 élèves, 460 sont demi-pensionnaires. Parmi les 350 élèves de seconde, 210 sont demi-pensionnaires. Complétons.

Demi-pensionExternatTotal
Seconde210?350
Autres niveaux???
Total460?800

Ligne « Seconde » : externat .
Colonne « Total » : autres niveaux .
Colonne « Demi-pension » : autres niveaux .
Ligne « Autres niveaux » : externat .
Colonne « Externat » : total .

Vérification : . ✓

15.2.2 Trois pourcentages pour une seule case

Le tableau des 2 000 actifs contient la case « femmes à temps partiel : 266 ». Combien cela fait-il en pourcentage ? La question, telle quelle, n'a pas de réponse, car elle ne dit pas pourcentage de quoi. Il y a trois réponses possibles, et toutes les trois sont exactes.

Ces trois nombres disent trois choses différentes :

Une bonne partie des désaccords sur les chiffres vient de là : deux personnes citent deux pourcentages différents, tous deux justes, et croient se contredire.

Définition 15.4Les trois familles de fréquences

Soit une case d'effectif dans un tableau croisé, située sur une ligne de total et une colonne de total , l'effectif total étant .

  • La fréquence globale de la case est : la part de cette case dans l'ensemble de la population.
  • La fréquence en ligne est . L'ensemble des fréquences d'une même ligne forme le profil de cette ligne ; leur somme vaut 1, c'est-à-dire 100 %.
  • La fréquence en colonne est . L'ensemble des fréquences d'une même colonne forme le profil de cette colonne ; leur somme vaut également 100 %.
Proposition 15.5Choisir la bonne fréquence

Le choix ne dépend pas des données, mais de la question posée.

  • Pour comparer deux groupes entre eux, on calcule les profils des lignes (ou des colonnes) qui correspondent à ces groupes : c'est la seule façon honnête de comparer des groupes de tailles différentes.
  • Pour dire quelle part de l'ensemble représente une situation, on calcule la fréquence globale.

Et dans tous les cas, on énonce le pourcentage avec sa population de référence : « 28 % des femmes actives », jamais « 28 % » tout court.

Méthode : Calculer et comparer des profils

  • Choisir le sens de lecture : par ligne si l'on veut comparer les lignes, par colonne si l'on veut comparer les colonnes.
  • Diviser chaque effectif de la ligne (ou de la colonne) par le total de cette ligne (ou de cette colonne).
  • Convertir en pourcentage et vérifier que le profil totalise bien 100 %, aux arrondis près.
  • Comparer les profils entre eux, et les comparer au profil de l'ensemble.
Exemple 15.6Les profils par sexe

Divisons chaque ligne du tableau des 2 000 actifs par son total.

Profil de la ligneTemps completTemps partielTotal
Hommes100 %
Femmes100 %
Ensemble100 %

La comparaison est nette : 28 % contre 8 %, soit trois fois et demie plus de temps partiel chez les femmes que chez les hommes. Le profil de l'ensemble, 17,5 %, se situe entre les deux — c'est toujours le cas, et cela donne un repère commode.

Attention : ces chiffres décrivent, ils n'expliquent pas. Ils ne disent pas si ce temps partiel est choisi ou subi, ni pourquoi il est si inégalement réparti. Ce sont d'autres enquêtes qui répondent à ces questions.

iRemarqueQuand les deux caractères sont-ils « sans lien » ?

Si le profil de chaque ligne était identique au profil de l'ensemble, connaître la ligne n'apprendrait rien sur la colonne : les deux caractères seraient sans lien. Ici les profils s'écartent beaucoup du profil d'ensemble (8 % et 28 % contre 17,5 %) : le lien est fort. Vous retrouverez cette idée, sous une forme plus précise, avec l'indépendance de deux évènements au chapitre suivant.

15.3 Voir le croisement : diagrammes en barres et diagrammes circulaires

Un tableau se lit ; un diagramme se voit. Le bon diagramme n'est pas le plus joli, c'est celui qui répond à la question posée. Trois questions, trois diagrammes.

15.3.1 Comparer des effectifs : le diagramme en barres groupées

Définition 15.7Diagramme en barres

Dans un diagramme en barres, chaque catégorie est représentée par une barre dont la longueur est proportionnelle à l'effectif (ou à la fréquence) qu'elle représente. Toutes les barres ont la même largeur, et l'axe des effectifs part de zéro.

Pour croiser deux caractères, on groupe les barres : un groupe par catégorie du premier caractère, et dans chaque groupe une barre par catégorie du second.


Temps de travail selon le sexe,

échantillon de 2 000 actifs occupés (d'après l'enquête Emploi de l'Insee). Ce diagramme montre des effectifs. On y voit tout de suite que la barre orange des femmes est trois fois plus haute que celle des hommes — mais on ne peut pas comparer directement les deux groupes, puisqu'ils n'ont pas le même nombre de personnes (1 050 et 950).</div>

Méthode : Construire un diagramme en barres groupées

  • Choisir le caractère qui donnera les groupes, et celui qui donnera les couleurs.
  • Repérer l'effectif le plus grand ; choisir une graduation régulière de l'axe vertical qui le contienne et qui commence à 0.
  • Tracer les barres, de largeur constante, en laissant un espace entre les groupes mais pas à l'intérieur d'un groupe.
  • Ajouter obligatoirement : le titre, la légende des couleurs, le nom et l'unité de l'axe vertical, et la source des données.

15.3.2 Comparer des profils : le diagramme en barres empilées

Pour comparer deux groupes de tailles différentes, il faut passer aux pourcentages. On empile alors, pour chaque groupe, des barres de même longueur totale, représentant 100 % du groupe.


Les mêmes données, en profils.

Chaque barre vaut 100 % de son groupe : les longueurs sont donc comparables. La barre « Ensemble », en teinte plus claire, sert de repère — le profil des hommes est très au-dessous, celui des femmes très au-dessus. C'est ce diagramme, et non le précédent, qui répond à la question « les femmes travaillent-elles plus souvent à temps partiel ? ».</div>

15.3.3 Représenter une répartition : le diagramme circulaire

Quand on veut montrer comment un tout se partage entre plusieurs catégories, on peut découper un disque en secteurs. La règle est simple : l'angle est proportionnel à la fréquence.

Définition 15.8Diagramme circulaire et diagramme semi-circulaire

Dans un diagramme circulaire, chaque catégorie occupe un secteur du disque dont l'angle au centre, en degrés, vaut

Dans un diagramme semi-circulaire, on n'utilise qu'un demi-disque et l'angle vaut .

Dans les deux cas, la somme des angles reconstitue exactement le tour complet (360°) ou le demi-tour (180°).

Méthode : Construire un diagramme circulaire

  • Calculer le total, puis la fréquence de chaque catégorie.
  • Multiplier chaque fréquence par 360 (ou par 180 pour un demi-disque) et arrondir au degré ou au dixième de degré.
  • Vérifier que la somme des angles fait bien 360°{} (ou 180°). Un écart de 1°{} est normal, il vient des arrondis ; un écart plus grand signale une erreur.
  • Reporter les angles au rapporteur, en partant du haut et en tournant toujours dans le même sens, en général du plus grand secteur au plus petit.
  • Légender chaque secteur et écrire le pourcentage.
Exemple 15.9Comment va-t-on au travail ?

On interroge 1 200 actifs sur leur mode de transport principal pour se rendre au travail, en distinguant ceux qui résident dans une commune dense et ceux qui résident dans une commune peu dense (données construites d'après le recensement de l'Insee).

Zone denseZone peu denseTotal
Voiture300510810
Transports en commun18030210
Marche ou vélo9648144
Deux-roues motorisé241236
Total6006001 200

Profil de la colonne « zone dense » et angles correspondants :

Somme : . ✓

Profil de l'ensemble des 1 200 actifs, en demi-disque :

Somme : . ✓


À gauche, un diagramme

circulaire : la répartition des modes de transport dans les communes denses. À droite, la répartition de l'ensemble des 1 200 actifs, cette fois en demi-disque : c'est exactement la même information, avec des angles deux fois plus petits. La voiture passe de 50 % à 67,5 % quand on ajoute les communes peu denses — ce sont bien deux profils de colonnes différents que l'on compare.</div>

iRemarqueQuel diagramme pour quelle question ?
  • Barres groupées : pour comparer des effectifs, ou plusieurs catégories entre elles.
  • Barres empilées à 100 % : pour comparer des profils, donc des groupes de tailles différentes.
  • Circulaire : pour montrer une seule répartition. Il devient illisible au-delà de cinq ou six secteurs, et il est très maladroit pour comparer deux répartitions — l'œil compare mal deux angles.
iRemarqueTrois façons de mentir avec un diagramme juste
  • L'axe tronqué. Si l'axe vertical d'un diagramme en barres commence à 95 au lieu de 0, un écart de 1 % devient une falaise. Premier réflexe devant un graphique : regarder où commence l'axe.
  • L'effectif déguisé en profil. Dire qu'il y a plus de femmes que d'hommes à temps partiel (vrai : 266 contre 84) ne revient pas à dire que les femmes sont plus souvent à temps partiel (vrai aussi : 28 % contre 8 %). Seul le second énoncé compare vraiment.
  • Les aires. Un dessin où l'on double à la fois la largeur et la hauteur d'une image pour représenter un doublement multiplie en réalité la surface par quatre. L'œil lit la surface, pas la hauteur.

15.4 Croiser deux caractères quantitatifs : le nuage de points

15.4.1 Les séries chronologiques et la courbe d'évolution

Quand le premier caractère est le temps, la série s'appelle une série chronologique : on observe une grandeur année après année. C'est le cas le plus fréquent dans les débats publics.

Voici l'indicateur thermique national, c'est-à-dire la température moyenne annuelle sur la France métropolitaine, publié par Météo-France.

Année2014201520162017201820192020202120222023
Température (°C)13,813,412,913,413,913,714,112,814,514,4

Courbe d'évolution de la

température moyenne annuelle en France métropolitaine (source : Météo-France, indicateur thermique national). Le double trait sur l'axe vertical prévient que la graduation ne commence pas à zéro. Deux enseignements : les variations d'une année sur l'autre sont fortes et désordonnées (2021 est plus froide que 2014), et pourtant toutes les années de la décennie sauf une sont au-dessus de la normale 1991-2020.</div>

iRemarqueA-t-on le droit de relier les points ?

Relier deux points par un segment revient à affirmer que la grandeur a pris toutes les valeurs intermédiaires entre les deux dates. C'est raisonnable pour une température, une population, un niveau de la mer, qui varient continûment. Ce serait absurde pour le nombre de buts marqués par journée de championnat.

Retenez la règle : on relie les points d'une série chronologique pour aider l'œil à suivre l'évolution ; on ne les relie jamais quand le premier caractère n'est pas le temps.

15.4.2 Le nuage de points

Le temps n'est pas le seul caractère quantitatif intéressant. Voici dix modèles de voitures neuves, avec leur masse à vide et leurs émissions de dioxyde de carbone mesurées en cycle homologué (données construites d'après la base de données de l'Ademe sur les véhicules commercialisés en France).

Masse (kg)1 0201 1001 1801 3001 4001 5001 6201 7001 7801 900
CO (g/km)118112128132145149168172175196
Définition 15.10Nuage de points

On considère une série statistique double dont les deux caractères sont quantitatifs. Dans un repère où l'axe horizontal porte le premier caractère et l'axe vertical le second, on place, pour chaque individu, le point de coordonnées . L'ensemble de ces points s'appelle le nuage de points de la série.

Méthode : Construire un nuage de points

  • Repérer la plus petite et la plus grande valeur de chaque caractère.
  • Choisir pour chaque axe une graduation régulière qui couvre cet intervalle. Les axes n'ont pas besoin de commencer à zéro — un nuage n'est pas un diagramme en barres — mais il faut alors le signaler, par exemple par un double trait près de l'origine.
  • Placer les points, sans les relier.
  • Nommer chaque axe avec son unité, et indiquer la source.
  • Regarder la forme obtenue avant de calculer quoi que ce soit.

Cette dernière étape est la plus importante et c'est celle que l'on saute le plus souvent. Un nuage peut être allongé le long d'une droite, allongé le long d'une courbe, réparti sans forme, ou séparé en deux paquets. Seul le premier cas justifiera la suite de ce chapitre.

15.5 Le point moyen

Définition 15.11Point moyen

Soit une série double . On note la moyenne des abscisses et la moyenne des ordonnées :

Le point de coordonnées s'appelle le point moyen du nuage.

Méthode : Calculer les coordonnées du point moyen

  • Additionner toutes les valeurs de ; diviser par l'effectif : on obtient .
  • Faire de même avec les valeurs de : on obtient .
  • Écrire et le placer sur le nuage.

Le point moyen n'appartient pas nécessairement au nuage : ce n'est pas un individu, c'est le « centre d'équilibre » de l'ensemble.

Exemple 15.12Le point moyen du nuage masse-CO

Somme des masses :

donc kg.

Somme des émissions :

donc g/km.

Le point moyen est . Il se lit ainsi : une voiture moyenne de cet échantillon pèse 1 450 kg et émet 149,5 g de CO par kilomètre. Aucun des dix modèles n'a exactement ces caractéristiques.


Nuage de points des dix modèles

et son point moyen . Le nuage est nettement allongé et monte de la gauche vers la droite : plus la voiture est lourde, plus elle émet. Les doubles traits près de l'origine rappellent que les deux axes sont « coupés ».</div>

15.6 Ajuster : une droite pour résumer le nuage

15.6.1 L'idée

Le nuage de la figure 15.5 est allongé le long d'une direction. On aimerait le remplacer par une droite unique : elle résumerait les dix modèles en une seule phrase, et surtout elle permettrait de répondre à des questions auxquelles le tableau ne répond pas, du type « et une voiture de 1 650 kg, elle émet combien ? ».

Définition 15.13Ajustement affine

Ajuster affinement un nuage de points, c'est choisir une droite non verticale, d'équation , qui passe « au plus près » de l'ensemble des points. Cette droite s'appelle une droite d'ajustement du nuage, et l'équation constitue un modèle affine de la série.

Un ajustement affine n'a de sens que si le nuage est visiblement allongé le long d'une direction. Sur un nuage rond ou en forme de banane, toute droite serait une trahison.

Il existe plusieurs manières de tracer cette droite. Le programme en mentionne trois, et n'exige la théorie d'aucune : ce qui compte est de savoir obtenir une droite, écrire son équation, et s'en servir.

15.6.2 Première méthode : l'ajustement au jugé

La plus simple, et la plus honnête quand on n'a qu'un crayon : on pose sa règle sur le nuage et on trace la droite qui semble le traverser en son milieu, en laissant autant de points d'un côté que de l'autre. Pour ne pas faire n'importe quoi, on s'impose une contrainte : la droite doit passer par le point moyen .

Méthode : Ajuster au jugé et écrire l'équation de la droite

  • Placer le point moyen sur le nuage.
  • Tracer à la règle une droite passant par et suivant la direction générale du nuage, avec à peu près autant de points au-dessus qu'au-dessous.
  • Lire sur le graphique les coordonnées de deux points et de cette droite, choisis éloignés l'un de l'autre et si possible sur des croisements de la grille.
  • Calculer le coefficient directeur .
  • Calculer l'ordonnée à l'origine : .
  • Conclure : , et donner le sens de dans le contexte.

15.6.3 Deuxième méthode : la droite de Mayer

L'ajustement au jugé a un défaut : deux élèves obtiennent deux droites différentes. La droite de Mayer supprime cet arbitraire par une recette purement mécanique.

Méthode : Construire la droite de Mayer

  • Ranger les points du nuage dans l'ordre croissant des abscisses.
  • Les couper en deux groupes de même effectif : la première moitié et la seconde moitié. (Si l'effectif est impair, on écarte le point du milieu.)
  • Calculer le point moyen du premier groupe et le point moyen du second.
  • La droite de Mayer est la droite . Son coefficient directeur est , puis .
Exemple 15.14Droite de Mayer du nuage masse-CO

Les dix modèles sont déjà rangés par masse croissante. On coupe après le cinquième.

Premier groupe (masses 1 020 à 1 400) :

Second groupe (masses 1 500 à 1 900) :

Coefficient directeur :

Ordonnée à l'origine :

La droite de Mayer a donc pour équation .

Interprétation du coefficient directeur — et c'est elle qui compte : 100 kg de plus, c'est environ grammes de CO de plus par kilomètre parcouru.


La droite de Mayer du nuage

masse-CO. Le nuage est coupé en deux moitiés ; chaque moitié fournit son point moyen, et la droite joint les deux. Elle passe exactement par le point moyen de l'ensemble : c'est une propriété générale quand les deux groupes ont le même effectif.</div>

Proposition 15.15La droite d'ajustement passe par le point moyen

Lorsque le nuage est coupé en deux groupes de même effectif, la droite de Mayer passe par le point moyen du nuage entier.

La droite obtenue par la méthode des moindres carrés (paragraphe suivant) passe elle aussi par . C'est pourquoi, dans un ajustement au jugé, on impose à la règle de passer par .

Démonstration (dans le cas de la droite de Mayer)

Notons l'effectif total, supposé pair, et l'effectif de chaque groupe. La somme de toutes les abscisses est la somme des abscisses du premier groupe plus celle du second, c'est-à-dire . Donc

et de la même façon .

Les coordonnées de sont donc les moyennes des coordonnées de et de : est le milieu du segment . Un milieu appartient toujours au segment, donc à la droite : appartient à la droite de Mayer.

15.6.4 Troisième méthode : la droite des moindres carrés

Toutes les calculatrices de lycée et tous les tableurs savent produire directement une droite d'ajustement, appelée droite des moindres carrés ou droite de régression. On lui donne les deux listes de valeurs, et elle renvoie et .

iRemarqueCe que fait la machine — hors programme

La droite des moindres carrés est celle qui rend la somme des carrés des écarts verticaux entre les points et la droite aussi petite que possible. Aucune connaissance théorique sur ce procédé n'est attendue de vous, et il n'y a aucune formule à retenir : sachez seulement que la machine choisit la droite selon un critère précis, toujours le même, ce qui garantit que deux personnes trouveront la même droite.

Sur le nuage masse-CO, la calculatrice donne et , soit

Les deux droites sont pratiquement confondues. Pour une voiture de 1 650 kg, l'une prévoit 167,6 g/km et l'autre 167,5 g/km : l'écart est bien plus petit que l'incertitude des données elles-mêmes. C'est presque toujours ainsi : quand un nuage est franchement allongé, toutes les méthodes raisonnables donnent la même réponse ; quand elles divergent, c'est le signe que l'ajustement affine n'était pas adapté.

iRemarqueLe coefficient directeur, c'est le message

n'est pas un nombre abstrait : c'est « 9 g de CO par kilomètre pour 100 kg de plus ». De même, dans une série chronologique, est une vitesse d'évolution par an. Une équation d'ajustement que l'on ne sait pas traduire en une phrase n'a servi à rien.

15.7 Interpoler, extrapoler

Une fois la droite obtenue, on s'en sert pour estimer des valeurs que l'on n'a pas mesurées. Selon l'endroit où l'on se place, l'opération porte deux noms différents — et présente deux niveaux de risque très différents.

Définition 15.16Interpolation et extrapolation

Soit une série double dont les abscisses observées vont de à . Estimer une valeur à l'aide du modèle affine, c'est faire :

  • une interpolation si l'abscisse choisie est à l'intérieur de l'intervalle : on comble un trou entre des données existantes ;
  • une extrapolation si l'abscisse choisie est à l'extérieur de cet intervalle : on prolonge le modèle au-delà du domaine observé.

Méthode : Interpoler ou extrapoler

Par le calcul : remplacer par la valeur voulue dans l'équation et effectuer.

Graphiquement : partir de la valeur de sur l'axe horizontal, monter verticalement jusqu'à la droite, puis se déplacer horizontalement jusqu'à l'axe vertical et lire.

Dans les deux cas, terminer par une phrase qui rappelle le contexte, les unités, et le statut du résultat : c'est une estimation fournie par un modèle, pas une mesure.

Exemple 15.17Le niveau moyen de la mer

Depuis 1993, des satellites mesurent en continu le niveau moyen des océans. Voici la hausse cumulée, en millimètres, par rapport à 1993 (données d'altimétrie satellitaire, telles que publiées par la Nasa et reprises dans les rapports du Giec).

Année1993199820032008201320182023
Rang 051015202530
Hausse (mm)01532506784102

On pose : cela évite de manipuler des nombres à quatre chiffres, et rend l'ordonnée à l'origine lisible.

Point moyen :

Donc , c'est-à-dire l'année 2008 et 50 mm.

Ajustement : la calculatrice donne . Le coefficient directeur se traduit immédiatement : la mer monte d'environ 3,4 mm par an, soit 3,4 cm par décennie.

Interpolation en 2011, année pour laquelle le tableau ne donne rien. Ici , valeur bien située entre 0 et 30 :

En 2011, le niveau moyen de la mer était d'environ 6 cm au-dessus de celui de 1993. Cette estimation est solide : elle se contente de combler un trou entre deux mesures qui l'encadrent.

Extrapolation en 2050. Ici , très en dehors du domaine observé :

soit environ 19 cm. Cette estimation-là est beaucoup plus fragile, et la figure 15.7 montre pourquoi.


Interpolation et extrapolation

du niveau moyen de la mer. Dans la zone verte, la droite passe au milieu des points mesurés et l'interpolation de 2011 (60 mm) est fiable. Dans la zone orange, il n'y a plus aucune mesure : la droite bleue n'y est qu'une hypothèse. Or les mesures montrent que la hausse s'accélère — la courbe violette prolonge cette accélération et donne 256 mm en 2050, soit un tiers de plus que le modèle affine.</div>

Proposition 15.18Interpolation, extrapolation : ce qu'il faut retenir
  • Une interpolation est en général fiable : le modèle est utilisé là où il a été construit et vérifié.
  • Une extrapolation est toujours un pari. Elle suppose que le phénomène continuera de se comporter exactement comme avant, ce que rien ne garantit. Plus on s'éloigne du domaine observé, plus le pari est risqué.
  • Un résultat d'extrapolation doit toujours être annoncé avec sa condition : « si l'évolution restait linéaire, alors… ».
Exemple 15.19Une extrapolation clairement abusive

Reprenons les dix températures annuelles de la figure 15.4, avec . La droite de Mayer, calculée sur les deux groupes de cinq années, a pour équation (vous le vérifierez à l'exercice 10).

Extrapolons en 2050, c'est-à-dire :

soit °C de plus qu'en 2014. Ce chiffre est à rejeter, pour trois raisons cumulées :

  • on extrapole sur 27 ans à partir de 10 ans d'observation seulement ;
  • les écarts d'une année à l'autre (12,8 °C en 2021, 14,5 °C en 2022) sont du même ordre de grandeur que la tendance cherchée : le « signal » est noyé dans le « bruit » ;
  • en climatologie, une tendance ne se calcule pas sur dix ans mais sur trente, précisément pour cette raison.

La droite décrit correctement la décennie observée ; elle ne prédit rien du tout au-delà. Savoir refuser un calcul que l'on sait pourtant faire fait aussi partie des mathématiques.

15.8 Faire le travail au tableur

Le programme demande explicitement de savoir utiliser un tableur pour représenter des données sous forme de tableau ou de diagramme. Les données réelles arrivent aujourd'hui sous forme de fichiers — sur le site de l'Insee, de l'Ined, sur data.gouv.fr ou dans les annexes des rapports du Giec — et personne ne les recopie à la main.

Méthode : Construire un tableau croisé et un diagramme au tableur

  • Saisir ou importer les données : une ligne par individu, une colonne par caractère, avec les intitulés en première ligne.
  • Compter les individus de chaque croisement avec =NB.SI.ENS(plage1 ; critère1 ; plage2 ; critère2), ou utiliser directement la fonction « tableau croisé dynamique » du tableur.
  • Calculer les totaux avec =SOMME(plage), et les profils en divisant chaque case par le total de sa ligne — en pensant à bloquer la référence de la colonne des totaux avec le signe `\\rightarrow$ Diagramme, et choisir : barres groupées, barres empilées, secteurs ou nuage de points* selon la question posée.
  • Titrer le graphique, nommer les axes, citer la source.

Méthode : Obtenir une droite d'ajustement au tableur

  • Construire le nuage de points (type de graphique : XY, nuage de points, surtout pas « courbe »).
  • Clic droit sur un point Ajouter une courbe de tendance Linéaire, puis cocher Afficher l'équation.
  • Ou bien, sans graphique, les deux fonctions =PENTE(plage_y ; plage_x) et =ORDONNEE.ORIGINE(plage_y ; plage_x) donnent respectivement et .
  • Le point moyen s'obtient avec =MOYENNE(plage_x) et =MOYENNE(plage_y).

Un tableur n'est pas obligatoire : quelques lignes de Python font le même travail, et montrent que ces calculs n'ont rien de mystérieux. Le programme ci-dessous n'est donné qu'en illustration ; aucun code n'est exigible.


masses = [1020, 1100, 1180, 1300, 1400, 1500, 1620, 1700, 1780, 1900]
co2    = [ 118,  112,  128,  132,  145,  149,  168,  172,  175,  196]

def moyenne(valeurs):
    return sum(valeurs) / len(valeurs)

# Point moyen du nuage
print("G(", moyenne(masses), ";", moyenne(co2), ")")

# Droite de Mayer : on coupe la serie en deux moities de meme effectif
milieu = len(masses) // 2
x1, y1 = moyenne(masses[:milieu]), moyenne(co2[:milieu])
x2, y2 = moyenne(masses[milieu:]), moyenne(co2[milieu:])
a = (y2 - y1) / (x2 - x1)
b = y1 - a * x1
print("y =", round(a, 4), "x +", round(b, 2))

L'exécution affiche G( 1450.0 ; 149.5 ) puis y = 0.09 x + 19.0 : exactement les résultats trouvés à la main.

15.9 Automatismes

Les capacités qui suivent ne font pas l'objet d'un cours nouveau : elles ont été travaillées les années précédentes et doivent rester disponibles sans réfléchir. Entraînez-vous en quelques minutes, régulièrement, plutôt qu'une heure la veille du contrôle. Les réponses sont données à la suite de chaque série.

15.9.1 Évolutions et variations

Définition 15.20Taux d'évolution et coefficient multiplicateur

Une grandeur passe de la valeur initiale à la valeur finale .

  • Le taux d'évolution est , que l'on exprime en pourcentage.
  • Le coefficient multiplicateur est , et l'on a .

Augmenter de 20 % revient à multiplier par ; diminuer de 20 % revient à multiplier par .

Proposition 15.21Les trois règles utiles
  • Évolutions successives : les coefficients multiplicateurs se multiplient, les taux ne s'additionnent pas.
  • Évolution réciproque : le coefficient multiplicateur qui ramène à la valeur de départ est .
  • Points et pourcentages : passer de 12 % à 15 %, c'est une hausse de 3 points, mais de 25 % en valeur relative . Les deux formulations sont justes et ne disent pas la même chose.

Méthode : Questions flash — évolutions

  • Un loyer de 620 € augmente de 3,5 %. Nouveau loyer ?
  • Après une baisse de 15 %, un article coûte 51 €. Prix initial ?
  • Un prix augmente de 10 % puis baisse de 10 %. Évolution globale ?
  • Une population a été multipliée par 1,45 en dix ans. Taux d'évolution ?
  • Un abonnement augmente de 25 %. Quel pourcentage de baisse ramènerait au prix initial ?
  • Le taux de chômage passe de 8,0 % à 7,2 %. Baisse en points, puis en pourcentage ?

Réponses. 1. €.   2. €.   3. , soit .   4. .   5. , soit .   6. point ; , soit .

15.9.2 Lire un graphique, un tableau, un diagramme en boîte

Vous devez pouvoir lire n'importe quelle représentation : repérer l'origine du repère, les unités et les échelles, et passer du graphique aux données comme des données au graphique.

Définition 15.22Indicateurs d'une série et diagramme en boîte

Pour une série de valeurs numériques rangées dans l'ordre croissant :

  • la moyenne est la somme divisée par l'effectif ;
  • la médiane partage la série en deux moitiés de même effectif ;
  • le premier quartile est la plus petite valeur telle qu'au moins 25 % des données lui soient inférieures ou égales ; le troisième quartile , celle pour au moins 75 % ;
  • l'étendue est la différence entre la plus grande et la plus petite valeur ; l'écart interquartile est ;
  • les déciles et délimitent respectivement les 10 % les plus petites et les 10 % les plus grandes valeurs.

Le diagramme en boîte résume tout cela : une boîte allant de à , un trait pour la médiane, et deux moustaches allant jusqu'aux valeurs extrêmes ou, comme ici, jusqu'à et .


Distribution des salaires nets

mensuels en équivalent temps plein dans le secteur privé, selon le sexe (ordres de grandeur d'après l'Insee). La boîte des femmes est entièrement décalée vers la gauche : à chaque niveau — premier décile, quartiles, médiane, dernier décile — le salaire féminin est inférieur. Notez que la moyenne, elle, n'apparaît nulle part sur un diagramme en boîte.</div>

Méthode : Questions flash — lire la figure 15.8

  • Quel est le salaire médian des hommes ? des femmes ?
  • Quelle proportion de femmes gagne moins de 1 720 € par mois ?
  • Quel est l'écart interquartile pour les hommes ? Pour les femmes ?
  • Quelle est la valeur de pour les femmes, et que signifie-t-elle ?
  • De combien de pourcents le salaire médian des femmes est-il inférieur à celui des hommes ?
  • Peut-on lire la moyenne sur ce diagramme ?

Réponses. 1. 2 290 € et 2 040 €.   2. 25 %, puisque 1 720 € est le premier quartile.   3. € ; € : les salaires féminins sont plus resserrés.   4. 2 680 € : trois femmes sur quatre gagnent moins que cela.   5. , soit environ .   6. Non : un diagramme en boîte ne montre que des positions (quartiles, médiane, déciles), jamais la moyenne.

15.9.3 Droites et coefficient directeur

Ces automatismes-là servent directement à écrire l'équation d'une droite d'ajustement.

Proposition 15.23Ce qu'il faut savoir faire sur une droite
  • Déterminer le coefficient directeur d'une droite passant par et : .
  • Tracer une droite donnée par son équation réduite : placer le point , puis avancer de 1 vers la droite et monter de .
  • Lire graphiquement l'équation réduite d'une droite : est l'ordonnée du point d'abscisse 0, se lit en comptant la montée pour un déplacement horizontal de 1.
  • Résoudre graphiquement ou : tracer la droite horizontale d'ordonnée et lire les abscisses.

Méthode : Questions flash — droites

  • Coefficient directeur de la droite passant par et ?
  • Équation réduite de cette droite ?
  • Une droite d'ajustement a pour équation . Que vaut pour ?
  • Pour quelle valeur de a-t-on avec la même droite ?
  • Dans un ajustement où est un nombre d'années, que représente 3,42 ?

Réponses. 1. .   2. , donc .   3. . 4. donne .   5. Une hausse de 3,42 unités par an.

15.10 Bilan

15.10.1 Ce que ce chapitre a construit

SituationOutil
Deux caractères qualitatifsTableau croisé d'effectifs
Comparer des effectifsDiagramme en barres groupées
Comparer des groupes de tailles différentesProfils, barres empilées à 100 %
Montrer une répartitionDiagramme circulaire ou semi-circulaire
Deux caractères quantitatifsNuage de points
Une série chronologiqueCourbe d'évolution
Résumer le centre d'un nuagePoint moyen
Résumer la direction d'un nuageDroite d'ajustement
Estimer à l'intérieur du domaine observéInterpolation
Estimer au-delà du domaine observéExtrapolation (à discuter)

15.10.2 Les gestes à savoir faire

  • Compléter un tableau croisé d'effectifs et en vérifier la cohérence.
  • Calculer une fréquence globale, une fréquence en ligne, une fréquence en colonne — et dire ce que chacune signifie.
  • Construire un diagramme en barres, un diagramme circulaire ou semi-circulaire, en passant par les angles.
  • Lire un graphique, un diagramme en boîte, un tableau, et repasser du graphique aux données.
  • Construire un nuage de points et calculer les coordonnées du point moyen.
  • Obtenir une droite d'ajustement : au jugé en passant par , par la méthode de Mayer, ou à la calculatrice ; en écrire l'équation réduite.
  • Interpoler et extrapoler, par le calcul ou graphiquement, et interpréter le coefficient directeur dans le contexte.
  • Utiliser un tableur pour produire un tableau, un diagramme et une droite de tendance.

15.10.3 Les cinq réflexes critiques

  • Un pourcentage sans sa référence n'existe pas. 13,3 %, 28 % et 76 % décrivaient la même case du même tableau.
  • On ne compare jamais deux groupes de tailles différentes par leurs effectifs, toujours par leurs profils.
  • Regarder d'abord où commence l'axe d'un graphique, et ce qu'il mesure.
  • Un lien n'est pas une cause. Le nuage masse-CO ne démontre pas à lui seul que c'est la masse qui fait les émissions — même si, ici, la physique le confirme par ailleurs.
  • Une extrapolation est un pari, jamais une prédiction. On l'annonce toujours sous condition : « si la tendance se poursuivait… ».

15.10.4 Vers la suite

Le lien statistique entre deux caractères qualitatifs, que ce chapitre a mesuré par des profils, sera repris au chapitre suivant sous une forme plus fine : la probabilité conditionnelle, et la question de l'indépendance de deux évènements. Quant aux modèles d'évolution, le modèle affine n'est que le premier des trois : les chapitres suivants introduiront la variation linéaire, la modélisation quadratique et la variation exponentielle, qui décrivent les phénomènes que la droite ne sait pas décrire — précisément ceux dont ce chapitre a montré qu'ils lui échappaient, comme l'accélération de la montée des océans.

Continuer sur Adloun : animation, QCM, fiches, exercices