Adloun

Thème 9 — Corrélation et causalité

Cours complet · mathématiques complémentaires (terminale), chapitre 19 · terminale, option mathématiques complémentaires

Travailler ce chapitre sur Adloun Exercices corrigés de ce chapitre

Une agence du médicament doit décider si elle rembourse un traitement. Un rectorat doit décider s'il finance des heures de soutien. Un maire doit décider s'il installe un radar. Aucune de ces trois questions n'est une question de corrélation : ce sont des questions de causalité. Celui qui décide ne demande pas « ces deux grandeurs varient-elles ensemble ? » mais « si j'agis sur celle-ci, qu'arrive-t-il à celle-là ? ». Et cette seconde question, le chapitre 10 l'a laissée sans réponse.

Il a fait mieux que cela : il a montré qu'aucun calcul mené sur les seules colonnes ne pouvait y répondre. Un même coefficient de corrélation est compatible avec une causalité directe, une causalité inversée, une variable de confusion et une pure coïncidence. Le chapitre s'arrêtait là, sur un avertissement.

Ce thème reprend l'affaire à cet endroit précis. Il ne s'agit plus de se méfier, mais de trancher : quels gestes, quelles données, quelles précautions permettent de dire — et parfois de démontrer — que l'un cause l'autre. Nous verrons que le statisticien dispose d'un instrument souverain, l'expérience randomisée, et qu'il lui arrive de ne pas pouvoir s'en servir : on ne tire pas au sort les gens à qui l'on fera fumer trois paquets par jour. Il faut alors reconstituer la preuve autrement, comme on l'a fait pour le tabac entre 1950 et 1965.

Question directrice. Comment sait-on qu'une chose en cause une autre — et que fait-on quand on ne peut pas faire l'expérience ?

Ce que ce thème mobilise. Le chapitre 10 fournit tout le socle : nuage, point moyen, droite des moindres carrés, résidus, coefficient de corrélation. Le chapitre 8 fournit l'instrument de mesure du hasard : schéma de Bernoulli, loi binomiale, coefficients binomiaux, intervalle de fluctuation — c'est lui qui dira si un écart entre deux groupes mérite qu'on s'y arrête. Le chapitre 9 fournit la loi uniforme sur , celle avec laquelle on fabrique un tirage au sort en Python. Le chapitre 3 sert à lire un rapport de risques sur une échelle multiplicative, et le chapitre 4 à interpréter une pente. Le thème est prévu pour deux à quatre semaines.

19.1 Une corrélation, quatre histoires : comment les départager

19.1.1 Là où le chapitre 10 s'est arrêté

Rappelons la situation. On observe entre deux séries et . Quatre récits l'expliquent aussi bien l'un que l'autre :

Le chapitre 10 concluait qu'aucun calcul sur les données ne les distingue. C'est exact, et c'est justement pour cela que l'affaire n'est pas close : si les données actuelles ne suffisent pas, il faut aller en chercher d'autres. Les quatre récits ne sont pas également fragiles ; chacun a un point faible, et chaque point faible se vise avec un instrument.

Proposition 19.1Ce que chaque lecture prédit en plus

Les quatre lectures s'accordent sur le nuage observé, mais elles ne s'accordent pas sur ce qu'on trouverait ailleurs.

iRemarque

La troisième colonne est le cœur de ce thème. Chacun de ces instruments demande des données que le nuage ne contient pas : une date de mesure, une troisième colonne, un second échantillon, ou une intervention. Aucune statistique plus savante appliquée aux mêmes deux colonnes ne remplacera cela.

19.1.2 Trois gestes, trois lectures écartées

Méthode : Écarter la causalité inversée : la chronologie

On exige que l'exposition soit mesurée avant l'issue. Deux dispositifs le permettent :

  • l'étude de cohorte : on part d'un groupe de personnes saines, on relève leur exposition aujourd'hui, et on les suit pendant des années en comptant les cas ;
  • l'étude cas-témoins : on part des malades, on leur trouve des témoins comparables, et on reconstitue le passé de chacun.

La cohorte est la plus solide, car l'exposition est enregistrée quand personne n'est encore malade ; elle est aussi la plus lente et la plus chère.

!Attention

La chronologie est nécessaire mais pas suffisante. Que précède n'exclut ni la confusion ni la coïncidence : la vente de maillots de bain précède les noyades d'été, sans rien y causer. Une cause doit précéder son effet ; ce qui précède n'est pas pour autant une cause.

Méthode : Écarter la variable de confusion : stratifier, ou tirer au sort

  • Stratifier : on découpe la population selon et on refait le calcul à l'intérieur de chaque strate, là où ne varie plus. C'est l'objet de la section sec:t9strat.
  • Tirer au sort : on décide de par une pièce de monnaie. Aucune variable, mesurée ou non, ne peut alors influencer . C'est l'objet de la section sec:t9ecr.

La différence est capitale : la stratification ne neutralise que les auxquels on a pensé et qu'on a mesurés ; le tirage au sort les neutralise tous.

Méthode : Écarter la coïncidence : annoncer avant, puis répliquer

Une corrélation qui n'a pas été prévue doit être vérifiée sur des données que l'on n'avait pas encore vues. Deux pratiques :

  • préenregistrer : écrire la relation que l'on va chercher avant de regarder les chiffres ;
  • répliquer : retrouver la même relation sur un second échantillon, recueilli indépendamment.

19.1.3 La coïncidence n'est pas rare : elle se fabrique

On croit volontiers qu'une corrélation à ne peut pas être due au hasard. Cela dépend entièrement d'une chose : combien de corrélations a-t-on regardées.

Proposition 19.2Le nombre de paires

À partir de séries statistiques, le nombre de couples que l'on peut former est

Démonstration

Choisir un couple de séries, c'est choisir une partie à deux éléments dans un ensemble à éléments : c'est exactement ce que compte le coefficient binomial , dont le chapitre 8 a donné la valeur .

Le nombre de paires croît comme le carré du nombre de séries : dix séries donnent paires, cent séries en donnent , deux cents en donnent . Un service statistique qui publie deux cents indicateurs met donc en ligne, sans le savoir, vingt mille corrélations.

Proposition 19.3Combien de fausses trouvailles, en moyenne, admis

Pour deux séries sans aucun lien de douze valeurs chacune, on admet que

Si l'on examine paires, le nombre de celles qui franchissent ce seuil est donc en moyenne voisin de .

Exemple 19.4Deux cent quarante et une découvertes, toutes fausses

On tire cent séries de douze nombres au hasard, indépendantes les unes des autres : par construction, aucune ne cause aucune autre. On calcule les coefficients de corrélation. On s'attend à environ paires au-delà de ; le tirage en donne , dont au-delà de et au-delà de . La meilleure atteint .

Présentée seule, avec son nuage bien aligné, cette paire ferait un très joli graphique. Elle ne repose sur rien.


import random
from math import sqrt
from itertools import combinations

def correlation(x, y):
    n = len(x)
    mx, my = sum(x) / n, sum(y) / n
    sxy = sum((x[i] - mx) * (y[i] - my) for i in range(n))
    sx = sqrt(sum((t - mx) ** 2 for t in x))
    sy = sqrt(sum((t - my) ** 2 for t in y))
    return sxy / (sx * sy)

random.seed(9)
series = [[random.gauss(0, 1) for _ in range(12)] for _ in range(100)]
rs = [abs(correlation(a, b)) for a, b in combinations(series, 2)]
print(len(rs), round(max(rs), 4))              # 4950 0.8487
print(sum(1 for t in rs if t > 0.576))         # 241   (attendu  248)
!Le réflexe

Devant une corrélation spectaculaire, la question à poser n'est pas « combien vaut ? » mais « combien de paires ont été regardées avant de retenir celle-ci ? ». Une relation annoncée avant de voir les données engage celui qui l'annonce ; une relation trouvée en cherchant n'engage personne, et doit être rejouée sur des données neuves.

19.2 L'expérience randomisée contrôlée

19.2.1 Observer, ou intervenir

Il faut d'abord voir que deux questions se cachent sous la même phrase.

Définition 19.5Les deux questions

Soit une exposition et une issue.

  • La question observationnelle : sachant que j'observe , à quoi dois-je m'attendre pour ? C'est celle à laquelle répond la droite des moindres carrés du chapitre 10.
  • La question interventionnelle : si j'impose , que devient ? C'est celle que pose toute décision.
!Attention

Ces deux questions ont des réponses différentes, et parfois de signes contraires. La section sec:t9strat en donnera un exemple chiffré : une droite des moindres carrés impeccable annonce , alors que l'effet réel de l'intervention vaut . Le calcul n'est pas faux ; il répond à l'autre question.

La raison de l'écart est toujours la même : quand on observe, ce sont les patients (ou les élèves, ou les pays) qui décident de leur exposition, et ils décident en fonction de ce qu'ils sont. Quand on intervient, c'est l'expérimentateur qui décide. Toute la difficulté est de faire décider quelqu'un qui ne sait rien des individus. Ce quelqu'un existe : c'est le hasard.

19.2.2 Pourquoi le tirage au sort règle le problème

Définition 19.6Expérience randomisée contrôlée

Une expérience randomisée contrôlée comporte quatre pièces :

  • on constitue un groupe d'individus éligibles, tous inclus ;
  • on les répartit au hasard en un groupe traité et un groupe témoin ;
  • le groupe témoin reçoit un placebo, c'est-à-dire une intervention d'apparence identique et sans principe actif ;
  • la mesure de l'issue se fait en aveugle : celui qui mesure ignore à quel groupe appartient le patient.

En médecine on parle d'essai clinique randomisé.

◆Théorème 19.7Ce que fait le tirage au sort

Si l'affectation au groupe traité est décidée par un tirage au sort, alors aucune caractéristique des individus — mesurée ou non, connue ou inconnue — n'influence cette affectation. Les deux groupes ne diffèrent donc que par le hasard du tirage, et ce hasard-là est de loi connue.

Démonstration

La démonstration tient en une remarque, et c'est ce qui fait sa force. Soit une caractéristique quelconque d'un individu — son âge, un gène, son revenu, la sévérité de sa maladie, une variable à laquelle personne n'a pensé. L'affectation est décidée par une pièce de monnaie lancée après l'inclusion : la probabilité d'aller dans le groupe traité vaut pour tout le monde, quelle que soit la valeur de . Le mécanisme d'affectation ne consulte pas : il ne peut donc pas en dépendre.

Par conséquent, si individus portent la caractéristique , le nombre de ceux qui atterrissent dans le groupe traité est le nombre de succès dans un schéma de Bernoulli à épreuves indépendantes de probabilité :

Le déséquilibre entre les deux groupes est donc centré sur zéro — il n'y a aucun biais — et sa dispersion se calcule avec les outils du chapitre 8.

iRemarque

On mesure ici la différence avec la stratification. Stratifier sur exige d'avoir pensé à , de l'avoir mesuré, et d'avoir assez d'individus dans chaque strate. Le tirage au sort ne demande rien de tout cela : il agit d'un coup sur toutes les variables, y compris celles qui seront découvertes dans trente ans.

19.2.3 Ce que le tirage au sort ne garantit pas

Le théorème dit que le déséquilibre est centré sur zéro. Il ne dit pas qu'il est nul.

Exemple 19.8Deux essais, deux fluctuations

Trente pour cent des patients portent un facteur de risque que personne n'a mesuré.

  • Petit essai : patients, donc porteurs. Le nombre de porteurs affectés au groupe traité (de patients) suit , d'espérance et d'écart type . Le plus petit intervalle tel que est : la part de porteurs dans le groupe traité peut aller de à .
  • Grand essai : patients, donc porteurs. Alors , d'espérance et d'écart type , et : la part de porteurs va de à .

Dans les deux cas la loi est centrée sur . Mais randomiser quarante patients ne garantit pas deux groupes comparables ; randomiser mille, presque.

!Le réflexe

Le tirage au sort ne supprime pas le hasard : il le rend calculable. C'est exactement pour cela qu'on peut ensuite dire « un écart pareil se produirait moins de deux fois sur cent si le traitement n'y était pour rien » — phrase impossible à prononcer devant des données d'observation.

!Attention

Trois limites, qu'aucune randomisation ne lève.

  • L'effectif : sur de petits groupes, la fluctuation reste large.
  • Les sorties d'étude : ceux qui abandonnent ne le font pas au hasard. Les exclure détruit la comparabilité obtenue par le tirage — d'où la règle de l'analyse en intention de traiter : chacun reste compté dans le groupe où le sort l'avait placé, qu'il ait suivi le traitement ou non.
  • La validité externe : un essai mené sur des hommes de moins de soixante-dix ans ne dit rien, en toute rigueur, des femmes de quatre-vingts ans. Le tirage au sort assure la comparabilité à l'intérieur de l'essai, pas la transportabilité au dehors.

19.2.4 Le témoin, le placebo et l'aveugle

Le tirage au sort est la pièce la plus célèbre du dispositif ; les trois autres sont tout aussi indispensables.

Définition 19.9Groupe témoin

Le groupe témoin sert à mesurer ce qui serait arrivé sans le traitement. Sans lui, on confond l'effet du traitement avec l'évolution spontanée : beaucoup de maladies guérissent seules, et beaucoup de mesures extrêmes reviennent d'elles-mêmes vers la moyenne.

Définition 19.10Placebo, aveugle, double aveugle

Le placebo est une intervention d'apparence identique au traitement mais sans principe actif. L'essai est dit en aveugle si le patient ignore ce qu'il reçoit, et en double aveugle si celui qui mesure l'ignore aussi.

iRemarquePourquoi le placebo

Recevoir un soin agit, en soi, sur ce que l'on ressent et sur ce que l'on déclare — c'est l'effet placebo. Sans placebo, le groupe traité vit deux choses de plus que le témoin : le principe actif et le fait d'être soigné. La comparaison mesure alors leur somme. Avec le placebo, les deux groupes vivent la même chose à une molécule près, et la différence isole cette molécule.

!Attention

L'aveugle n'est pas une précaution de politesse : c'est ce qui empêche l'attente de fabriquer le résultat. Un médecin qui sait que son patient reçoit le nouveau produit l'interroge autrement, cote autrement, prescrit autrement. Quand l'aveugle est impossible — on ne fait pas semblant d'opérer — on le remplace par un évaluateur indépendant, qui, lui, ignore tout.

!Le réflexe

Retirer une seule des quatre pièces, et la conclusion redevient une corrélation. Sans tirage au sort, la confusion revient ; sans témoin, l'évolution spontanée ; sans placebo, l'effet du soin ; sans aveugle, l'attente de l'observateur. C'est la combinaison qui démontre, pas le hasard tout seul.

19.3 Quand l'expérience est impossible : tabac et cancer

Il y a des expériences qu'on ne fera jamais : on ne tire pas au sort mille adolescents pour en faire fumer cinq cents pendant trente ans. Il a pourtant bien fallu répondre. L'histoire de cette réponse, entre 1950 et 1965, est le meilleur cas d'école qui soit — parce qu'elle a été contestée, et par le plus grand statisticien du siècle.

19.3.1 Vingt ans de controverse

iRemarqueCe que la cohorte de 1951 a réglé

L'objection de causalité inversée est morte de la façon la plus simple : par la chronologie. Dans l'étude des médecins britanniques, les habitudes tabagiques sont enregistrées en 1951, chez des gens en bonne santé, et les décès sont comptés pendant les décennies suivantes. Un cancer non encore déclaré ne peut pas avoir modifié une réponse donnée dix ans avant lui. C'est exactement le premier des trois gestes de la section 1.

iRemarqueLa réversibilité, argument décisif

Le suivi cinquantenaire (Doll, Peto, Boreham et Sutherland, British Medical Journal, 2004) rapporte que les fumeurs continus nés entre 1900 et 1930 sont morts en moyenne une dizaine d'années plus tôt que les non-fumeurs, et qu'arrêter à , , ou ans faisait regagner respectivement environ , , et ans d'espérance de vie. Aucune hypothèse constitutionnelle n'explique cela : un gène ne s'efface pas quand on écrase sa dernière cigarette.

19.3.2 Les neuf points de vue de Bradford Hill (1965)

Méthode : Les neuf points de vue de Hill

Devant une association qui ne provient ni du hasard ni d'un biais évident, Hill propose neuf angles sous lesquels l'examiner avant de parler de cause.

  • Force — l'association est-elle ample ?
  • Constance — se retrouve-t-elle chez d'autres observateurs, d'autres pays, d'autres époques ?
  • Spécificité — l'exposition frappe-t-elle une issue particulière ?
  • Antériorité — la cause précède-t-elle l'effet ?
  • Gradient biologique — plus d'exposition, plus d'effet ?
  • Plausibilité — connaît-on un mécanisme possible ?
  • Cohérence — l'explication s'accorde-t-elle avec ce qu'on sait par ailleurs de la maladie ?
  • Preuve expérimentale — une intervention modifie-t-elle l'issue ?
  • Analogie — connaît-on des cas semblables ?
!Attention

Ce ne sont pas des critères à cocher, et Hill le dit lui-même : aucun de ces neuf points n'est indispensable, aucun n'est suffisant, et il n'existe pas de score. Le seul qui soit logiquement obligatoire est l'antériorité — une cause ne peut pas suivre son effet. La spécificité, en particulier, est un mauvais juge : le tabac cause bien d'autres maladies que le cancer du poumon, ce qui ne l'innocente en rien.

Exemple 19.11Les neuf points, appliqués au tabac
  • Force : le rapport des cotes calculé sur l'étude cas-témoins de Doll et Hill vaut environ .
  • Constance : la relation est retrouvée par des équipes différentes, dans des pays différents, avec des protocoles différents.
  • Antériorité : assurée par la cohorte prospective de 1951.
  • Gradient : le risque croît avec le nombre de cigarettes (voir le problème consacré à l'étude de Doll et Hill).
  • Plausibilité et cohérence : la fumée contient des substances cancérogènes connues, et l'augmentation de la mortalité par cancer du poumon suit, avec un retard de quelques décennies, celle de la consommation.
  • Preuve expérimentale : les goudrons produisent des tumeurs chez l'animal (1953), et l'arrêt du tabac fait baisser le risque chez l'homme.
  • Mécanisme : au milieu des années 1990, on a montré que le benzo[a]pyrène de la fumée se fixe sur le gène suppresseur de tumeur précisément aux positions les plus souvent mutées dans les cancers du poumon des fumeurs (M. F. Denissenko et coll., Science, 1996). Le mécanisme n'est plus seulement plausible : il est décrit.

19.3.3 L'inégalité de Cornfield : mesurer ce qu'il faudrait cacher

L'objection de Fisher n'est pas absurde : peut-être existe-t-il un facteur héréditaire qui pousse à fumer et prédispose au cancer. On ne peut pas prouver qu'il n'existe pas. Cornfield a fait autre chose, et de bien plus fort : il a calculé à quoi il devrait ressembler.

Définition 19.12Cote et rapport des cotes

Dans un groupe où une proportion des individus présente un caractère, la cote de ce caractère est le nombre

c'est-à-dire le nombre d'individus qui le présentent pour un qui ne le présente pas. Le rapport des cotes de deux groupes est le quotient de leurs cotes.

iRemarque

Dans une étude cas-témoins on ne peut pas calculer un risque : on a choisi soi-même combien de malades et combien de témoins on interrogeait. On peut en revanche calculer un rapport des cotes, et l'on admet que, pour une maladie rare, ce rapport est une bonne approximation du risque relatif, c'est-à-dire du rapport des probabilités de tomber malade selon qu'on est exposé ou non.

◆Théorème 19.13Inégalité de Cornfield (1959), admise

Supposons qu'une exposition soit associée à une maladie avec un risque relatif égal à , et supposons que cette association soit entièrement due à un facteur caché . Alors est nécessairement, lui aussi, au moins fois plus fréquent chez les exposés que chez les non-exposés.

Exemple 19.14Le gène de Fisher, s'il existait

Le problème consacré à l'étude de Doll et Hill établira, sur les données de 1952, un rapport des cotes voisin de . Si tout cela venait d'un facteur héréditaire, ce facteur devrait être au moins neuf fois plus répandu chez les fumeurs que chez les non-fumeurs. Autrement dit, s'il était porté par des non-fumeurs, il faudrait qu'au moins des fumeurs le portent.

Un tel facteur aurait été spectaculaire, et facile à repérer : il n'a jamais été trouvé. L'argument ne démontre pas son inexistence ; il place l'objection devant une exigence si lourde que la maintenir devient déraisonnable.

!Le réflexe

Retenons la forme de cet argument, car elle sert partout : plutôt que de discuter à l'infini d'un facteur caché possible, on calcule ce qu'il devrait valoir, et l'on regarde si un tel facteur pourrait exister sans qu'on l'ait remarqué. Une corrélation faible se laisse détruire par une confusion modeste ; une corrélation énorme exige une confusion énorme.

19.4 Neutraliser une variable de confusion : la stratification

Quand l'expérience est impossible mais que l'on a mesuré la variable suspecte, il reste un geste simple : comparer à variable de confusion égale.

Définition 19.15Stratification

Stratifier une population selon une variable , c'est la découper en sous-populations — les strates — à l'intérieur desquelles est constante ou presque, puis mener l'étude dans chaque strate séparément. À l'intérieur d'une strate, ne varie plus : elle ne peut donc plus expliquer quoi que ce soit.

Exemple 19.16Une dose qui tue, ou qui sauve

Douze groupes de patients reçoivent un médicament à des doses différentes ; on relève la mortalité à trente jours. On dispose aussi de la gravité initiale, en trois niveaux.

Sur les douze points pris ensemble, la droite des moindres carrés a pour pente : plus de dose, plus de morts. Dans chacune des trois strates, la pente vaut exactement : plus de dose, moins de morts. Les calculs complets sont faits dans l'exercice de stratification, où la pente s'inverse.

!Le réflexe

La structure des résidus de l'ajustement global trahit à elle seule le problème. Ils valent

c'est-à-dire qu'ils décroissent régulièrement à l'intérieur de chaque strate, puis repartent en haut. Un résidu qui suit un motif n'est plus du bruit : c'est de l'information que le modèle a laissée de côté. C'est le réflexe du chapitre 10 — on regarde toujours les résidus — et il paie encore ici.

!AttentionStratifier sur une cause, jamais sur une conséquence

On stratifie sur une variable qui agit en amont de l'exposition : la gravité décide de la dose, l'âge décide du traitement. Stratifier sur une variable située en aval, c'est-à-dire sur une conséquence de l'exposition, fait disparaître une partie de l'effet que l'on cherche justement à mesurer.

Un exemple : un médicament fait baisser la tension, et une tension basse protège de l'infarctus. Comparer les infarctus à tension égale revient à retirer du médicament son principal moyen d'agir — et à conclure qu'il ne sert à rien. La question à se poser est toujours : cette variable est-elle une cause de l'exposition, ou son effet ?

!Attention

La stratification ne neutralise que les variables mesurées. Après avoir stratifié sur la gravité, sur l'âge et sur le sexe, il reste toutes les autres. C'est pourquoi une étude d'observation, si soigneuse soit-elle, ne clôt jamais tout à fait le débat — et pourquoi on tire au sort dès qu'on le peut.

19.5 Le paradoxe de Simpson

Le phénomène rencontré à la section précédente porte un nom lorsqu'il concerne des proportions, et il est plus spectaculaire encore : la relation ne s'affaiblit pas, elle s'inverse.

Proposition 19.17Une moyenne pondérée peut inverser deux comparaisons

Soient deux traitements A et B appliqués chacun dans deux strates. Notons et les taux de succès de A dans les strates 1 et 2, et ceux de B, et (respectivement ) la part des patients de A (de B) traités dans la strate 1. Les taux d'ensemble sont les moyennes pondérées

On peut avoir simultanément , et pourtant , dès lors que .

Démonstration

Il suffit d'un exemple, et il vaut mieux qu'il soit vrai : c'est celui qui suit. Le mécanisme, lui, se voit d'une phrase. Si la strate 2 est celle où les deux traitements réussissent moins bien, alors le traitement qui y est le plus employé (celui pour lequel est grand) voit sa moyenne tirée vers le bas, quelle que soit sa supériorité dans chaque strate. Le poids l'emporte sur la performance.

Exemple 19.18Deux traitements de la lithiase rénale

On compare deux traitements des calculs rénaux : A, la chirurgie ouverte, et B, la néphrolithotomie percutanée. Les effectifs ci-dessous sont ceux, devenus classiques, que Julious et Mullee (British Medical Journal, 1994) reprennent de l'étude de Charig et ses coauteurs (British Medical Journal, 1986) pour illustrer précisément ce paradoxe.

A est meilleur sur les petits calculs ( points), meilleur sur les gros ( points), et pourtant moins bon au total ( points).

iRemarqueD'où vient l'inversion

Elle vient des poids, et de rien d'autre. Le traitement A a été employé sur gros calculs sur , soit de ses patients ; B, sur sur , soit . Or les gros calculs sont plus difficiles pour les deux traitements. On a

— le taux d'ensemble de A est une moyenne où la mauvaise strate pèse trois quarts, alors que chez B elle ne pèse qu'un quart. Ce n'est pas un hasard de recueil : la chirurgie ouverte était réservée aux cas les plus lourds. La taille du calcul décide à la fois du traitement reçu et de la chance de succès : c'est une variable de confusion en bonne et due forme.

Méthode : Quelle réponse retenir ?

Devant une inversion, il faut choisir, et le choix ne se fait pas au vu des nombres mais du sens de la troisième variable.

  • Si la variable de stratification agit en amont — elle influence le choix du traitement et l'issue — alors les taux par strate répondent à la question causale, et le taux global est trompeur.
  • Si elle est une conséquence du traitement, stratifier est au contraire une faute (voir le piège de la section sec:t9strat).

Ici la taille du calcul préexiste au choix du chirurgien : on retient les taux par strate, et A est le meilleur des deux.

Méthode : Standardiser : une seule comparaison, une seule population

Pour publier un chiffre unique et honnête, on recalcule les deux taux sur une même population de référence. Ici les patients se répartissent en petits calculs et gros, d'où

L'inversion a disparu : à répartition identique, A l'emporte de points.

19.6 Du prédictif au causal : le glissement

Reste à nommer l'erreur la plus courante, celle que commettent des gens qui savent parfaitement que « corrélation n'est pas causalité » et qui la commettent quand même.

!AttentionLe glissement

On ajuste une droite, on contrôle qu'elle passe par le point moyen, on vérifie que les résidus se compensent, on obtient . Puis on écrit : « augmenter la dose de mg fait monter la mortalité de point ». Les deux premiers tiers de la phrase sont du chapitre 10 ; le dernier tiers est un saut. La droite dit : parmi les patients observés, ceux qui ont reçu mg de plus sont morts davantage. Elle ne dit rien de ce qui arriverait si l'on donnait mg de plus au même patient. Nous l'avons vu : la vraie réponse est .

!Le réflexe

Trois questions à se poser avant de transformer une pente en décision.

  • Qui a décidé de ? Si ce sont les individus eux-mêmes, ou leur médecin, ou leur richesse, la pente mélange l'effet de et l'effet de ce qui a décidé de .
  • Suis-je dans les données ? Une intervention sort presque toujours de l'intervalle observé : au risque causal s'ajoute alors celui de l'extrapolation, déjà signalé au chapitre 10.
  • Le modèle survivra-t-il à mon intervention ? Un modèle ajusté dans un monde où les fortes doses allaient aux cas graves cesse d'être valable le jour où l'on décide de donner des fortes doses à tout le monde — le mécanisme qui produisait les données a été supprimé par la décision elle-même.
iRemarquePrédire n'est pas expliquer, et c'est très bien ainsi

Un modèle purement prédictif garde toute sa valeur pour anticiper : savoir qu'une forte dose annonce une mortalité élevée permet d'organiser un service de réanimation. Ce que l'on n'a pas le droit d'en tirer, c'est une action. Les deux usages sont légitimes ; ils ne sont pas interchangeables, et confondre les deux est la seule véritable faute.

19.7 Bilan

Proposition 19.19L'essentiel du thème
  • Le chapitre 10 avertissait ; ce thème tranche. Les quatre lectures d'une corrélation ne sont pas également fragiles : la chronologie écarte la causalité inversée, la stratification ou le tirage au sort écarte la confusion, la réplication écarte la coïncidence. Aucun de ces trois gestes ne se fait sur les seules colonnes .
  • La coïncidence se fabrique : séries donnent paires, et environ d'entre elles franchiront n'importe quel seuil « à ». Ce qu'il faut annoncer, c'est le nombre de paires regardées.
  • L'expérience randomisée contrôlée est l'instrument souverain. Le tirage au sort supprime la flèche pour toutes les variables , connues ou non ; le nombre de porteurs d'un facteur dans le groupe traité suit alors une loi , centrée — donc sans biais — et de fluctuation calculable. Les trois autres pièces sont le groupe témoin, le placebo et l'aveugle ; retirer l'une d'elles ramène à une corrélation.
  • Quand l'expérience est impossible, on assemble un faisceau : force, gradient, antériorité, constance, mécanisme, réversibilité. Les neuf points de vue de Bradford Hill (1965) l'organisent, sans être une grille à cocher — seule l'antériorité est obligatoire. L'inégalité de Cornfield (1959) permet de chiffrer la confusion qu'il faudrait invoquer : pour effacer un rapport de , il faut un facteur caché fois plus fréquent chez les exposés.
  • Stratifier, c'est comparer à variable de confusion égale. On stratifie sur une cause de l'exposition, jamais sur une de ses conséquences, et l'on ne neutralise ainsi que ce qu'on a mesuré.
  • Le paradoxe de Simpson est le cas extrême : un taux d'ensemble est une moyenne pondérée des taux par strate, et des poids différents peuvent inverser la comparaison. Sur les calculs rénaux, A l'emporte sur B dans les deux strates ( contre et contre ) et perd au total ( contre ). La standardisation rétablit une comparaison honnête.
  • Enfin, la faute la plus fréquente n'est pas de confondre corrélation et causalité : c'est de lire une pente d'observation comme une pente d'intervention. La droite des moindres carrés répond à « si j'observe , à quoi m'attendre ? » ; elle ne répond jamais à « si j'impose , que se passe-t-il ? ». Sur les données de la section sec:t9strat, la première vaut et la seconde .

Continuer sur Adloun : animation, QCM, fiches, exercices