Espaces Probabilisés et Variables Aléatoires Discrètes
Cours complet · mathématiques (PC), chapitre 11 · CPGE PC (2e année)
Travailler ce chapitre sur Adloun Exercices corrigés de ce chapitre
11.1 Introduction et vue d'ensemble
L'extension du calcul des probabilités aux univers quelconques et aux variables aléatoires discrètes à valeurs dans un ensemble infini (typiquement ou ) constitue l'un des piliers de l'analyse moderne en PC. Ce cadre unificateur formalise l'étude des phénomènes aléatoires en physique-chimie (spectrométrie photonique, désintégrations radioactives avec la loi de Poisson, thermodynamique statistique de Boltzmann, bruit d'agitation thermique) et la concentration des moyennes empiriques vers les grandeurs macroscopiques (loi faible des grands nombres).
La théorie repose sur l'axiomatique de Kolmogorov (espace probabilisé , -additivité), les théorèmes fondamentaux de continuité de la mesure, l'étude rigoureuse de l'indépendance (lemme des coalitions), les outils de sommation infinie (familles sommables, formule de transfert, théorème de Fubini), les fonctions génératrices et les inégalités de concentration.
11.2 Ensembles Dénombrables et Familles Sommables
Cette section peut sembler une digression avant les probabilités ; elle en est en réalité la condition de possibilité. Dès qu'une variable aléatoire prend une infinité de valeurs, tout le chapitre manipule des sommes indexées par un ensemble infini — , — et deux questions se posent qu'on ne rencontrait pas avec des sommes finies : cette somme a-t-elle un sens, et sa valeur dépend-elle de l'ordre dans lequel on additionne ?
Les réponses conditionnent des manipulations que l'on fera ensuite sans y penser : regrouper les termes par paquets, intervertir deux signes somme, dériver une série terme à terme. Aucune n'est légitime sans les résultats qui suivent.
11.2.1 Dénombrabilité
Un ensemble est dit au plus dénombrable s'il est en bijection avec une partie de . Il est dit dénombrable s'il est en bijection avec tout entier, c'est-à-dire s'il peut être décrit en extension sous la forme d'une suite d'éléments deux à deux distincts :
- Toute partie d'un ensemble dénombrable est au plus dénombrable.
- L'ensemble des entiers relatifs est dénombrable.
- Le produit cartésien d'un nombre fini d'ensembles dénombrables est dénombrable (en particulier , , ).
- La réunion d'une famille au plus dénombrable d'ensembles dénombrables est dénombrable :
- L'ensemble des rationnels est dénombrable : par l'écriture irréductible (), il s'identifie à une partie infinie de , dénombrable par le point précédent.
11.2.2 Familles sommables de réels positifs
Le cas positif est le cas confortable, et il faut savoir pourquoi : une somme de termes positifs croît quand on ajoute des termes, donc elle admet toujours une limite dans , éventuellement infinie, et cette limite ne dépend pas de l'ordre d'addition. Il n'y a donc jamais rien à vérifier avant d'écrire lorsque les sont positifs : la seule question est de savoir si le résultat est fini.
C'est exactement la situation des probabilités, où tous les termes manipulés sont des , donc positifs. Le théorème de sommation par paquets qui suit est l'outil qui légitime la formule des probabilités totales, et le Fubini positif celui qui autorise à sommer une loi conjointe ligne par ligne ou colonne par colonne, au choix.
Soit un ensemble au plus dénombrable et une famille d'éléments de . On associe à cette famille sa somme définie par :
La famille est dite sommable si sa somme est finie : .
Soit une famille d'éléments de .
- Pour tout découpage en paquets disjoints de : , on a :
- Théorème de Fubini positif : Pour une famille d'éléments de indexée par un produit dénombrable :
11.2.3 Familles sommables de nombres complexes
Hors du cas positif, la sommabilité se définit par : c'est encore la convergence absolue, comme au chapitre des séries. Le gain est le même, et il est décisif : une famille sommable peut être additionnée dans n'importe quel ordre sans que la somme change, ce qui n'a aucun sens pour une série seulement convergente. La série harmonique alternée, dont le réarrangement peut donner n'importe quel réel, reste le rappel de ce qui se passe sans cette hypothèse.
C'est ce qui explique la définition de l'espérance donnée plus loin : on n'exige pas que converge, on exige qu'elle converge absolument. Sans cela, la valeur de dépendrait de l'ordre d'énumération des valeurs de , c'est-à-dire de rien.
Une famille de nombres complexes est dite sommable si la famille des modules est sommable dans :
Pour , la sommabilité équivaut à la convergence absolue de la série .
Soient et deux familles sommables de nombres complexes.
- Domination : Si pour tout , alors est sommable et .
- Linéarité : Pour tous , la famille est sommable et :
- Sommation par paquets : Si , alors chaque sous-famille est sommable, la suite des sommes partielles forme une série absolument convergente, et :
- Théorème de Fubini : Si , alors :
- Produit de deux sommes : Si et sont sommables, alors est sommable et :
11.3 Espaces Probabilisés et Probabilités Conditionnelles
11.3.1 Espaces probabilisables, Tribus et Événements
Sur un univers fini, on attribuait une probabilité à toutes les parties de sans se poser de question. Dès que devient infini, cette générosité n'est plus tenable : il existe des parties auxquelles aucune probabilité ne peut être attribuée de façon cohérente. On choisit donc à l'avance la liste des parties qu'on accepte de mesurer — c'est la tribu, et ses éléments s'appellent des événements.
En classe de PC, cette précaution reste largement formelle : l'univers est au plus dénombrable et l'on prend pour tribu l'ensemble de toutes ses parties. La notion sert surtout à énoncer proprement les axiomes, et à donner un sens aux opérations infinies — réunion et intersection d'une suite d'événements — qui vont devenir l'ordinaire du chapitre.
Soit un ensemble quelconque appelé univers. Une famille de parties de est appelée une tribu (ou -algèbre) sur si :
- .
- est stable par passage au complémentaire : .
- est stable par réunion dénombrable : pour toute suite d'éléments de ,
Le couple est appelé un espace probabilisable. Les éléments de sont appelés les événements.
Par les lois de De Morgan, une tribu est également stable par intersection dénombrable :
Traduction logique de la réalisation des événements :
- (au moins un événement est réalisé).
- (tous les événements sont réalisés simultanément).
11.3.2 Mesure de Probabilité et Continuité de la Mesure
Un seul axiome sépare ce chapitre des probabilités de première année : la -additivité, qui étend l'additivité à une infinité dénombrable d'événements deux à deux incompatibles. Tout le reste en découle, y compris les deux théorèmes de continuité, qui sont l'outil de calcul le plus employé de la section.
Soit un espace probabilisable. Une application est appelée une probabilité sur si :
- .
- -additivité : Pour toute suite d'événements deux à deux disjoints ( pour ) :
Le triplet est alors appelé un espace probabilisé.
- et .
- .
- Croissance : Si , alors et .
Soit un espace probabilisé.
- Continuité croissante : Si est une suite croissante d'événements ( pour tout ), alors :
- Continuité décroissante : Si est une suite décroissante d'événements ( pour tout ), alors :
Démonstration (Démonstration de la continuité croissante)
Soit une suite croissante d'événements. Posons et pour tout , .
- Les événements sont deux à deux disjoints.
- Pour tout , par télescopage ensembliste : .
- De même, la réunion dénombrable coïncide : .
Par -additivité de la mesure de probabilité :
La continuité décroissante s'obtient immédiatement par passage au complémentaire : .
Pour toute suite d'événements (non nécessairement disjoints ni monotones) :
De plus, et .
11.3.3 Événements presque sûrs, négligeables et Systèmes quasi-complets
Les théorèmes de continuité répondent à une question qui n'existait pas en univers fini : que vaut la probabilité d'un événement défini comme une limite ? « Obtenir pile au moins une fois » est la réunion croissante des événements « obtenir pile lors de l'un des premiers lancers » ; sa probabilité est donc la limite de , c'est-à-dire . Le calcul est immédiat une fois la continuité croissante invoquée, et impossible sans elle.
Cet exemple introduit la distinction de la sous-section suivante, qui surprend toujours.
Un événement est dit :
- Négligeable si .
- Presque sûr si (ou de manière équivalente si est négligeable).
Une propriété portant sur les aléas est dite vraie presque sûrement (p.s.) si l'événement où elle est vérifiée est de probabilité 1.
Une famille au plus dénombrable d'événements est appelée :
- Un système complet d'événements (SCE) si les sont deux à deux disjoints et .
- Un système quasi-complet d'événements si les sont deux à deux disjoints et (la réunion ne diffère de que par un événement négligeable).
Dans les deux cas, .
11.3.4 Probabilités Conditionnelles et Formules Fondamentales
Presque sûr n'est pas certain. Dans l'exemple précédent, l'événement « obtenir au moins un pile » a pour probabilité , et pourtant il n'est pas : la suite constante « que des faces » appartient bien à l'univers, elle est simplement de probabilité nulle. De même, un événement de probabilité nulle n'est pas forcément impossible. Cette distinction n'apparaît qu'en univers infini — en univers fini, probabilité nulle et impossibilité coïncident — et c'est elle qui rend nécessaire la notion de système quasi-complet, où la réunion des n'est pas mais un événement presque sûr.
Conditionner, c'est changer d'univers. Une fois réalisé, les événements incompatibles avec deviennent impossibles et les autres voient leur probabilité renormalisée par : l'application est elle-même une probabilité, et tous les résultats déjà établis lui sont applicables tels quels. Les trois formules qui suivent sont les trois manières de circuler dans un arbre de probabilités : descendre le long d'une branche, sommer sur toutes les branches, remonter une branche à l'envers.
Soit tel que . Pour tout événement , la probabilité conditionnelle de sachant , notée ou , est définie par :
L'application définit une mesure de probabilité sur .
Soient des événements tels que . Alors :
alors la réunion disjointe des , et sa probabilité s'obtient en additionnant les morceaux — ce que la -additivité autorise même lorsque les tranches sont en nombre infini.</div>
Soit un système complet ou quasi-complet d'événements au plus dénombrable. Pour tout événement :
avec la convention standard si .
Soit un système complet ou quasi-complet d'événements. Pour tout événement tel que et tout :
branche et multiplier les probabilités rencontrées, c'est la formule des probabilités composées ; additionner les feuilles correspondant à , c'est la formule des probabilités totales ; remonter d'une feuille vers la branche dont elle provient, c'est la formule de Bayes.</div>
La formule de Bayes existe parce que et sont deux nombres différents, et les confondre est l'erreur la plus coûteuse de tout le chapitre. Un exemple chiffré vaut mieux qu'un avertissement. Un test de dépistage détecte des malades et ne se trompe que dans des cas chez les bien-portants ; la maladie touche de la population. Un test revient positif : quelle est la probabilité d'être malade ? La formule donne
Environ un test positif sur six correspond à un malade, alors que le test « détecte des malades ». Rien n'est faux dans l'énoncé : les faux positifs sont rares en proportion, mais ils sont prélevés sur les de bien-portants, donc ils écrasent en nombre les vrais positifs. C'est la probabilité a priori qui commande, et c'est elle qu'on oublie.
11.4 Variables Aléatoires Discrètes et Lois Usuelles
11.4.1 Définition et Loi de Probabilité
Une variable aléatoire discrète sur un espace probabilisé est une application (où ou ) telle que :
- L'image est un ensemble au plus dénombrable.
- Pour tout , l'image réciproque appartient à la tribu .
On note ou cet événement. Pour tout , . Lorsque est réelle, on note .
La loi de probabilité de la variable aléatoire discrète , notée , est l'application définie sur l'ensemble des parties de par :
Elle est entièrement caractérisée par la distribution discrète , qui vérifie :
Si deux variables et ont la même loi, on note . Si , alors pour toute fonction , .
11.4.2 Lois Discrètes Usuelles
1. Loi de Bernoulli
Modélise une expérience n'ayant que deux issues possibles (succès = 1 avec probabilité , échec = 0 avec probabilité ).
2. Loi Binomiale
Modélise le nombre de succès obtenus au cours de épreuves de Bernoulli indépendantes et de même paramètre .
3. Loi Géométrique (Temps de premier succès)
Modélise le rang du premier succès dans une suite infinie d'épreuves de Bernoulli indépendantes et de même paramètre ().
- Queue de distribution : Pour tout entier :
- Absence de mémoire : Pour tous entiers :
4. Loi de Poisson (Loi des événements rares)
Modélise le nombre d'occurrences d'un événement rare dans un intervalle continu (désintégrations radioactives, émissions photoniques, chocs moléculaires), de paramètre d'intensité .
Soit une suite de variables aléatoires telles que . Si , alors pour tout entier fixé :
en et , parce que le rapport vaut , donc exactement pour : c'est la signature d'un paramètre entier.</div>
Démonstration
Pour :
Or , donc .
De plus, , car , et :
Par produit des limites, .
11.4.3 Couples et Vecteurs de Variables Aléatoires Discrètes
Soit un couple de variables aléatoires discrètes définies sur , à valeurs dans .
- La loi conjointe est donnée par la famille .
- Les lois marginales de et sont obtenues par sommation :
Pour tout événement tel que :
11.5 Indépendance des Événements et des Variables Aléatoires
11.5.1 Indépendance d'Événements
L'indépendance n'est pas une propriété des événements, c'est une propriété de la probabilité qui les mesure : deux mêmes événements peuvent être indépendants pour une loi et liés pour une autre. Elle ne se constate donc pas, elle se vérifie par le calcul — ou bien elle est posée par l'énoncé, ce qui est le cas le plus fréquent lorsqu'on modélise des expériences répétées.
Deux événements et sont dits indépendants si :
Si , cela équivaut à .
Si et sont indépendants, alors les paires , et sont également formées d'événements indépendants.
Une famille finie d'événements est dite mutuellement indépendante si pour toute sous-famille d'indices :
11.5.2 Indépendance de Variables Aléatoires Discrètes
L'indépendance deux à deux n'entraîne pas l'indépendance mutuelle, et deux lancers de pièce suffisent à le voir. Posons : « le premier lancer donne pile », : « le second donne pile », : « les deux lancers donnent le même résultat ». Chacun a probabilité , et les trois intersections deux à deux valent : les événements sont donc indépendants deux à deux. Pourtant
La raison est claire : connaître et détermine entièrement. La définition d'une famille indépendante exige l'égalité pour toutes les sous-familles, pas seulement pour les paires.
Deux variables aléatoires discrètes et définies sur sont dites indépendantes, noté , si :
Le théorème suivant est celui qu'on utilise sans le nommer, à chaque fois qu'on affirme que et sont indépendantes parce que et le sont, ou que est indépendante de . Il autorise à regrouper des variables indépendantes en coalitions disjointes et à traiter chaque bloc comme une seule variable.
Soient des variables aléatoires discrètes mutuellement indépendantes.
- Si , alors pour toutes fonctions et .
- Lemme des coalitions : Pour tout , .
11.6 Espérance Mathématique
11.6.1 Définition générale et Espérance finie
L'espérance est une moyenne pondérée par les probabilités. En univers fini, elle existe toujours ; sur une infinité de valeurs, elle peut ne pas exister, et la définition qui suit prend soin de distinguer les deux étapes : pour une variable positive, la somme a toujours un sens dans ; dans le cas général, on exige la sommabilité, c'est-à-dire la convergence absolue.
- Pour , .
- est d'espérance finie si . Alors .
Pour toute variable à valeurs dans :
Démonstration
Par le théorème de Fubini positif :
11.6.2 Formule de Transfert et Propriétés
Une variable aléatoire peut parfaitement n'avoir aucune espérance, et il ne s'agit pas d'un cas pathologique inventé pour la circonstance. Soit définie par
C'est bien une loi de probabilité, puisque . Mais alors
et n'admet pas d'espérance finie. C'est le paradoxe de Saint-Pétersbourg : un jeu dont le gain moyen est infini, et auquel personne n'accepterait de miser une somme importante. Avant d'écrire , il faut donc avoir établi que la famille est sommable — ce que l'énoncé demande d'ailleurs souvent comme première question.
Pour , est d'espérance finie si et seulement si est sommable, et alors :
La formule de transfert est ce qui évite le calcul le plus pénible : pour obtenir , on n'a pas besoin de la loi de , seulement de celle de . C'est elle qui donne sans jamais déterminer la loi de , donc la variance.
- Linéarité : .
- Positivité et croissance : , et .
- Stricte positivité : Si et , alors presque sûrement.
- Multiplicativité : Si et d'espérance finie, alors .
11.6.3 Espérances des Lois Usuelles
De toutes les propriétés qui précèdent, la linéarité est la plus précieuse, et pour une raison qu'il faut souligner : elle ne réclame aucune hypothèse d'indépendance. L'égalité vaut pour des variables aussi liées qu'on voudra, ce qui n'est le cas ni de la variance ni de l'espérance d'un produit.
C'est ce qui fonde la technique la plus rentable du chapitre, la décomposition en indicatrices : pour compter le nombre de succès, on écrit la variable comme une somme d'indicatrices , dont l'espérance vaut simplement , et l'on somme. Le nombre de boules rouges tirées, le nombre de points fixes d'une permutation aléatoire, le nombre de cases vides d'une distribution : tous se traitent ainsi, sans que l'indépendance ait à être discutée, et souvent sans que la loi de la variable soit connue.
- Bernoulli : .
- Binomiale : .
- Géométrique : .
- Poisson : .
11.7 Variance, Covariance et Moments d'Ordre 2
L'espérance situe une variable aléatoire, la variance dit de combien elle s'en écarte. Le passage au couple de variables introduit la covariance, et avec elle une distinction qui coûte cher quand on l'oublie.
L'indépendance entraîne une covariance nulle ; la réciproque est fausse. Si suit une loi symétrique et , la covariance est nulle alors que est entièrement déterminée par . Une covariance nulle ne dit rien de plus que l'absence de liaison linéaire.
La conséquence pratique est que vaut dès que la covariance est nulle — donc sous une hypothèse plus faible que l'indépendance. C'est ce qui rend le calcul de variance d'une somme praticable dans les modèles où l'indépendance n'est pas acquise.
11.7.1 Variance, Écart-Type et Inégalité de Cauchy-Schwarz
Pour telle que soit d'espérance finie () :
- (Koenig-Huygens).
- . Variable centrée réduite : .
- .
Pour deux variables réelles et telles que et soient d'espérance finie :
Démonstration
.
11.7.2 Covariance et Variance d'une Somme
Si les variables sont deux à deux indépendantes : .
11.7.3 Variances des Lois Usuelles
- Bernoulli : .
- Binomiale : .
- Géométrique : .
- Poisson : .
11.8 Fonctions Génératrices
La fonction génératrice range toute la loi d'une variable à valeurs entières dans une seule série entière : la probabilité y est le coefficient de . Elle transforme des questions de probabilités en questions d'analyse, et c'est tout son intérêt.
Trois usages en découlent. Elle caractérise la loi : deux variables de même fonction génératrice ont la même loi. Elle donne les moments par dérivation en — et . Et surtout, la fonction génératrice d'une somme de variables indépendantes est le produit des fonctions génératrices : c'est ainsi qu'on retrouve en trois lignes que la somme de deux lois de Poisson est de Poisson.
11.8.1 Définition, Rayon et Moments
Pour à valeurs dans :
- , est continue sur , et caractérise entièrement la loi de .
- et .
- Si , alors .
sur . Elle vaut toujours en , puisque la somme des probabilités vaut ; et la pente de sa tangente en ce point est exactement l'espérance, ici .</div>
11.8.2 Formulaires des Lois Usuelles
| Loi | |||
|---|---|---|---|
11.9 Inégalités Probabilistes et Loi Faible des Grands Nombres
Ces inégalités répondent à une question que la loi exacte ne pose pas : que peut-on affirmer quand on ne connaît que l'espérance, ou que l'espérance et la variance ? Elles sont volontairement grossières, et c'est leur force — elles ne supposent presque rien.
Markov ne demande qu'une variable positive et son espérance. Bienaymé-Tchebychev y ajoute la variance et borne l'écart à la moyenne. Ces bornes sont très larges : pour de loi (espérance , écart-type ), Tchebychev annonce au plus de chances de s'écarter de deux écarts-types, , quand la vraie valeur est d'environ . On ne les emploie donc jamais pour estimer, mais pour démontrer — et la loi faible des grands nombres en est la récompense : trois lignes à partir de Tchebychev.
- Markov () : .
- Bienaymé-Tchebychev : .
valeurs des deux queues, au-delà de , pèsent ensemble au plus ; tout le reste de la masse est concentré autour de la moyenne. Plus la variance est petite, plus les queues sont minces — c'est ce mécanisme qui, appliqué à une moyenne de variables, donnera la loi faible des grands nombres.</div>
Soit une suite de variables aléatoires i.i.d. de variance finie ; on note et . En notant :