Adloun

Espaces Probabilisés et Variables Aléatoires Discrètes

Cours complet · mathématiques (PC), chapitre 11 · CPGE PC (2e année)

Travailler ce chapitre sur Adloun Exercices corrigés de ce chapitre

11.1 Introduction et vue d'ensemble

L'extension du calcul des probabilités aux univers quelconques et aux variables aléatoires discrètes à valeurs dans un ensemble infini (typiquement ou ) constitue l'un des piliers de l'analyse moderne en PC. Ce cadre unificateur formalise l'étude des phénomènes aléatoires en physique-chimie (spectrométrie photonique, désintégrations radioactives avec la loi de Poisson, thermodynamique statistique de Boltzmann, bruit d'agitation thermique) et la concentration des moyennes empiriques vers les grandeurs macroscopiques (loi faible des grands nombres).

La théorie repose sur l'axiomatique de Kolmogorov (espace probabilisé , -additivité), les théorèmes fondamentaux de continuité de la mesure, l'étude rigoureuse de l'indépendance (lemme des coalitions), les outils de sommation infinie (familles sommables, formule de transfert, théorème de Fubini), les fonctions génératrices et les inégalités de concentration.

11.2 Ensembles Dénombrables et Familles Sommables

Cette section peut sembler une digression avant les probabilités ; elle en est en réalité la condition de possibilité. Dès qu'une variable aléatoire prend une infinité de valeurs, tout le chapitre manipule des sommes indexées par un ensemble infini — , — et deux questions se posent qu'on ne rencontrait pas avec des sommes finies : cette somme a-t-elle un sens, et sa valeur dépend-elle de l'ordre dans lequel on additionne ?

Les réponses conditionnent des manipulations que l'on fera ensuite sans y penser : regrouper les termes par paquets, intervertir deux signes somme, dériver une série terme à terme. Aucune n'est légitime sans les résultats qui suivent.

11.2.1 Dénombrabilité

Définition 11.1Ensemble au plus dénombrable

Un ensemble est dit au plus dénombrable s'il est en bijection avec une partie de . Il est dit dénombrable s'il est en bijection avec tout entier, c'est-à-dire s'il peut être décrit en extension sous la forme d'une suite d'éléments deux à deux distincts :

Proposition 11.2Propriétés de stabilité de la dénombrabilité
  • Toute partie d'un ensemble dénombrable est au plus dénombrable.
  • L'ensemble des entiers relatifs est dénombrable.
  • Le produit cartésien d'un nombre fini d'ensembles dénombrables est dénombrable (en particulier , , ).
  • La réunion d'une famille au plus dénombrable d'ensembles dénombrables est dénombrable :

  • L'ensemble des rationnels est dénombrable : par l'écriture irréductible (), il s'identifie à une partie infinie de , dénombrable par le point précédent.

11.2.2 Familles sommables de réels positifs

Le cas positif est le cas confortable, et il faut savoir pourquoi : une somme de termes positifs croît quand on ajoute des termes, donc elle admet toujours une limite dans , éventuellement infinie, et cette limite ne dépend pas de l'ordre d'addition. Il n'y a donc jamais rien à vérifier avant d'écrire lorsque les sont positifs : la seule question est de savoir si le résultat est fini.

C'est exactement la situation des probabilités, où tous les termes manipulés sont des , donc positifs. Le théorème de sommation par paquets qui suit est l'outil qui légitime la formule des probabilités totales, et le Fubini positif celui qui autorise à sommer une loi conjointe ligne par ligne ou colonne par colonne, au choix.

Définition 11.3Somme d'une famille positive dans

Soit un ensemble au plus dénombrable et une famille d'éléments de . On associe à cette famille sa somme définie par :

La famille est dite sommable si sa somme est finie : .

◆Théorème 11.4Théorème de sommation par paquets et Fubini positif

Soit une famille d'éléments de .

  • Pour tout découpage en paquets disjoints de : , on a :

  • Théorème de Fubini positif : Pour une famille d'éléments de indexée par un produit dénombrable :

11.2.3 Familles sommables de nombres complexes

Hors du cas positif, la sommabilité se définit par : c'est encore la convergence absolue, comme au chapitre des séries. Le gain est le même, et il est décisif : une famille sommable peut être additionnée dans n'importe quel ordre sans que la somme change, ce qui n'a aucun sens pour une série seulement convergente. La série harmonique alternée, dont le réarrangement peut donner n'importe quel réel, reste le rappel de ce qui se passe sans cette hypothèse.

C'est ce qui explique la définition de l'espérance donnée plus loin : on n'exige pas que converge, on exige qu'elle converge absolument. Sans cela, la valeur de dépendrait de l'ordre d'énumération des valeurs de , c'est-à-dire de rien.

Définition 11.5Sommabilité dans

Une famille de nombres complexes est dite sommable si la famille des modules est sommable dans :

Pour , la sommabilité équivaut à la convergence absolue de la série .

◆Théorème 11.6Propriétés fondamentales des familles sommables complexes

Soient et deux familles sommables de nombres complexes.

  • Domination : Si pour tout , alors est sommable et .
  • Linéarité : Pour tous , la famille est sommable et :

  • Sommation par paquets : Si , alors chaque sous-famille est sommable, la suite des sommes partielles forme une série absolument convergente, et :

  • Théorème de Fubini : Si , alors :

  • Produit de deux sommes : Si et sont sommables, alors est sommable et :

11.3 Espaces Probabilisés et Probabilités Conditionnelles

11.3.1 Espaces probabilisables, Tribus et Événements

Sur un univers fini, on attribuait une probabilité à toutes les parties de sans se poser de question. Dès que devient infini, cette générosité n'est plus tenable : il existe des parties auxquelles aucune probabilité ne peut être attribuée de façon cohérente. On choisit donc à l'avance la liste des parties qu'on accepte de mesurer — c'est la tribu, et ses éléments s'appellent des événements.

En classe de PC, cette précaution reste largement formelle : l'univers est au plus dénombrable et l'on prend pour tribu l'ensemble de toutes ses parties. La notion sert surtout à énoncer proprement les axiomes, et à donner un sens aux opérations infinies — réunion et intersection d'une suite d'événements — qui vont devenir l'ordinaire du chapitre.

Définition 11.7Tribu et Espace probabilisable

Soit un ensemble quelconque appelé univers. Une famille de parties de est appelée une tribu (ou -algèbre) sur si :

  • .
  • est stable par passage au complémentaire : .
  • est stable par réunion dénombrable : pour toute suite d'éléments de ,

Le couple est appelé un espace probabilisable. Les éléments de sont appelés les événements.

Proposition 11.8Opérations sur les événements

Par les lois de De Morgan, une tribu est également stable par intersection dénombrable :

Traduction logique de la réalisation des événements :

  • (au moins un événement est réalisé).
  • (tous les événements sont réalisés simultanément).

11.3.2 Mesure de Probabilité et Continuité de la Mesure

Un seul axiome sépare ce chapitre des probabilités de première année : la -additivité, qui étend l'additivité à une infinité dénombrable d'événements deux à deux incompatibles. Tout le reste en découle, y compris les deux théorèmes de continuité, qui sont l'outil de calcul le plus employé de la section.

Définition 11.9Probabilité et -additivité

Soit un espace probabilisable. Une application est appelée une probabilité sur si :

  • .
  • -additivité : Pour toute suite d'événements deux à deux disjoints ( pour ) :

Le triplet est alors appelé un espace probabilisé.

Proposition 11.10Propriétés élémentaires de la probabilité
  • et .
  • .
  • Croissance : Si , alors et .
◆Théorème 11.11Théorèmes de Continuité Croissante et Décroissante

Soit un espace probabilisé.

  • Continuité croissante : Si est une suite croissante d'événements ( pour tout ), alors :

  • Continuité décroissante : Si est une suite décroissante d'événements ( pour tout ), alors :

Démonstration (Démonstration de la continuité croissante)

Soit une suite croissante d'événements. Posons et pour tout , .

  • Les événements sont deux à deux disjoints.
  • Pour tout , par télescopage ensembliste : .
  • De même, la réunion dénombrable coïncide : .

Par -additivité de la mesure de probabilité :

La continuité décroissante s'obtient immédiatement par passage au complémentaire : .

Proposition 11.12Sous-additivité dénombrable

Pour toute suite d'événements (non nécessairement disjoints ni monotones) :

De plus, et .

11.3.3 Événements presque sûrs, négligeables et Systèmes quasi-complets

Les théorèmes de continuité répondent à une question qui n'existait pas en univers fini : que vaut la probabilité d'un événement défini comme une limite ? « Obtenir pile au moins une fois » est la réunion croissante des événements « obtenir pile lors de l'un des premiers lancers » ; sa probabilité est donc la limite de , c'est-à-dire . Le calcul est immédiat une fois la continuité croissante invoquée, et impossible sans elle.

Cet exemple introduit la distinction de la sous-section suivante, qui surprend toujours.

Définition 11.13Presque sûreté et Négligeabilité

Un événement est dit :

  • Négligeable si .
  • Presque sûr si (ou de manière équivalente si est négligeable).

Une propriété portant sur les aléas est dite vraie presque sûrement (p.s.) si l'événement où elle est vérifiée est de probabilité 1.

Définition 11.14Système complet et quasi-complet d'événements

Une famille au plus dénombrable d'événements est appelée :

  • Un système complet d'événements (SCE) si les sont deux à deux disjoints et .
  • Un système quasi-complet d'événements si les sont deux à deux disjoints et (la réunion ne diffère de que par un événement négligeable).

Dans les deux cas, .

11.3.4 Probabilités Conditionnelles et Formules Fondamentales

Important

Presque sûr n'est pas certain. Dans l'exemple précédent, l'événement « obtenir au moins un pile » a pour probabilité , et pourtant il n'est pas : la suite constante « que des faces » appartient bien à l'univers, elle est simplement de probabilité nulle. De même, un événement de probabilité nulle n'est pas forcément impossible. Cette distinction n'apparaît qu'en univers infini — en univers fini, probabilité nulle et impossibilité coïncident — et c'est elle qui rend nécessaire la notion de système quasi-complet, où la réunion des n'est pas mais un événement presque sûr.

Conditionner, c'est changer d'univers. Une fois réalisé, les événements incompatibles avec deviennent impossibles et les autres voient leur probabilité renormalisée par : l'application est elle-même une probabilité, et tous les résultats déjà établis lui sont applicables tels quels. Les trois formules qui suivent sont les trois manières de circuler dans un arbre de probabilités : descendre le long d'une branche, sommer sur toutes les branches, remonter une branche à l'envers.

Définition 11.15Probabilité conditionnelle

Soit tel que . Pour tout événement , la probabilité conditionnelle de sachant , notée ou , est définie par :

L'application définit une mesure de probabilité sur .

◆Théorème 11.16Formule des probabilités composées

Soient des événements tels que . Alors :

Figure : Un système complet d'événements découpe l'univers en tranches. L'événement est

alors la réunion disjointe des , et sa probabilité s'obtient en additionnant les morceaux — ce que la -additivité autorise même lorsque les tranches sont en nombre infini.</div>

◆Théorème 11.17Formule des Probabilités Totales

Soit un système complet ou quasi-complet d'événements au plus dénombrable. Pour tout événement :

avec la convention standard si .

◆Théorème 11.18Formule de Bayes

Soit un système complet ou quasi-complet d'événements. Pour tout événement tel que et tout :

Figure : L'arbre des probabilités, où se lisent les trois formules. Descendre une

branche et multiplier les probabilités rencontrées, c'est la formule des probabilités composées ; additionner les feuilles correspondant à , c'est la formule des probabilités totales ; remonter d'une feuille vers la branche dont elle provient, c'est la formule de Bayes.</div>

Important

La formule de Bayes existe parce que et sont deux nombres différents, et les confondre est l'erreur la plus coûteuse de tout le chapitre. Un exemple chiffré vaut mieux qu'un avertissement. Un test de dépistage détecte des malades et ne se trompe que dans des cas chez les bien-portants ; la maladie touche de la population. Un test revient positif : quelle est la probabilité d'être malade ? La formule donne

Environ un test positif sur six correspond à un malade, alors que le test « détecte des malades ». Rien n'est faux dans l'énoncé : les faux positifs sont rares en proportion, mais ils sont prélevés sur les de bien-portants, donc ils écrasent en nombre les vrais positifs. C'est la probabilité a priori qui commande, et c'est elle qu'on oublie.

11.4 Variables Aléatoires Discrètes et Lois Usuelles

11.4.1 Définition et Loi de Probabilité

Définition 11.19Variable aléatoire discrète

Une variable aléatoire discrète sur un espace probabilisé est une application (où ou ) telle que :

  • L'image est un ensemble au plus dénombrable.
  • Pour tout , l'image réciproque appartient à la tribu .

On note ou cet événement. Pour tout , . Lorsque est réelle, on note .

Définition 11.20Loi de probabilité

La loi de probabilité de la variable aléatoire discrète , notée , est l'application définie sur l'ensemble des parties de par :

Elle est entièrement caractérisée par la distribution discrète , qui vérifie :

Si deux variables et ont la même loi, on note . Si , alors pour toute fonction , .

11.4.2 Lois Discrètes Usuelles

1. Loi de Bernoulli

Modélise une expérience n'ayant que deux issues possibles (succès = 1 avec probabilité , échec = 0 avec probabilité ).

2. Loi Binomiale

Modélise le nombre de succès obtenus au cours de épreuves de Bernoulli indépendantes et de même paramètre .

3. Loi Géométrique (Temps de premier succès)

Modélise le rang du premier succès dans une suite infinie d'épreuves de Bernoulli indépendantes et de même paramètre ().

Proposition 11.21Propriétés de la loi géométrique
  • Queue de distribution : Pour tout entier :

  • Absence de mémoire : Pour tous entiers :

4. Loi de Poisson (Loi des événements rares)

Modélise le nombre d'occurrences d'un événement rare dans un intervalle continu (désintégrations radioactives, émissions photoniques, chocs moléculaires), de paramètre d'intensité .

◆Théorème 11.22Théorème de la limite rare de Poisson

Soit une suite de variables aléatoires telles que . Si , alors pour tout entier fixé :

Figure : La loi de Poisson de paramètre . Le maximum est atteint deux fois,

en et , parce que le rapport vaut , donc exactement pour : c'est la signature d'un paramètre entier.</div>

Démonstration

Pour :

Or , donc .
De plus, , car , et :

Par produit des limites, .

11.4.3 Couples et Vecteurs de Variables Aléatoires Discrètes

Définition 11.23Loi conjointe et Lois marginales

Soit un couple de variables aléatoires discrètes définies sur , à valeurs dans .

  • La loi conjointe est donnée par la famille .
  • Les lois marginales de et sont obtenues par sommation :

Définition 11.24Loi conditionnelle

Pour tout événement tel que :

11.5 Indépendance des Événements et des Variables Aléatoires

11.5.1 Indépendance d'Événements

L'indépendance n'est pas une propriété des événements, c'est une propriété de la probabilité qui les mesure : deux mêmes événements peuvent être indépendants pour une loi et liés pour une autre. Elle ne se constate donc pas, elle se vérifie par le calcul — ou bien elle est posée par l'énoncé, ce qui est le cas le plus fréquent lorsqu'on modélise des expériences répétées.

Définition 11.25Indépendance de deux événements

Deux événements et sont dits indépendants si :

Si , cela équivaut à .

Proposition 11.26Propriétés de l'indépendance de deux événements

Si et sont indépendants, alors les paires , et sont également formées d'événements indépendants.

Définition 11.27Indépendance d'une famille finie d'événements

Une famille finie d'événements est dite mutuellement indépendante si pour toute sous-famille d'indices :

11.5.2 Indépendance de Variables Aléatoires Discrètes

Important

L'indépendance deux à deux n'entraîne pas l'indépendance mutuelle, et deux lancers de pièce suffisent à le voir. Posons : « le premier lancer donne pile », : « le second donne pile », : « les deux lancers donnent le même résultat ». Chacun a probabilité , et les trois intersections deux à deux valent : les événements sont donc indépendants deux à deux. Pourtant

La raison est claire : connaître et détermine entièrement. La définition d'une famille indépendante exige l'égalité pour toutes les sous-familles, pas seulement pour les paires.

Définition 11.28Variables aléatoires indépendantes

Deux variables aléatoires discrètes et définies sur sont dites indépendantes, noté , si :

Le théorème suivant est celui qu'on utilise sans le nommer, à chaque fois qu'on affirme que et sont indépendantes parce que et le sont, ou que est indépendante de . Il autorise à regrouper des variables indépendantes en coalitions disjointes et à traiter chaque bloc comme une seule variable.

◆Théorème 11.29Fonctions de variables indépendantes et Lemme des coalitions

Soient des variables aléatoires discrètes mutuellement indépendantes.

  • Si , alors pour toutes fonctions et .
  • Lemme des coalitions : Pour tout , .

11.6 Espérance Mathématique

11.6.1 Définition générale et Espérance finie

L'espérance est une moyenne pondérée par les probabilités. En univers fini, elle existe toujours ; sur une infinité de valeurs, elle peut ne pas exister, et la définition qui suit prend soin de distinguer les deux étapes : pour une variable positive, la somme a toujours un sens dans ; dans le cas général, on exige la sommabilité, c'est-à-dire la convergence absolue.

Définition 11.30Espérance d'une variable positive et Espérance finie
  • Pour , .
  • est d'espérance finie si . Alors .
◆Théorème 11.31Formule sommatoire pour les variables à valeurs entières

Pour toute variable à valeurs dans :

Démonstration

Par le théorème de Fubini positif :

11.6.2 Formule de Transfert et Propriétés

Important

Une variable aléatoire peut parfaitement n'avoir aucune espérance, et il ne s'agit pas d'un cas pathologique inventé pour la circonstance. Soit définie par

C'est bien une loi de probabilité, puisque . Mais alors

et n'admet pas d'espérance finie. C'est le paradoxe de Saint-Pétersbourg : un jeu dont le gain moyen est infini, et auquel personne n'accepterait de miser une somme importante. Avant d'écrire , il faut donc avoir établi que la famille est sommable — ce que l'énoncé demande d'ailleurs souvent comme première question.

◆Théorème 11.32Formule de transfert

Pour , est d'espérance finie si et seulement si est sommable, et alors :

La formule de transfert est ce qui évite le calcul le plus pénible : pour obtenir , on n'a pas besoin de la loi de , seulement de celle de . C'est elle qui donne sans jamais déterminer la loi de , donc la variance.

◆Théorème 11.33Propriétés de l'espérance
  • Linéarité : .
  • Positivité et croissance : , et .
  • Stricte positivité : Si et , alors presque sûrement.
  • Multiplicativité : Si et d'espérance finie, alors .

11.6.3 Espérances des Lois Usuelles

De toutes les propriétés qui précèdent, la linéarité est la plus précieuse, et pour une raison qu'il faut souligner : elle ne réclame aucune hypothèse d'indépendance. L'égalité vaut pour des variables aussi liées qu'on voudra, ce qui n'est le cas ni de la variance ni de l'espérance d'un produit.

C'est ce qui fonde la technique la plus rentable du chapitre, la décomposition en indicatrices : pour compter le nombre de succès, on écrit la variable comme une somme d'indicatrices , dont l'espérance vaut simplement , et l'on somme. Le nombre de boules rouges tirées, le nombre de points fixes d'une permutation aléatoire, le nombre de cases vides d'une distribution : tous se traitent ainsi, sans que l'indépendance ait à être discutée, et souvent sans que la loi de la variable soit connue.

  • Bernoulli : .
  • Binomiale : .
  • Géométrique : .
  • Poisson : .

11.7 Variance, Covariance et Moments d'Ordre 2

L'espérance situe une variable aléatoire, la variance dit de combien elle s'en écarte. Le passage au couple de variables introduit la covariance, et avec elle une distinction qui coûte cher quand on l'oublie.

Important

L'indépendance entraîne une covariance nulle ; la réciproque est fausse. Si suit une loi symétrique et , la covariance est nulle alors que est entièrement déterminée par . Une covariance nulle ne dit rien de plus que l'absence de liaison linéaire.

La conséquence pratique est que vaut dès que la covariance est nulle — donc sous une hypothèse plus faible que l'indépendance. C'est ce qui rend le calcul de variance d'une somme praticable dans les modèles où l'indépendance n'est pas acquise.

11.7.1 Variance, Écart-Type et Inégalité de Cauchy-Schwarz

Définition 11.34Variance et Écart-type

Pour telle que soit d'espérance finie () :

  • (Koenig-Huygens).
  • . Variable centrée réduite : .
  • .
◆Théorème 11.35Inégalité de Cauchy-Schwarz

Pour deux variables réelles et telles que et soient d'espérance finie :

Démonstration

.

11.7.2 Covariance et Variance d'une Somme

◆Théorème 11.36Variance d'une somme

Si les variables sont deux à deux indépendantes : .

11.7.3 Variances des Lois Usuelles

  • Bernoulli : .
  • Binomiale : .
  • Géométrique : .
  • Poisson : .

11.8 Fonctions Génératrices

La fonction génératrice range toute la loi d'une variable à valeurs entières dans une seule série entière : la probabilité y est le coefficient de . Elle transforme des questions de probabilités en questions d'analyse, et c'est tout son intérêt.

Trois usages en découlent. Elle caractérise la loi : deux variables de même fonction génératrice ont la même loi. Elle donne les moments par dérivation en — et . Et surtout, la fonction génératrice d'une somme de variables indépendantes est le produit des fonctions génératrices : c'est ainsi qu'on retrouve en trois lignes que la somme de deux lois de Poisson est de Poisson.

11.8.1 Définition, Rayon et Moments

Définition 11.37Fonction génératrice

Pour à valeurs dans :

◆Théorème 11.38Propriétés fondamentales
  • , est continue sur , et caractérise entièrement la loi de .
  • et .
  • Si , alors .
Figure : Une fonction génératrice, ici celle de la loi

sur . Elle vaut toujours en , puisque la somme des probabilités vaut ; et la pente de sa tangente en ce point est exactement l'espérance, ici .</div>

11.8.2 Formulaires des Lois Usuelles

Loi

11.9 Inégalités Probabilistes et Loi Faible des Grands Nombres

Ces inégalités répondent à une question que la loi exacte ne pose pas : que peut-on affirmer quand on ne connaît que l'espérance, ou que l'espérance et la variance ? Elles sont volontairement grossières, et c'est leur force — elles ne supposent presque rien.

Markov ne demande qu'une variable positive et son espérance. Bienaymé-Tchebychev y ajoute la variance et borne l'écart à la moyenne. Ces bornes sont très larges : pour de loi (espérance , écart-type ), Tchebychev annonce au plus de chances de s'écarter de deux écarts-types, , quand la vraie valeur est d'environ . On ne les emploie donc jamais pour estimer, mais pour démontrer — et la loi faible des grands nombres en est la récompense : trois lignes à partir de Tchebychev.

◆Théorème 11.39Inégalités de Markov et de Bienaymé-Tchebychev
  • Markov () : .
  • Bienaymé-Tchebychev : .
Figure : L'inégalité de Bienaymé-Tchebychev, lue sur la loi d'une variable discrète. Les

valeurs des deux queues, au-delà de , pèsent ensemble au plus ; tout le reste de la masse est concentré autour de la moyenne. Plus la variance est petite, plus les queues sont minces — c'est ce mécanisme qui, appliqué à une moyenne de variables, donnera la loi faible des grands nombres.</div>

◆Théorème 11.40Loi Faible des Grands Nombres

Soit une suite de variables aléatoires i.i.d. de variance finie ; on note et . En notant :

Continuer sur Adloun : animation, QCM, fiches, exercices