Espaces Probabilisés et Variables Aléatoires Discrètes
Cours complet · mathématiques (PSI), chapitre 11 · CPGE PSI (2e année)
Travailler ce chapitre sur Adloun Exercices corrigés de ce chapitre
11.1 Introduction et vue d'ensemble
L'extension du calcul des probabilités aux univers quelconques et aux variables aléatoires discrètes à valeurs dans un ensemble infini (typiquement ou ) constitue l'un des piliers de l'analyse moderne en classe de PSI / PSI*. Ce cadre unificateur formalise l'étude des temps d'attente d'événements aléatoires (processus de Poisson, files d'attente, télécommunications, algorithmes stochastiques) et la concentration des moyennes empiriques vers les grandeurs théoriques (loi faible des grands nombres).
La théorie repose sur l'axiomatique de Kolmogorov (espace probabilisé , -additivité), les théorèmes fondamentaux de continuité de la mesure, l'étude rigoureuse de l'indépendance (lemme des coalitions), les outils de sommation infinie (familles sommables, formule de transfert, théorème de Fubini), les fonctions génératrices et les inégalités de concentration.
forment un système complet : deux à deux disjoints, ils recouvrent l'univers. L'événement se découpe alors en les morceaux , eux aussi deux à deux disjoints, et la -additivité donne . Tout le travail consiste à choisir le découpage pour lequel les sont connues.</div>
11.2 Ensembles Dénombrables et Familles Sommables
Cette section est un préalable technique, mais elle n'est pas un détour. Dès que l'univers cesse d'être fini — et il le cesse dès qu'on attend le premier succès d'une série d'épreuves —, additionner des probabilités devient additionner une infinité de termes, et il faut savoir dans quel ordre. La réponse du programme est qu'il n'y a pas d'ordre : une famille indexée par un ensemble dénombrable quelconque n'en possède pas naturellement, et c'est la notion de famille sommable qui permet de s'en passer.
Le prix à payer est une exigence d'absolue convergence, et le bénéfice est double : la somme ne dépend pas de l'ordre choisi, et l'on peut regrouper les termes en paquets comme on veut. Ces deux libertés sont utilisées à chaque page de la suite du chapitre, souvent sans être nommées.
11.2.1 Dénombrabilité
Un ensemble est dit au plus dénombrable s'il est en bijection avec une partie de . Il est dit dénombrable s'il est en bijection avec tout entier, c'est-à-dire s'il peut être décrit en extension sous la forme d'une suite d'éléments deux à deux distincts :
- Toute partie d'un ensemble dénombrable est au plus dénombrable.
- L'ensemble des entiers relatifs est dénombrable.
- Le produit cartésien d'un nombre fini d'ensembles dénombrables est dénombrable (en particulier , , ).
- La réunion d'une famille au plus dénombrable d'ensembles dénombrables est dénombrable :
- Le corps des rationnels est dénombrable. En revanche, et ne sont pas dénombrables.
Ces propriétés servent à une seule chose, mais elle est constante : établir qu'un ensemble d'indices est au plus dénombrable, condition sans laquelle rien de ce qui suit ne s'applique. Le point 4 est le plus utile — une réunion dénombrable de dénombrables reste dénombrable —, et le point 5 marque la limite du cadre : une variable aléatoire à valeurs réelles quelconques sort du chapitre, qui ne traite que le cas discret, c'est-à-dire à valeurs dans un ensemble au plus dénombrable.
11.2.2 Familles sommables de réels positifs
Soit un ensemble au plus dénombrable et une famille d'éléments de . On associe à cette famille sa somme définie par :
La famille est dite sommable si sa somme est finie : .
La définition par borne supérieure mérite d'être comprise plutôt que retenue : elle ne choisit aucun ordre d'énumération, elle regarde toutes les sommes finies à la fois. Pour une famille positive, ces sommes finies croissent avec le paquet d'indices considéré, et leur borne supérieure existe toujours dans — c'est pourquoi une famille positive a toujours une somme, éventuellement infinie, et pourquoi seul le caractère fini de cette somme reste à discuter.
Soit une famille d'éléments de .
- Pour tout découpage en paquets disjoints de : , on a :
- Théorème de Fubini positif : Pour une famille d'éléments de indexée par un produit dénombrable :
Ce théorème est l'outil de calcul le plus employé du chapitre. Le premier point autorise à découper un ensemble d'indices en paquets et à sommer paquet par paquet — c'est ce que fait la formule des probabilités totales, où les paquets sont les événements d'un système complet. Le second permet d'intervertir deux sommations, ce dont on se sert pour établir la formule sommatoire , ou la multiplicativité de l'espérance.
L'hypothèse de positivité est ce qui rend ces échanges gratuits : aucune convergence n'est à vérifier au préalable, puisque les deux membres sont définis dans et qu'on démontre leur égalité, finie ou non. C'est la raison pour laquelle on commence toujours par appliquer Fubini positif aux modules, quitte à revenir ensuite aux quantités signées.
11.2.3 Familles sommables de nombres complexes
Une famille de nombres complexes est dite sommable si la famille des modules est sommable dans :
Pour , la sommabilité équivaut à la convergence absolue de la série .
Une série semi-convergente comme converge, mais la famille n'est pas sommable. Aucun résultat de cette section ne s'y applique : ni le regroupement par paquets, ni l'interversion des sommations, ni le produit de deux sommes. Ce n'est pas une précaution formelle — le théorème de réarrangement de Riemann affirme qu'en changeant l'ordre des termes d'une telle série on peut lui faire prendre n'importe quelle valeur.
En probabilités, la conséquence est directe : une variable aléatoire dont la famille n'est pas sommable n'a pas d'espérance, même si l'on parvient à donner un sens à la somme en énumérant les valeurs dans un certain ordre. « admet une espérance » signifie toujours .
Soient et deux familles sommables de nombres complexes.
- Domination : Si pour tout , alors est sommable et .
- Linéarité : Pour tous , la famille est sommable et :
- Sommation par paquets : Si , alors chaque sous-famille est sommable, la suite des sommes partielles forme une série absolument convergente, et :
- Théorème de Fubini : Si , alors :
- Produit de deux sommes : Si et sont sommables, alors est sommable et :
11.3 Espaces Probabilisés et Probabilités Conditionnelles
En probabilités finies, on affectait une probabilité à toutes les parties de et la question ne se posait pas. Sur un univers infini, elle se pose : il n'est pas toujours possible de mesurer toutes les parties de manière cohérente. La solution de Kolmogorov est de choisir d'avance la famille des parties que l'on accepte de mesurer — la tribu —, et d'exiger qu'elle soit stable par les opérations logiques qu'on voudra faire, y compris en nombre dénombrable.
Le second changement est le passage de l'additivité finie à la -additivité. Il paraît anodin et ne l'est pas : c'est lui, et lui seul, qui donne les théorèmes de continuité, donc le droit de passer à la limite sur une suite d'événements. Sans lui, la probabilité d'un temps d'attente ne pourrait même pas être définie.
11.3.1 Espaces probabilisables, Tribus et Événements
Soit un ensemble quelconque appelé univers. Une famille de parties de est appelée une tribu (ou -algèbre) sur si :
- .
- est stable par passage au complémentaire : .
- est stable par réunion dénombrable : pour toute suite d'éléments de ,
Le couple est appelé un espace probabilisable. Les éléments de sont appelés les événements.
Les trois axiomes se lisent en langage courant. Le premier dit que « quelque chose se produit » est un événement ; le deuxième que la négation d'un événement en est un ; le troisième que « l'un au moins des se produit » en est un, même pour une infinité dénombrable de . C'est ce troisième point qui distingue une tribu d'une algèbre, et c'est lui qui permettra d'écrire des événements comme « le succès finit par arriver », réunion infinie des « le succès arrive au rang ».
Par les lois de De Morgan, une tribu est également stable par intersection dénombrable :
Traduction logique de la réalisation des événements :
- (au moins un événement est réalisé).
- (tous les événements sont réalisés simultanément).
11.3.2 Mesure de Probabilité et Continuité de la Mesure
Soit un espace probabilisable. Une application est appelée une probabilité sur si :
- .
- -additivité : Pour toute suite d'événements deux à deux disjoints ( pour ) :
Le triplet est alors appelé un espace probabilisé.
- et .
- .
- Croissance : Si , alors et .
Aucune de ces propriétés n'est propre au cas infini : elles se démontrent exactement comme en première année, à partir de l'additivité finie, qui est le cas particulier de la -additivité où tous les sont vides à partir d'un certain rang.
Soit un espace probabilisé.
- Continuité croissante : Si est une suite croissante d'événements ( pour tout ), alors :
- Continuité décroissante : Si est une suite décroissante d'événements ( pour tout ), alors :
Ces deux énoncés se résument en une phrase : la probabilité commute avec les limites monotones d'événements. C'est le pendant probabiliste du théorème de la limite monotone, et il est constamment utilisé dans l'autre sens que celui où on l'énonce : pour calculer la probabilité d'un événement défini par une réunion ou une intersection infinie, on l'approche par ses tronquées finies, que l'on sait calculer.
Un exemple type : l'événement « le succès finit par arriver » est la réunion croissante des « le succès est arrivé avant le rang », dont la probabilité vaut ; la continuité croissante donne aussitôt que le succès est presque sûr dès que .
Démonstration (Démonstration de la continuité croissante)
Soit une suite croissante d'événements. Posons et pour tout , .
- Les événements sont deux à deux disjoints.
- Pour tout , par télescopage ensembliste : .
- De même, la réunion dénombrable coïncide : .
Par -additivité de la mesure de probabilité :
La continuité décroissante s'obtient immédiatement par passage au complémentaire : .
Pour toute suite d'événements (non nécessairement disjoints ni monotones) :
De plus, et .
11.3.3 Événements presque sûrs, négligeables et Systèmes quasi-complets
Un événement est dit :
- Négligeable si .
- Presque sûr si (ou de manière équivalente si est négligeable).
Une propriété portant sur les aléas est dite vraie presque sûrement (p.s.) si l'événement où elle est vérifiée est de probabilité 1.
Une famille au plus dénombrable d'événements est appelée :
- Un système complet d'événements (SCE) si les sont deux à deux disjoints et .
- Un système quasi-complet d'événements si les sont deux à deux disjoints et (la réunion ne diffère de que par un événement négligeable).
Dans les deux cas, .
11.3.4 Probabilités Conditionnelles et Formules Fondamentales
Soit tel que . Pour tout événement , la probabilité conditionnelle de sachant , notée ou , est définie par :
L'application définit une mesure de probabilité sur .
Le dernier point de la définition est celui qu'on oublie et qui fait gagner le plus de temps : conditionner, c'est changer d'univers, et est une probabilité à part entière. Tous les résultats du chapitre lui sont donc applicables tels quels — probabilités totales, Bayes, espérance —, à condition de conditionner partout par le même événement.
Soient des événements tels que . Alors :
Soit un système complet ou quasi-complet d'événements au plus dénombrable. Pour tout événement :
avec la convention standard si .
Soit un système complet ou quasi-complet d'événements. Pour tout événement tel que et tout :
Les trois formules se distinguent par le sens dans lequel elles font circuler l'information. Les probabilités composées descendent l'arbre, en multipliant les probabilités rencontrées le long d'une branche. Les probabilités totales le remontent, en sommant les branches qui aboutissent au même événement. Bayes, enfin, inverse le conditionnement : on connaît la probabilité de l'effet sachant la cause, on veut celle de la cause sachant l'effet.
L'erreur d'interprétation la plus répandue consiste à confondre et . Un test de dépistage fiable à dans les deux sens, appliqué à une maladie touchant une personne sur , donne pour un individu positif
soit moins de : sur personnes testées, on attend un vrai positif et une centaine de faux positifs. Le facteur décisif n'est pas la fiabilité du test mais la probabilité a priori , et c'est elle que l'intuition oublie.
les probabilités rencontrées donne la formule des probabilités composées ; sommer les feuilles qui portent le même événement donne la formule des probabilités totales ; et rapporter une feuille à cette somme donne la formule de Bayes. Les trois énoncés sont trois lectures du même arbre.</div>
11.4 Variables Aléatoires Discrètes et Lois Usuelles
11.4.1 Définition et Loi de Probabilité
Une variable aléatoire discrète sur un espace probabilisé est une application (où ou ) telle que :
- L'image est un ensemble au plus dénombrable.
- Pour tout , l'image réciproque appartient à la tribu .
On note ou cet événement. Pour tout , . Lorsque est réelle, on note .
La loi de probabilité de la variable aléatoire discrète , notée , est l'application définie sur l'ensemble des parties de par :
Elle est entièrement caractérisée par la distribution discrète , qui vérifie :
Si deux variables et ont la même loi, on note . Si , alors pour toute fonction , .
11.4.2 Lois Discrètes Usuelles
1. Loi de Bernoulli
Modélise une expérience n'ayant que deux issues possibles (succès = 1 avec probabilité , échec = 0 avec probabilité ).
2. Loi Binomiale
Modélise le nombre de succès obtenus au cours de épreuves de Bernoulli indépendantes et de même paramètre .
3. Loi Géométrique (Temps de premier succès)
Modélise le rang du premier succès dans une suite infinie d'épreuves de Bernoulli indépendantes et de même paramètre ().
- Queue de distribution : Pour tout entier :
- Absence de mémoire : Pour tous entiers :
4. Loi de Poisson (Loi des événements rares)
Modélise le nombre d'occurrences d'un événement rare dans un intervalle de temps ou d'espace continu (désintégrations radioactives, appels entrants, mutations génétiques), de paramètre d'intensité .
. Le maximum est atteint deux fois, en et , où la probabilité vaut : c'est une particularité des paramètres entiers, pour lesquels . La décroissance en est ensuite très rapide — ne pèse déjà plus que .</div>
Soit une suite de variables aléatoires telles que . Si , alors pour tout entier fixé :
Démonstration
Pour :
Or , donc .
De plus, , car , et :
Par produit des limites, .
11.4.3 Couples et Vecteurs de Variables Aléatoires Discrètes
Soit un couple de variables aléatoires discrètes définies sur , à valeurs dans .
- La loi conjointe est donnée par la famille .
- Les lois marginales de et sont obtenues par sommation (formule des probabilités totales) :
Pour tout événement tel que (par exemple avec ), la loi conditionnelle de sachant est donnée par :
11.5 Indépendance des Événements et des Variables Aléatoires
L'indépendance est la seule notion du chapitre qui ne se lise pas sur les ensembles : elle est une propriété de la probabilité, pas des événements. Deux mêmes parties de peuvent être indépendantes pour une probabilité et liées pour une autre. C'est pourquoi elle se démontre par un calcul, et ne se devine pas sur un dessin.
Elle ne doit surtout pas être confondue avec l'incompatibilité. Deux événements incompatibles de probabilité non nulle sont au contraire fortement dépendants : si , alors , alors que l'indépendance exigerait . Savoir que s'est produit est l'information la plus forte possible sur — elle l'exclut.
11.5.1 Indépendance d'Événements
Deux événements et sont dits indépendants si :
Si , cela équivaut à .
Si et sont indépendants, alors les paires , et sont également formées d'événements indépendants.
Une famille finie d'événements est dite mutuellement indépendante si pour toute sous-famille d'indices :
L'indépendance deux à deux ( pour tout ) n'entraîne pas l'indépendance mutuelle. Exemple classique : On lance deux pièces équilibrées indépendantes. , , . Les événements sont 2 à 2 indépendants mais .
La définition de l'indépendance mutuelle porte sur toutes les sous-familles, et c'est bien nécessaire : dans l'exemple ci-dessus, les trois égalités deux à deux sont vérifiées et la quatrième, celle qui porte sur les trois événements ensemble, ne l'est pas. Il faut donc, en toute rigueur, vérifications pour une famille de taille — raison pour laquelle l'indépendance mutuelle est en pratique toujours postulée par l'énoncé (des lancers indépendants, des tirages avec remise) plutôt que démontrée.
11.5.2 Indépendance de Variables Aléatoires Discrètes
Deux variables aléatoires discrètes et définies sur sont dites indépendantes, noté , si :
De façon équivalente :
Une famille finie est indépendante si :
Soient des variables aléatoires discrètes mutuellement indépendantes.
- Stabilité par transformation : Pour toutes fonctions et , si , alors :
- Lemme des coalitions : Pour tout entier , et toutes fonctions et :
Le résultat s'étend à un nombre quelconque de coalitions disjointes de variables.
Le lemme des coalitions est l'outil qui rend l'indépendance exploitable. Sans lui, on ne pourrait rien dire de et de , alors que l'énoncé garantit seulement l'indépendance des pris un à un. Avec lui, toute quantité construite à partir d'un premier groupe de variables est indépendante de toute quantité construite à partir d'un groupe disjoint — la seule condition étant que les groupes ne partagent aucune variable. C'est ce qui autorise, dans les sommes de variables indépendantes, à traiter séparément les termes déjà additionnés et ceux qui restent.
11.6 Espérance Mathématique
L'espérance est la moyenne des valeurs prises par , pondérées par leurs probabilités. Sur un univers fini, la somme est finie et il n'y a rien à discuter ; sur un univers infini, elle peut ne pas exister, et la définition se fait en deux temps — d'abord les variables positives, pour lesquelles la somme est toujours définie dans , puis le cas général, par sommabilité.
11.6.1 Définition générale et Espérance finie
Soit une variable aléatoire discrète à valeurs dans . L'espérance de , notée , est la somme de la famille positive :
avec la convention lorsque et .
Une variable aléatoire à valeurs réelles ou complexes est dite d'espérance finie (ou intégrable) si la famille est sommable, c'est-à-dire si :
Dans ce cas, l'espérance de est le nombre . Une variable d'espérance finie telle que est dite centrée.
L'ordre de ces deux définitions n'est pas un caprice de rédaction : c'est le seul moyen de définir sans avoir à choisir un ordre d'énumération des valeurs. On teste la sommabilité sur , où tout est positif et où la somme existe toujours ; puis, une fois la sommabilité acquise, la somme de la famille signée est bien définie et ne dépend d'aucun ordre.
Soit une variable aléatoire à valeurs dans . Alors :
est d'espérance finie si et seulement si la série converge.
Cette formule est un raccourci précieux : elle calcule l'espérance sans jamais faire apparaître les , et beaucoup de variables entières se décrivent bien plus facilement par leurs queues que par leur loi ponctuelle — le maximum de plusieurs variables, ou un temps d'attente, en sont les exemples habituels.
Démonstration
Par Fubini positif sur la famille positive :
11.6.2 Formule de Transfert et Propriétés de l'Espérance
Soit une variable aléatoire discrète et . La variable est d'espérance finie si et seulement si la famille est sommable. Dans ce cas :
Pour un couple : .
Soient et deux variables aléatoires d'espérance finie.
- Linéarité : Pour tous , .
- Positivité : Si p.s., alors .
- Croissance : Si p.s., alors .
- Stricte positivité : Si et , alors presque sûrement ().
- Multiplicativité pour des variables indépendantes : Si et sont indépendantes et d'espérance finie, alors est d'espérance finie et :
est vraie sans aucune hypothèse d'indépendance, pourvu que et soient d'espérance finie. C'est la propriété la plus rentable du chapitre : elle permet de décomposer une variable compliquée en une somme d'indicatrices dont chacune a une espérance évidente, sans jamais avoir à connaître la loi de la somme ni les dépendances entre les termes.
En revanche exige l'indépendance, et la réciproque est fausse : deux variables peuvent vérifier cette égalité sans être indépendantes. On dit alors qu'elles sont non corrélées, ce qui est strictement plus faible — la covariance de la section suivante mesure précisément cet écart, et ne le mesure que partiellement.
Démonstration (Démonstration de la multiplicativité)
Sous l'hypothèse , . Par Fubini :
Donc est d'espérance finie, et .
11.6.3 Espérances des Lois Usuelles
- Bernoulli : .
- Binomiale : avec i.i.d., donc .
- Géométrique : Par la formule sommatoire des queues de distribution :
- Poisson :
11.7 Variance, Covariance et Moments d'Ordre 2
L'espérance situe une variable aléatoire, la variance dit de combien elle s'en écarte. Le passage au couple de variables introduit la covariance, et avec elle une distinction qui coûte cher quand on l'oublie.
L'indépendance entraîne une covariance nulle ; la réciproque est fausse. Si suit une loi symétrique et , la covariance est nulle alors que est entièrement déterminée par . Une covariance nulle ne dit rien de plus que l'absence de liaison linéaire.
La conséquence pratique est que vaut dès que la covariance est nulle — donc sous une hypothèse plus faible que l'indépendance. C'est ce qui rend le calcul de variance d'une somme praticable dans les modèles où l'indépendance n'est pas acquise.
11.7.1 Variance et Écart-Type
Une variable aléatoire réelle est dite de carré intégrable (ou de moment d'ordre 2 fini) si est d'espérance finie : . Dans ce cas, est automatiquement d'espérance finie ().
- La variance de est définie par :
- L'écart-type de est .
- Si , la variable est dite centrée et réduite ( et ).
- Koenig-Huygens : .
- Affinité : Pour tous , et .
- Nullité de la variance : presque sûrement ( est constante p.s.).
Si et sont deux variables aléatoires réelles de carré intégrable, alors est d'espérance finie et :
Avec égalité si et seulement si il existe tel que presque sûrement.
Démonstration
Pour tout , la variable est d'espérance finie. Par positivité et linéarité :
Ce trinôme du second degré en restant de signe constant positif ou nul sur , son discriminant réduit est nécessairement négatif ou nul :
11.7.2 Covariance et Variance d'une Somme
Soient et deux variables aléatoires de carré intégrable. La covariance de et est :
Si , les variables et sont dites décorrélées.
- .
- La covariance est une forme bilinéaire symétrique positive sur l'espace des variables de carré intégrable.
- Si et sont indépendantes, alors (la réciproque est fausse en général).
Soient des variables aléatoires de carré intégrable.
En particulier, si les variables sont deux à deux indépendantes (ou simplement décorrélées) :
11.7.3 Variances des Lois Usuelles
- Bernoulli : .
- Binomiale : Somme de Bernoulli indépendantes .
- Géométrique : .
. - Poisson : .
.
11.8 Fonctions Génératrices
La fonction génératrice range toute la loi d'une variable à valeurs entières dans une seule série entière : la probabilité y est le coefficient de . Elle transforme des questions de probabilités en questions d'analyse, et c'est tout son intérêt.
Trois usages en découlent. Elle caractérise la loi : deux variables de même fonction génératrice ont la même loi. Elle donne les moments par dérivation en — et . Et surtout, la fonction génératrice d'une somme de variables indépendantes est le produit des fonctions génératrices : c'est ainsi qu'on retrouve en trois lignes que la somme de deux lois de Poisson est de Poisson.
11.8.1 Définition, Rayon et Caractérisation de la Loi
Soit une variable aléatoire à valeurs dans . La fonction génératrice de , notée , est la fonction définie par la somme de la série entière :
- Rayon de convergence : Comme , le rayon de convergence de la série entière vérifie .
- Domaine de définition et continuité : La série converge normalement sur . La fonction est donc continue sur et de classe sur , avec et pour tout .
- Caractérisation de la loi : La loi de est entièrement caractérisée par :
probabilités , et , soit . Trois traits se lisent sur le dessin et valent pour toute fonction génératrice : elle passe par le point , puisque la somme des probabilités vaut ; elle est croissante et convexe sur , ses coefficients étant positifs ; et la pente de sa tangente en est l'espérance — ici .</div>
11.8.2 Calcul des Moments par Dérivation en 1
Soit une variable aléatoire à valeurs dans .
- est d'espérance finie si et seulement si est dérivable à gauche en 1. Dans ce cas :
- est de carré intégrable si et seulement si est deux fois dérivable à gauche en 1. Dans ce cas, et :
11.8.3 Fonction Génératrice d'une Somme Indépendante
Soient et deux variables aléatoires indépendantes à valeurs dans . La fonction génératrice de leur somme est donnée par :
Pour variables indépendantes : .
Démonstration
Comme , les variables et sont indépendantes pour tout . Par multiplicativité de l'espérance pour des variables indépendantes :
11.8.4 Tableau Récapitulatif des Fonctions Génératrices Usuelles
| Loi | Distribution | |||
|---|---|---|---|---|
| Bernoulli | ||||
| Binomiale | ||||
| Géométrique | () | |||
| Poisson |
11.9 Inégalités Probabilistes et Loi Faible des Grands Nombres
Ces inégalités répondent à une question que la loi exacte ne pose pas : que peut-on affirmer quand on ne connaît que l'espérance, ou que l'espérance et la variance ? Elles sont volontairement grossières, et c'est leur force — elles ne supposent presque rien.
Markov ne demande qu'une variable positive et son espérance. Bienaymé-Tchebychev y ajoute la variance et borne l'écart à la moyenne. Ces bornes sont très larges : sur une loi normale, Tchebychev annonce au plus de chances de s'écarter de deux écarts-types quand la vraie valeur est proche de . On ne les emploie donc jamais pour estimer, mais pour démontrer — et la loi faible des grands nombres en est la récompense : trois lignes à partir de Tchebychev.
11.9.1 Inégalités de Markov et de Bienaymé-Tchebychev
Soit une variable aléatoire discrète positive () d'espérance finie. Pour tout réel :
Démonstration
Considérons la variable indicatrice . Comme , on a l'inégalité ponctuelle :
En effet, si , le membre de gauche vaut 0 et . Si , le membre de gauche vaut . Par croissance et linéarité de l'espérance :
Soit une variable aléatoire réelle de carré intégrable, d'espérance et de variance . Pour tout réel :
Démonstration
La variable est positive et d'espérance . Remarquons que l'événement coïncide avec . En appliquant l'inégalité de Markov à la variable positive avec le seuil :
, d'espérance et de variance , avec . Les deux queues, en rouge, pèsent exactement , tandis que l'inégalité annonce . La majoration est donc correcte — et presque deux fois trop grande. C'est le prix de sa généralité : elle ne suppose rien de la loi, et ne peut donc pas être fine pour une loi particulière.</div>
11.9.2 Loi Faible des Grands Nombres
Soit une suite de variables aléatoires indépendantes et identiquement distribuées (i.i.d.), de carré intégrable, d'espérance commune et de variance commune . On pose et la moyenne empirique. Alors, pour tout :
En d'autres termes, la moyenne empirique converge en probabilité vers l'espérance théorique .
Démonstration
Par linéarité de l'espérance :
Comme les variables sont mutuellement indépendantes :
En appliquant directement l'inégalité de Bienaymé-Tchebychev à la variable :
Puisque lorsque , le résultat est démontré.