Probleme – La courbe du sur-apprentissage, mesurée
Exercice · niveau 3 (difficile) · informatique (MP2I/MPI), chapitre 26 — Apprentissage automatique
Énoncé
On veut voir la courbe que le cours dessine. On tire points dans , on leur donne l'étiquette « », et l'on inverse l'étiquette avec probabilité . On apprend un arbre de décision à seuils, de profondeur bornée par .
- Que vaut l'erreur minimale qu'un modèle quelconque peut espérer sur ces données ?
- Mesurer l'erreur d'entraînement et l'erreur de test pour , et commenter les deux courbes.
- Comment choisir en pratique ?
Corrigé
1. Le plancher. Le meilleur modèle imaginable est la règle vraie, « ». Elle se trompe exactement quand l'étiquette a été inversée, soit avec probabilité . Aucun modèle ne peut descendre sous d'erreur de test : c'est le bruit, il n'est pas prédictible. Toute méthode qui annoncerait sur ces données a mesuré autre chose que ce qu'elle croit.
2. Les deux courbes. Mesuré sur points d'entraînement et points de test :
| profondeur | feuilles | erreur d'entraînement | erreur de test |
|---|---|---|---|
| sans limite |
La colonne d'entraînement décroît sans exception jusqu'à : c'est ce que le cours annonce, et c'est mécanique — chaque niveau supplémentaire permet d'isoler quelques exemples de plus. La colonne de test remonte dès , et croît de entre () et ().
Les meilleurs arbres sont ceux de profondeur et , à égalité ; le premier n'a qu'un seul test. Son seuil, appris, vaut ; la vérité est . Son erreur de test, , est à moins d'un point du plancher théorique . Le modèle le plus simple est ici le meilleur possible, et les dix-neuf feuilles supplémentaires de l'arbre complet ne servent qu'à mémoriser douze étiquettes bruitées.
3. Choisir . Jamais sur la colonne d'entraînement, qui désignerait . Jamais non plus sur la colonne de test, qu'on ne regarde qu'une fois. On réserve donc un troisième lot, dit de validation, on y mesure l'erreur pour chaque , on retient le qui la minimise, et l'on annonce enfin le chiffre obtenu sur le test. L'autre procédé, plus courant sur les arbres, est l'élagage : on construit l'arbre complet, puis on remonte en remplaçant par une feuille tout sous-arbre dont la suppression n'aggrave pas l'erreur de validation.
Ce que cette table démontre concrètement. Deux modèles, l'un à deux feuilles et l'autre à vingt, apprennent les mêmes points ; le second les classe tous correctement et le premier en rate dix. Sur des données nouvelles, c'est le premier qui gagne, et largement. L'erreur d'entraînement n'est pas une mesure dégradée de la qualité : c'est une mesure d'autre chose.
Les autres exercices de ce chapitre Le cours du chapitre
Un blocage sur cet exercice ? Le tuteur d'Adloun guide par questions, sans donner la réponse.