Surapprentissage en Machine Learning : comprendre l’overfitting
Un modèle peut sembler très performant pendant son apprentissage et pourtant obtenir des résultats moins satisfaisants lorsqu’il rencontre de nouvelles données.
Cette situation peut notamment être liée au surapprentissage, également appelé overfitting.
Qu’est-ce que le surapprentissage ?
Le surapprentissage apparaît lorsqu’un modèle s’adapte trop fortement aux particularités des données utilisées pour son entraînement.
Il peut alors avoir davantage de difficultés à généraliser à de nouvelles observations.
Pourquoi est-ce un problème ?
L’objectif d’un modèle n’est généralement pas de mémoriser uniquement les exemples déjà rencontrés.
Il doit pouvoir produire des résultats utiles sur de nouvelles données correspondant au problème étudié.
Exemple conceptuel
Supposons qu’un modèle obtienne d’excellents résultats sur les données d’entraînement.
Lorsqu’on le teste sur d’autres données, ses performances diminuent fortement.
Cet écart peut constituer un signal qu’il faut examiner.
Quel lien avec entraînement et test ?
La séparation des données permet justement d’examiner le comportement du modèle en dehors des exemples utilisés pendant l’apprentissage.
C’est pourquoi entraînement/test et surapprentissage sont étroitement liés.
Un modèle plus complexe est-il toujours meilleur ?
Non.
Augmenter la complexité n’améliore pas automatiquement la capacité à généraliser.
Le modèle doit rester adapté au problème et aux données.
Peut-on détecter le surapprentissage uniquement en regardant le code ?
Pas nécessairement.
Il faut notamment examiner le comportement du modèle sur différentes données et analyser ses performances.
Comment éviter le surapprentissage ?
Il existe différentes stratégies en Machine Learning.
Le choix dépend du modèle, des données et du contexte.
La page publique de la formation confirme l’étude du surapprentissage mais ne publie pas une liste exhaustive de techniques à attribuer au programme.
Pourquoi cette notion est-elle importante pour un débutant ?
Parce qu’elle corrige une idée fréquente :
un modèle très performant sur ses données d’entraînement n’est pas automatiquement un bon modèle sur de nouvelles données.
Guides complémentaires
- Formation Intelligence Artificielle & Data au CAFP Casablanca →
- Entraînement et test en Machine Learning : pourquoi séparer les données ? →
- Comment évaluer un modèle de Machine Learning ? →
- Biais en Machine Learning : pourquoi faut-il les comprendre ? →
- Formation Machine Learning pour débutants : que faut-il apprendre ? →
FAQ — Intelligence Artificielle & Data
Que signifie overfitting?
Surapprentissage.
Qu’est-ce que le surapprentissage?
Une adaptation excessive aux données d’entraînement pouvant réduire la capacité de généralisation.
Quel lien avec le jeu de test?
Le test aide à examiner le comportement sur d’autres données.
Un modèle complexe est-il toujours meilleur?
Non.
Le surapprentissage est-il abordé dans la formation?
Oui.
Consultez la page principale de cette filière pour retrouver la durée, les conditions d’admission et les informations de préinscription.
