Guide CAFP · Intelligence Artificielle & Data

Entraînement et test en Machine Learning : pourquoi séparer les données ?

Lorsqu’un modèle fonctionne bien sur les données utilisées pour l’entraîner, cela ne suffit pas à démontrer qu’il se comportera correctement sur de nouvelles données.

À retenir

C’est pourquoi la distinction entre entraînement et test constitue une notion fondamentale du Machine Learning.

Qu’est-ce que l’entraînement ?

L’entraînement correspond à la phase pendant laquelle le modèle apprend à partir des données mises à sa disposition.

Il ajuste son comportement afin de répondre au problème étudié.

Qu’est-ce que le test ?

Le test permet d’examiner le comportement du modèle sur des données qui n’ont pas joué le même rôle pendant son apprentissage.

L’objectif est d’obtenir une meilleure indication de sa capacité à traiter de nouveaux exemples.

Pourquoi ne pas tout utiliser pour l’entraînement ?

Si l’on examine uniquement le modèle sur les données qu’il a déjà utilisées pour apprendre, on risque d’obtenir une vision trop favorable de son comportement.

Il est donc utile de conserver des données pour l’évaluation.

Quelle progression retenir ?

Une représentation simplifiée est :

données → séparation → entraînement → prédiction → test/évaluation.

Cette représentation sert à comprendre le principe et ne constitue pas une procédure universelle pour tous les projets.

Quel lien avec le surapprentissage ?

Un modèle peut apprendre trop précisément certaines particularités des données d’entraînement et moins bien fonctionner sur de nouvelles données.

C’est le problème du surapprentissage.

La séparation entraînement/test aide à mieux observer ce type de difficulté.

Est-ce suffisant pour garantir un bon modèle ?

Non.

L’évaluation d’un modèle dépend du problème, des données et de la méthodologie adoptée.

La séparation entraînement/test constitue une base, pas une garantie automatique.

La proportion exacte de données est-elle toujours la même ?

Non.

Il n’existe pas une proportion unique adaptée à toutes les situations.

Le programme public ne publie d’ailleurs pas de ratio obligatoire à appliquer.

Pourquoi apprendre cela dès le niveau débutant ?

Parce que cette distinction développe une idée essentielle :

un modèle doit être évalué au-delà des exemples qu’il a utilisés pour apprendre.

Guides complémentaires

FAQ — Intelligence Artificielle & Data

Qu’est-ce que le jeu d’entraînement?

Les données utilisées pour l’apprentissage du modèle.

Qu’est-ce que le jeu de test?

Des données utilisées pour examiner son comportement après l’apprentissage.

Pourquoi les séparer?

Pour mieux évaluer la capacité du modèle à traiter de nouvelles données.

Existe-t-il un ratio obligatoire?

Non, pas universellement.

Cette notion est-elle au programme?

Oui.

Formation Intelligence Artificielle & Data au CAFP Casablanca

Consultez la page principale de cette filière pour retrouver la durée, les conditions d’admission et les informations de préinscription.

Retour à la filière
WhatsApp