16h CM, 14h TD

Plan du cours

- Principales étapes d’un processus de machine learning (apprentissage automatique) ou de fouille de données

- Ingénierie des données pour la préparation des données, la construction ou la sélection de variables

- Algorithmes de classification supervisée (ex : arbre de décision), procédures et métriques d’évaluation

- Algorithmes de clustering (ex. clustering hiérarchique), métriques d’évaluation

- Fouille de motifs (pattern mining) et de règles d’association

- Mise en œuvre du processus et des algorithmes sur des données du monde réel incluant des données en lien avec les disciplines des masters  (microbiologie, ingénierie moléculaire)

Pré-requis

 - Connaissance des bases de données relationnelles et du langage SQL

- Modèles statistiques pour l'analyse de données (estimation, tests...)

Acquis d'apprentissage

-  Différencier "recherche dans une BD" et "extraction de connaissances à partir de données massives"

Comprendre les différentes catégories d’algorithmes qui constituent le machine learning

Compétences visées

- Savoir appliquer correctement des programmes de machine learning (ex. librairie spécialisée ScikitLearn, matplotlib) sur des données réelles

Savoir préparer des données avant de les analyser