IGNACE BAGRE
← Accueil
Statistiques & méthodes

Exercices appliqués en statistique et apprentissage automatique

Un espace distinct de mes projets de recherche environnementale, dédié aux méthodes statistiques et d'apprentissage automatique que je pratique et approfondis — clustering, classification, évaluation de modèles. Les jeux de données utilisés ici sont pédagogiques ; l'objectif est de documenter la méthode, pas le terrain.

Exercice pédagogique
Cas d'étude

Prédiction de survie — jeu de données Titanic

Exercice classique de classification supervisée, utilisé ici pour illustrer trois méthodes complémentaires : une exploration non supervisée par clustering, une évaluation de modèle par courbe ROC, et une interprétation de modèle par importance des variables (Random Forest).

01 — Exploration

Structure des données par clustering

Projection des individus sur les deux premières dimensions d'une analyse factorielle, avec regroupement en 4 clusters. Les enveloppes convexes montrent des groupes assez bien séparés sur le premier axe (38,6 % de variance expliquée), avec un chevauchement notable entre les clusters 1 et 4.

Graphique de clustering — projection sur deux dimensions avec 4 groupes
Figure 1 — Clustering des individus (Dim1 38,6 % · Dim2 29,6 % de variance expliquée)
02 — Évaluation

Performance du modèle logistique

Courbe ROC sur le jeu de test pour un modèle de régression logistique prédisant la survie. La courbe s'écarte nettement de la diagonale (classification aléatoire), indiquant une bonne capacité de discrimination du modèle entre les deux classes.

Courbe ROC du modèle de régression logistique sur le jeu de test
Figure 2 — Courbe ROC, modèle logistique (test set)
03 — Interprétation

Importance des variables (Random Forest)

Classement des variables prédictives selon deux critères : la baisse de précision moyenne (MeanDecreaseAccuracy) et la baisse moyenne de l'indice de Gini (MeanDecreaseGini) lorsqu'elles sont retirées du modèle. Le sexe et le tarif payé (fare) ressortent comme les variables les plus déterminantes — cohérent avec les analyses historiques du naufrage.

Graphique d'importance des variables pour le modèle Random Forest
Figure 3 — Importance des variables, modèle Random Forest

Ces trois méthodes — non supervisée, linéaire, et à base d'arbres — offrent des lectures complémentaires d'un même problème de classification, et illustrent une palette d'outils statistiques mobilisables au-delà des projets de télédétection.