Les forêts aléatoires avec R

La 4e de couv. indique : "Les forêts aléatoires sont une méthode d'apprentissage statistique qui fait aujourd'hui partie des outils centraux des statisticiens ou autres data scientists. Introduites par Leo Breiman en 2001, elles sont depuis intensément utilisées dans de nombreux domai...

Fuld beskrivelse

Enregistré dans:
Bibliografiske detaljer
Auteurs principaux: Genuer, Robin, 1983-, Poggi, Jean-Michel, 1960- (Auteur)
Format: Livre papier
Sprog:Français
Udgivet: Rennes : Presses universitaires de Rennes 2019.
Serier:Pratique de la statistique
Fag:
Autres localisations: Voir dans le Sudoc
Indholdsfortegnelse:
  • P. i
  • Remerciements
  • P. iii
  • Avant-propos
  • P. 1
  • 1 Introduction
  • P. 1
  • 1.1 Préambule
  • P. 2
  • 1.2 Notations
  • P. 3
  • 1.3 Objectifs statistiques
  • P. 4
  • 1.4 Packages
  • P. 5
  • 1.5 Jeux de données
  • P. 5
  • 1.5.1 Exemple fil rouge : détection de spams
  • P. 6
  • 1.5.2 Pollution par l'ozone
  • P. 7
  • 1.5.3 Données génomiques pour une étude vaccinale
  • P. 7
  • 1.5.4 Pollution par les poussières
  • P. 9
  • 2 Arbres CART
  • P. 9
  • 2.1 Le principe
  • P. 10
  • 2.2 Construction de l'arbre maximal
  • P. 13
  • 2.3 Élagage
  • P. 16
  • 2.4 Le package rpart
  • P. 24
  • 2.5 Découpes concurrentes et de substitution
  • P. 24
  • 2.5.1 Découpes compétitives ou concurrentes
  • P. 24
  • 2.5.2 Découpes de substitution
  • P. 26
  • 2.5.3 Interprétabilité
  • P. 28
  • 2.6 Exemples
  • P. 28
  • 2.6.1 Prédire la concentration d'ozone
  • P. 31
  • 2.6.2 Analyser des données génomiques
  • P. 35
  • 3 Forêts aléatoires
  • P. 35
  • 3.1 Principe général
  • P. 36
  • 3.1.1 Instabilité d'un arbre
  • P. 39
  • 3.1.2 D'un arbre à un ensemble : le Bagging
  • P. 41
  • 3.2 Forêts aléatoires Random Inputs
  • P. 43
  • 3.3 Le package randomForest
  • P. 45
  • 3.4 Erreur Out-Of-Bag
  • P. 46
  • 3.5 Réglage des paramètres pour la prédiction
  • P. 46
  • 3.5.1 Le nombre d'arbres ntree
  • P. 47
  • 3.5.2 Le nombre de variables choisies à chaque noeud mtry
  • P. 50
  • 3.6 Exemples
  • P. 50
  • 3.6.1 Prédire la concentration d'ozone
  • P. 53
  • 3.6.2 Analyser des données génomiques
  • P. 56
  • 3.6.3 Analyser la pollution par les poussières
  • P. 61
  • 4 Importance des variables
  • P. 61
  • 4.1 Notions d'importance
  • P. 65
  • 4.2 Comportement de l'importance
  • P. 66
  • 4.2.1 Comportement vis-à-vis de n et p
  • P. 67
  • 4.2.2 Comportement vis-à-vis de groupes de variables corrélées
  • P. 68
  • 4.3 Diversité des arbres et importance
  • P. 70
  • 4.4 Influence des paramètres et importance
  • P. 72
  • 4.5 Exemples
  • P. 72
  • 4.5.1 Une illustration par simulation en régression
  • P. 74
  • 4.5.2 Prédire la concentration d'ozone
  • P. 77
  • 4.5.3 Analyser des données génomiques
  • P. 79
  • 4.5.4 Pollution de l'air par les poussières : quelle part locale ?
  • P. 83
  • 5 Sélection de variables
  • P. 83
  • 5.1 Généralités
  • P. 85
  • 5.2 Le principe
  • P. 86
  • 5.3 La procédure
  • P. 87
  • 5.4 Le package VSURF
  • P. 94
  • 5.5 Réglage des paramètres pour la sélection
  • P. 96
  • 5.6 Exemples
  • P. 96
  • 5.6.1 Prédire la concentration d'ozone
  • P. 97
  • 5.6.2 Analyser des données génomiques
  • P. 101
  • Bibliographie
  • P. 107
  • Index des fonctions
  • P. 108
  • Index