-
451
pages
-
Français
-
Ebooks
-
2023
Description
Cet ouvrage expose de manière détaillée, exemples à l’appui, différentes façons de répondre à un des problèmes statistiques les plus courants : la régression. Cette nouvelle édition se décompose en cinq parties. La première donne les grands principes des régressions simple et multiple par moindres carrés. Les fondamentaux de la méthode, tant au niveau des choix opérés que des hypothèses et leur utilité, sont expliqués. La deuxième partie est consacrée à l’inférence et présente les outils permettant de vérifier les hypothèses mises en œuvre. Les techniques d’analyse de la variance et de la covariance sont également présentées dans cette partie. Le cas de la grande dimension est ensuite abordé dans la troisième partie. Différentes méthodes de réduction de la dimension telles que la sélection de variables, les régressions sous contraintes (lasso, elasticnet ou ridge) et sur composantes (PLS ou PCR) sont notamment proposées. Un dernier chapitre propose des algorithmes, basés sur des méthodes de rééchantillonnage comme l’apprentissage/validation ou la validation croisée, qui permettent d’établir une comparaison entre toutes ces méthodes. La quatrième partie se concentre sur les modèles linéaires généralisés et plus particulièrement sur les régressions logistique et de Poisson avec ou sans technique de régularisation. Une section particulière est consacrée aux comparaisons de méthodes en classification supervisée. Elle introduit notamment des critères de performance pour scorer des individus comme les courbes ROC et lift et propose des stratégies de choix seuil (Younden, macro F1...) pour les classer. Ces notions sont ensuite mises en œuvre sur des données réelles afin de sélectionner une méthode de prévision parmi plusieurs algorithmes basés sur des modèles logistiques (régularisés ou non). Une dernière section aborde le problème des données déséquilibrées qui est souvent rencontré en régression binaire. Enfin, la dernière partie présente l’approche non paramétrique à travers les splines, les estimateurs à noyau et des plus proches voisins. La présentation témoigne d’un réel souci pédagogique des auteurs qui bénéficient d’une expérience d’enseignement auprès de publics très variés. Les résultats exposés sont replacés dans la perspective de leur utilité pratique grâce à l’analyse d’exemples concrets. Les commandes permettant le traitement des exemples sous R figurent dans le corps du texte. Enfin, chaque chapitre est complété par une suite d’exercices corrigés. 3 1.1.1 Un exemple : la pollutionde l’air ............... 3 1.1.2 Un second exemple : lahauteur des arbres .......... 5 1.2 Modélisation mathématique..................... 7 1.2.1 Choix du critère de qualitéet distance à la droite ...... 7 1.2.2 Choix des fonctions àutiliser ................. 9 1.3 Modélisation statistique . .. . . . . . . . . . . . . . . . . . . . . . 10 1.4 Estimateurs des moindrescarrés . . . . . . . . . . . . . . . . . . . 11 1.4.1 Calcul des estimateurs deβj , quelques propriétés . . . . . . 11 1.4.2 Résidus et variancerésiduelle . . . . . . . . . . . . . . . . . 15 1.4.3 Prévision . . . . . . . . .. . . . . . . . . . . . . . . . . . . 15 1.5 Interprétations géométriques. . . . . . . . . . . . . . . . . . . . . 16 1.5.1 Représentation desindividus . . . . . . . . . . . . . . . . . 16 1.5.2 Représentation desvariables . . . . . . . . . . . . . . . . . . 17 1.6 Inférence statistique . . . .. . . . . . . . . . . . . . . . . . . . . . 19 1.7 Exemples . . . . . . . . . .. . . . . . . . . . . . . . . . . . . . . . 22 1.8 Exercices . . . . . . . . . .. . . . . . . . . . . . . . . . . . . . . . 29 2 La régression linéaire multiple31 2.1 Introduction . . . . . . . .. . . . . . . . . . . . . . . . . . . . . . . 31 2.2 Modélisation . . . . . . . .. . . . . . . . . . . . . . . . . . . . . . 32 2.3 Estimateurs des moindrescarrés . . . . . . . . . . . . . . . . . . . 34 2.3.1 Calcul de βˆ . . . . . . .. . . . . . . . . . . . . . . . . . . . 35 2.3.2 Interprétation . . . . . .. . . . . . . . . . . . . . . . . . . . 37 2.3.3 Quelques propriétésstatistiques . . . . . . . . . . . . . . . . 38 2.3.4 Résidus et variancerésiduelle . . . . . . . . . . . . . . . . . 40 2.3.5 Prévision . . . . . . . . .. . . . . . . . . . . . . . . . . . . 41 2.4 Interprétation géométrique .. . . . . . . . . . . . . . . . . . . . . 42 2.5 Exemples . . . . . . . . . .. . . . . . . . . . . . . . . . . . . . . . 43 2.6 Exercices . . . . . . . . . .. . . . . . . . . . . . . . . . . . . . . . 47 3 Validation du modèle 51 3.1 Analyse des résidus . . . . .. . . . . . . . . . . . . . . . . . . . . . 52 3.1.1 Les différents résidus . .. . . . . . . . . . . . . . . . . . . . 52 3.1.2 Ajustement individuel aumodèle, valeur aberrante . . . . . 53 3.1.3 Analyse de la normalité . .. . . . . . . . . . . . . . . . . . 54 3.1.4 Analyse del’homoscédasticité . . . . . . . . . . . . . . . . . 55 3.1.5 Analyse de la structure desrésidus . . . . . . . . . . . . . . 56 3.2 Analyse de la matrice deprojection . . . . . . . . . . . . . . . . . . 59 3.3 Autres mesures diagnostiques. . . . . . . . . . . . . . . . . . . . . 60 3.4 Effet d’une variableexplicative . . . . . . . . . . . . . . . . . . . . 63 3.4.1 Ajustement au modèle . . .. . . . . . . . . . . . . . . . . . 63 3.4.2 Régression partielle :impact d’une variable . . . . . . . . . 64 3.4.3 Résidus partiels et résiduspartiels augmentés . . . . . . . . 65 3.5 Exemple : la concentration enozone . . . . . . . . . . . . . . . . . 67 3.6 Exercices . . . . . . . . . .. . . . . . . . . . . . . . . . . . . . . . 70 4 Extensions : non-inversibilitéet (ou) erreurs corrélées 73 4.1 Régression ridge . . . . . .. . . . . . . . . . . . . . . . . . . . . . 73 4.1.1 Une solution historique . .. . . . . . . . . . . . . . . . . . 74 4.1.2 Minimisation des MCOpénalisés . . . . . . . . . . . . . . . 75 4.1.3 Equivalence avec unecontrainte sur la norme des coefficients 75 4.1.4 Propriétés statistiques del’estimateur ridge βˆridge . . . . . . 76 4.2 Erreurs corrélées : moindrescarrés généralisés . . . . . . . . . . . . 78 4.2.1 Erreurs hétéroscédastiques. . . . . . . . . . . . . . . . . . . 79 4.2.2 Estimateur des moindrescarrés généralisés . . . . . . . . . 82 4.2.3 Matrice Ω inconnue . . . .. . . . . . . . . . . . . . . . . . 84 4.3 Exercices . . . . . . . . . .. . . . . . . . . . . . . . . . . . . . . . 85 II Inférence 89 5 Inférence dans le modèlegaussien 91 5.1 Estimateurs du maximum devraisemblance . . . . . . . . . . . . . 91 5.2 Nouvelles propriétésstatistiques . . . . . . . . . . . . . . . . . . . 92 5.3 Intervalles et régions deconfiance . . . . . . . . . . . . . . . . . . . 94 5.4 Prévision . . . . . . . . . .. . . . . . . . . . . . . . . . . . . . . . 97 5.5 Les tests d’hypothèses . . .. . . . . . . . . . . . . . . . . . . . . . 98 5.5.1 Introduction . . . . . . .. . . . . . . . . . . . . . . . . . . 98 5.5.2 Test entre modèles emboîtés. . . . . . . . . . . . . . . . . . 98 5.6 Applications . . . . . . . .. . . . . . . . . . . . . . . . . . . . . . . 102 5.7 Exercices . . . . . . . . . .. . . . . . . . . . . . . . . . . . . . . . 106 5.8 Notes . . . . . . . . . . . .. . . . . . . . . . . . . . . . . . . . . . 109 5.8.1 Intervalle de confiance :bootstrap . . . . . . . . . . . . . . 109 5.8.2 Test de Fisher pour unehypothèse linéaire quelconque . . . 112 5.8.3 Propriétés asymptotiques .. . . . . . . . . . . . . . . . . . 114 6 Variables qualitatives : ANCOVAet ANOVA 117 6.1 Introduction . . . . . . . .. . . . . . . . . . . . . . . . . . . . . . . 117 6.2 Analyse de la covariance . .. . . . . . . . . . . . . . . . . . . . . . 119 6.2.1 Introduction : exemple deseucalyptus . . . . . . . . . . . . 119 6.2.2 Modélisation du problème .. . . . . . . . . . . . . . . . . . 121 6.2.3 Hypothèse gaussienne . . .. . . . . . . . . . . . . . . . . . 123 6.2.4 Exemple : la concentrationen ozone . . . . . . . . . . . . . 124 6.2.5 Exemple : la hauteur deseucalyptus . . . . . . . . . . . . . 129 6.3 Analyse de la variance à 1facteur . . . . . . . . . . . . . . . . . . . 131 6.3.1 Introduction . . . . . . .. . . . . . . . . . . . . . . . . . . 131 6.3.2 Modélisation du problème .. . . . . . . . . . . . . . . . . . 132 6.3.3 Interprétation descontraintes . . . . . . . . . . . . . . . . . 134 6.3.4 Estimation des paramètres .. . . . . . . . . . . . . . . . . 134 6.3.5 Hypothèse gaussienne ettest d’influence du facteur . . . . . 136 6.3.6 Exemple : la concentrationen ozone . . . . . . . . . . . . . 137 6.3.7 Une décomposition directede la variance . . . . . . . . . . 142 6.4 Analyse de la variance à 2facteurs . . . . . . . . . . . . . . . . . . 142 6.4.1 Introduction . . . . . . .. . . . . . . . . . . . . . . . . . . 142 6.4.2 Modélisation du problème .. . . . . . . . . . . . . . . . . . 143 6.4.3 Estimation des paramètres .. . . . . . . . . . . . . . . . . 145 6.4.4 Analyse graphique del’interaction . . . . . . . . . . . . . . 146 6.4.5 Hypothèse gaussienne ettest de l’interaction . . . . . . . . 148 6.4.6 Exemple : la concentrationen ozone . . . . . . . . . . . . . 150 6.5 Exercices . . . . . . . . . .. . . . . . . . . . . . . . . . . . . . . . 152 6.6 Note : identifiabilité etcontrastes . . . . . . . . . . . . . . . . . . . 155 III Réduction de dimension 157 7 Choix de variables 159 7.1 Introduction . . . . . . . .. . . . . . . . . . . . . . . . . . . . . . . 159 7.2 Choix incorrect de variables: conséquences . . . . . . . . . . . . . 161 7.2.1 Biais des estimateurs . . .. . . . . . . . . . . . . . . . . . 161 7.2.2 Variance des estimateurs .. . . . . . . . . . . . . . . . . . . 163 7.2.3 Erreur quadratique moyenne. . . . . . . . . . . . . . . . . 163 7.2.4 Erreur quadratique moyennede prévision . . . . . . . . . . 166 7.3 Critères classiques de choixde modèles . . . . . . . . . . . . . . . 168 7.3.1 Tests entre modèlesemboîtés . . . . . . . . . . . . . . . . . 169 7.3.2 Le R2 . . . . . . . . . . .. . . . . . . . . . . . . . . . . . . 170 7.3.3 Le R2 ajusté . . . . . . .. . . . . . . . . . . . . . . . . . . 171 7.3.4 Le Cp de Mallows . . . . .. . . . . . . . . . . . . . . . . . 172 7.3.5 Vraisemblance etpénalisation . . . . . . . . . . . . . . . . . 174 7.3.6 Liens entre les critères .. . . . . . . . . . . . . . . . . . . . 176 7.4 Procédure de sélection . . .. . . . . . . . . . . . . . . . . . . . . . 178 7.4.1 Recherche exhaustive . . .. . . . . . . . . . . . . . . . . . . 178 7.4.2 Recherche pas à pas . . . .. . . . . . . . . . . . . . . . . . 178 7.5 Exemple : la concentration enozone . . . . . . . . . . . . . . . . . 180 7.5.1 Variables explicativesquantitatives . . . . . . . . . . . . . . 180 7.5.2 Intégration de variablesqualitatives . . . . . . . . . . . . . 183 7.6 Exercices . . . . . . . . . .. . . . . . . . . . . . . . . . . . . . . . 184 7.7 Note : Cp et biais desélection . . . . . . . . . . . . . . . . . . . . . 187 8 Régularisation des moindrescarrés : Ridge, Lasso et elastic-net 191 8.1 Introduction . . . . . . . .. . . . . . . . . . . . . . . . . . . . . . . 191 8.2 Problème ducentrage-réduction des variables . . . . . . . . . . . . 194