La régularisation est une technique fondamentale en apprentissage automatique pour contrôler la complexité des modèles et améliorer la généralisation. En ajoutant des contraintes, des pénalités ou du bruit au processus d'apprentissage, la régularisation réduit le surapprentissage (overfitting) — la tendance des modèles à mémoriser les données d'entraînement plutôt qu'à apprendre des motifs généralisables. Mes recherches sur la régularisation couvrent les méthodes de pénalité classiques, les approches bayésiennes, les techniques spécifiques aux réseaux de neurones et le lien entre la robustesse adverse et la régularisation.
Méthodes de régularisation classiques
Régularisation L1 et L2
La régularisation L1 (lasso) et L2 (ridge) ajoute des termes de pénalité à la fonction de perte qui contraignent l'ampleur des paramètres du modèle. La régularisation L1 encourage la parcimonie (de nombreux paramètres deviennent nuls), ce qui la rend utile pour la sélection de caractéristiques. La régularisation L2 réduit tous les paramètres vers zéro sans imposer de parcimonie, et possède une interprétation bayésienne naturelle sous forme de loi a priori gaussienne sur les paramètres.
Recherche sur la manière dont la régularisation L1 et L2 affecte les modèles appris par les modèles graphiques probabilistes, les algorithmes évolutionnaires et les réseaux de neurones, et sur la combinaison de plusieurs stratégies de régularisation pour une meilleure généralisation.
Parcimonie en programmation génétique
Application des concepts de régularisation à la programmation génétique via la pression de parcimonie : pénalisation de la fitness des programmes proportionnellement à leur complexité (nombre de nœuds, profondeur, etc.). La pression de parcimonie contrôle le gonflement (bloat) — la tendance des programmes génétiques à croître en taille sans améliorer la fitness — et encourage l'évolution de programmes compacts et généralisables.
Régularisation bayésienne
Distributions a priori comme régularisateurs
Dans le cadre bayésien, la régularisation apparaît naturellement via la spécification de distributions a priori sur les paramètres du modèle. Une loi a priori gaussienne sur les poids d'un modèle de régression correspond à la régularisation L2 (régression ridge) ; une loi a priori de Laplace correspond à la régularisation L1 (lasso). Recherche sur la manière dont les différents choix de distribution a priori façonnent les propriétés de généralisation des modèles bayésiens.
Critère d'information bayésien pour l'apprentissage de structure
Utilisation du critère d'information bayésien (BIC) comme score régularisé pour l'apprentissage de la structure de modèles graphiques probabilistes. Le BIC pénalise la complexité du modèle (nombre de paramètres) pour prévenir le surapprentissage pendant l'apprentissage de structure, équilibrant la qualité de l'ajustement et la parcimonie. Recherche sur l'influence de la pénalité BIC sur les structures apprises par les algorithmes d'apprentissage de réseaux bayésiens.
Régularisation des réseaux de neurones
Dropout et régularisation stochastique
Étude du dropout et d'autres techniques de régularisation stochastique pour les réseaux de neurones, incluant leur lien avec l'approximation bayésienne. Recherche sur la manière dont le dropout peut être interprété comme une inférence bayésienne approximative et utilisé pour fournir des estimations d'incertitude pour les prédictions des réseaux de neurones, particulièrement dans le contexte de l'apprentissage semi-supervisé et de la robustesse adverse.
Régularisation basée sur l'architecture en NAS
Régularisation via la conception de l'architecture : recherche sur la manière dont le choix de l'architecture du réseau de neurones (types de couches, motifs de connectivité, fonctions d'activation) régularise implicitement le modèle. Dans la recherche d'architecture neuronale (NAS), cela se traduit par la conception d'espaces de recherche qui favorisent naturellement les architectures généralisables par rapport à des architectures hautement expressives mais potentiellement sujettes au surapprentissage.
Régularisation dans les réseaux de neurones informés par la physique
Régularisation des réseaux de neurones informés par la physique (PINN) via le terme de perte physique. La perte physique agit comme un régulateur fort en contraignant le réseau à satisfaire les équations aux dérivées partielles sous-jacentes, réduisant significativement le risque de surapprentissage sur des données bruitées. Recherche sur l'équilibrage des termes de perte de données et de perte physique pour une généralisation optimale.
Régularisation adverse
L'entraînement adverse comme régularisation
L'entraînement adverse — incluant des exemples perturbés de manière adverse dans l'ensemble d'entraînement — peut être vu comme une forme d'augmentation de données et de régularisation qui améliore la robustesse aux attaques adverses et aux entrées hors distribution. Recherche sur les effets de régularisation de l'entraînement adverse, incluant son impact sur la géométrie des frontières de décision du modèle et sa généralisation à des perturbations adverses invisibles.
Perturbations adverses et généralisation
Étude de la relation entre la vulnérabilité adverse et la généralisation dans les réseaux de neurones. La recherche montre que les caractéristiques qui rendent un modèle précis sur la distribution d'entraînement peuvent être non robustes aux perturbations adverses, suggérant une tension fondamentale entre précision et robustesse que les méthodes de régularisation doivent aborder.
Régularisation implicite
Régularisation implicite dans les algorithmes d'optimisation
Recherche sur les effets de régularisation implicite des algorithmes d'optimisation utilisés pour l'entraînement des réseaux de neurones. Différents optimiseurs (SGD, Adam, méthodes du second ordre) imposent une régularisation implicite différente via leurs règles de mise à jour, affectant les solutions trouvées même sans termes de régularisation explicites. Ceci est particulièrement pertinent pour les réseaux de neurones sur-paramétrés où le paysage d'optimisation contient de nombreux minima globaux avec des propriétés de généralisation différentes.
Régularisation dans les modèles graphiques probabilistes
Régularisation des modèles graphiques probabilistes via des contraintes de structure (par ex., limitation du nombre maximum de parents dans un réseau bayésien), le lissage des paramètres (par ex., lissage de Laplace pour les tables de probabilités conditionnelles) et la régularisation bayésienne (par ex., lois a priori de Dirichlet sur les distributions catégorielles). Recherche sur l'influence de ces choix de régularisation sur la qualité et l'interprétabilité des modèles appris.
Publications sélectionnées