Ce cours propose une vue d’ensemble moderne de l’apprentissage statistique sur données tabulaires, depuis les modèles classiques à base d’arbres jusqu’aux modèles profonds et aux modèles de fondation émergents. Nous reviendrons sur les fondements des méthodes de gradient boosting et de leurs implémentations à grande échelle, présenterons les modèles récents de deep learning conçus pour les données tabulaires, puis introduirons les modèles de fondation tabulaires. En particulier, nous discuterons des limites des grands modèles de langage (LLM) sur les données structurées, présenterons le concept d’apprentissage en contexte (in-context learning), et proposerons une compréhension approfondie des nouveaux modèles de fondation tabulaires, incluant leur architecture et leurs stratégies de préentraînement. Le cours abordera également des défis pratiques majeurs rencontrés dans les jeux de données réels et les applications, tels que l’encodage de variables hétérogènes (catégorielles, numériques, temporelles, textuelles), ainsi que les stratégies de gestion des données manquantes.