Ce cours explore les approches modernes d'apprentissage et d'inférence en vision par ordinateur et en compréhension de scènes 3D. Les étudiants étudieront quatre paradigmes complémentaires qui structurent le domaine aujourd'hui : les représentations neuronales implicites (INR) pour encoder des signaux et de la géométrie sous forme continue ; l'analyse par synthèse via le rendu différentiable, illustrée par les champs de radiance neuronaux (NeRF) ; l'inférence amortie pour la reconstruction 3D rapide, avec des modèles feed-forward récents tels que DUSt3R et VGGT ; et les modèles génératifs vidéo, ainsi que les modèles vision-langage-action (VLA) pour la prise de décision en environnements dynamiques.

Le cours combine fondements théoriques et expérimentation pratique. L'enseignement s'articule autour de quatre cours magistraux (3 heures chacun) introduisant les concepts clés et la littérature récente, de deux séances de travaux pratiques (3 heures chacune) au cours desquelles les étudiants implémentent et analysent les méthodes étudiées, et d'un projet final (deux séances de 3 heures) où de petits groupes explorent un sujet de leur choix, en s'appuyant sur les techniques vues en cours. Le projet se conclut par une présentation orale et un court rapport écrit.

À l'issue du cours, les étudiants seront familiarisés avec les approches de pointe en représentation neuronale de scènes et en perception générative, et auront acquis une expérience pratique de l'implémentation, l'entraînement et l'évaluation de tels modèles.