Description
Formation articulant rigueur mathématique sans concession et mise en perspective des enjeux de souveraineté numérique et de recherche impliquée. Elle offre aux cadres et ingénieurs une compréhension profonde des mécanismes, permettant d’anticiper les ruptures technologiques plutôt que de simplement les subir.
Tarif adhérent : 2500€ / participant (net de taxe)
Intra-entreprise : Sur devis
À l’issue de la formation les participants seront en mesure de :
- Modéliser des problèmes décisionnels complexes sous forme de processus de décision de Markov (MDP).
- Implémenter et calibrer les algorithmes de pointe (Q-Learning, Policy Gradients,
Deep RL). - Évaluer la viabilité et la sécurité du déploiement de modèles de renforcement en environnement de production réel.
- Intégrer une démarche réflexive sur l’éthique et la robustesse des systèmes
autonomes
Profil des béneficiaires
Pour qui
- Ingénieurs en Intelligence Artificielle et Data Scientists souhaitant approfondir les mécanismes décisionnels complexes.
- Chefs de projets IA et Directeurs Techniques (CTO) désireux d’intégrer des
systèmes autonomes et auto-apprenants dans leurs processus de production
Prérequis
- Niveau technique : maîtrise confirmée de Python et des frameworks de Deep Learning (TensorFlow ou PyTorch).
- Niveau scientifique : solides bases en algèbre linéaire, probabilités et
statistiques. - Expérience : pratique de la science des données ou de la gestion de projets
techniques en IA.
Contenu de la formation
-
Séance 1 : Fondations et Processus de Décision de Markov (MDP)
- Formalisation mathématique de l’interaction agent-environnement. Définition des états, actions, récompenses et du facteur d’escompte.
- Atelier : Modélisation d’un problème industriel spécifique aux participants sous forme de MDP.
-
Séance 2 : Programmation Dynamique et Méthodes de Monte-Carlo
- Équations de Bellman. Algorithmes d’itération de valeur et de politique. Apprentissage à partir de l’expérience complète.
-
Séance 3 : Apprentissage par Différence Temporelle (TD Learning)
- Q-Learning et SARSA. Le compromis Exploration-Exploitation (Bandits manchots, epsilon-greedy).
-
Séance 4 : Deep Reinforcement Learning (DRL)
- Intégration des réseaux de neurones profonds. Deep Q-Networks (DQN), Replay Buffer et Target Networks.
-
Séance 5 : Méthodes de Gradient de Politique (Policy Gradients
- Algorithmes REINFORCE, Actor-Critic et introduction aux méthodes de pointe (PPO, Soft Actor-Critic).
-
Séance 6 : Mise en Production, Éthique et Sobriété Numérique
- Déploiement (MloPs), robustesse face aux attaques adverses et évaluation de l’empreinte carbone des modèles.
-
Mentorat
- Session individuelle en distanciel de diagnostic pour lever les verrous technologiques sur un projet propre à l’entreprise du participant.
Équipe pédagogique
-
Responsable
Aurélien Garivier, professeur des universités.
Unité de Mathématiques Pures et Appliquées & Laboratoire de l’Informatique du Parallélisme, ENS de Lyon
- Attestation de formation
Ressources techniques et pédagogiques
- Exposés théoriques
- Études de cas
- Exercices d’application
- Des aménagements peuvent être étudiés afin d’adapter les modalités pédagogiques et les conditions de formation aux besoins spécifiques de chacun.