Accueil Formations Apprentissage par renforcement : de la recherche fondamentale à l’optimisation industrielle

Apprentissage par renforcement : de la recherche fondamentale à l’optimisation industrielle

Intéressé.e par la formation ?
Contactez-nous

Description

Formation articulant rigueur mathématique sans concession et mise en perspective des enjeux de souveraineté numérique et de recherche impliquée. Elle offre aux cadres et ingénieurs une compréhension profonde des mécanismes, permettant d’anticiper les ruptures technologiques plutôt que de simplement les subir.

Tarif adhérent : 2500€ / participant (net de taxe)

Intra-entreprise : Sur devis

Objectifs de la formation

À l’issue de la formation les participants seront en mesure de :

  • Modéliser des problèmes décisionnels complexes sous forme de processus de décision de Markov (MDP).
  • Implémenter et calibrer les algorithmes de pointe (Q-Learning, Policy Gradients,
    Deep RL).
  • Évaluer la viabilité et la sécurité du déploiement de modèles de renforcement en environnement de production réel.
  • Intégrer une démarche réflexive sur l’éthique et la robustesse des systèmes
    autonomes

Profil des béneficiaires

Pour qui

  • Ingénieurs en Intelligence Artificielle et Data Scientists souhaitant approfondir les mécanismes décisionnels complexes.
  • Chefs de projets IA et Directeurs Techniques (CTO) désireux d’intégrer des
    systèmes autonomes et auto-apprenants dans leurs processus de production

Prérequis

  • Niveau technique : maîtrise confirmée de Python et des frameworks de Deep Learning (TensorFlow ou PyTorch).
  • Niveau scientifique : solides bases en algèbre linéaire, probabilités et
    statistiques.
  • Expérience : pratique de la science des données ou de la gestion de projets
    techniques en IA.

Contenu de la formation

  • Séance 1 : Fondations et Processus de Décision de Markov (MDP)

    • Formalisation mathématique de l’interaction agent-environnement. Définition des états, actions, récompenses et du facteur d’escompte.
    • Atelier : Modélisation d’un problème industriel spécifique aux participants sous forme de MDP.
  • Séance 2 : Programmation Dynamique et Méthodes de Monte-Carlo

    • Équations de Bellman. Algorithmes d’itération de valeur et de politique. Apprentissage à partir de l’expérience complète.
  • Séance 3 : Apprentissage par Différence Temporelle (TD Learning)

    • Q-Learning et SARSA. Le compromis Exploration-Exploitation (Bandits manchots, epsilon-greedy).
  • Séance 4 : Deep Reinforcement Learning (DRL)

    • Intégration des réseaux de neurones profonds. Deep Q-Networks (DQN), Replay Buffer et Target Networks.
  • Séance 5 : Méthodes de Gradient de Politique (Policy Gradients

    • Algorithmes REINFORCE, Actor-Critic et introduction aux méthodes de pointe (PPO, Soft Actor-Critic).
  • Séance 6 : Mise en Production, Éthique et Sobriété Numérique

    • Déploiement (MloPs), robustesse face aux attaques adverses et évaluation de l’empreinte carbone des modèles.
  • Mentorat

    • Session individuelle en distanciel de diagnostic pour lever les verrous technologiques sur un projet propre à l’entreprise du participant.

Équipe pédagogique

  • Responsable

    Aurélien Garivier, professeur des universités.

    Unité de Mathématiques Pures et Appliquées & Laboratoire de l’Informatique du Parallélisme, ENS de Lyon

Suivi de l’exécution et évaluation des résultats
  • Attestation de formation

Ressources techniques et pédagogiques

  • Exposés théoriques
  • Études de cas
  • Exercices d’application
Accessibilité
  • Des aménagements peuvent être étudiés afin d’adapter les modalités pédagogiques et les conditions de formation aux besoins spécifiques de chacun.

Prochaines dates

Aucune session à venir pour l’instant.