Description
Cette formation propose une présentation vulgarisée des modèles de langues modernes. Elle vise une approche pratique avec études de cas concrets (analyse de sentiments, détection d’entités nommées, résumé automatique, etc.) avec un focus sur la frugalité pour le choix d’une solution (rapport efficacité / efficience).
Vous utiliserez les bibliothèques de référence en Python (spaCy) ; et aborderez les transformers (huggingface). Vous développerez des solutions sans recourir à des API commerciales.
Tarif : Sur devis
Intra-entreprise : Sur devis
À l’issue de la formation les participants seront en mesure de mettre en place des solutions sans dépendre d’API commerciales :
- Pré-traiter des données textuelles
- Mettre en œuvre une solution locale pour traiter automatique des données textuelles
- Mettre en place un chatbot rudimentaire pouvant exploiter une collection documentaire locale
Profil des béneficiaires
Pour qui
- Machine Learning Engineer
- Data Scientist
- Décideurs souhaitant comprendre ce que l’on peut faire sans avoir recours à des API commerciales
Prérequis
- Connaissances en Python
- Familiarité avec les concepts de Machine Learning (notamment apprentissage supervisé et validation croisée)
- Compte Google fonctionnel permettant d’utiliser la version gratuite de Google Colab (nécessaire pour avoir accès à un GPU lors des ateliers)
Contenu de la formation
-
Jour 1 : Représentation vectorielle du sens des mots
- Espace vectoriel et sens des mots : concepts clés
- Apprentissage de représentations vectorielles du sens des mots
- Atelier : opérations linéaires sur les représentations pour résoudre des tâches simples
-
Jour 2 : Compréhension de la langue
- Mécanisme d’attention & Transformer
- Modèle de langue de type encodeur
- Atelier : adapter un modèle encodeur à diverses tâches
-
Jour 3 : Génération de la langue
- Modèle de langue de type décodeur
- Pré-entraînement et alignement
- Génération augmentée par recherche d’information (RAG)
- Atelier : mettre en place un chatbot RAG local, interroger une base de données SQL en langage naturel
Équipe pédagogique
-
Responsable
Dr. Adrien GUILLE
- Pédagogie active : Alternance de cours théoriques (30%) et d’ateliers pratiques (70%).
- Évaluation : QCM en fin de module + projet pratique. Attestation de formation remise à l’issue des 3 jours, incluant les compétences acquises.
Ressources techniques et pédagogiques
- Notebooks Python
- Jeux de données réels
- Des aménagements peuvent être étudiés afin d’adapter les modalités pédagogiques et les conditions de formation aux besoins spécifiques de chacun.