3.5SpécialisationSession 3 · Deep Learning & Applied Machine Learning

Algorithmes d'apprentissage par renforcement

15classes45htotalTH2 · PR1 · PNW2pondération par classe

Déroulé classe par classe

15 classes

TH = théorie · PR = pratique · PNW = travail personnel. Ce sont des codes de pondération du ministère (et non des heures) servant à répartir les minutes de chaque classe. La durée d'une classe = heures du cours ÷ nombre de classes ; les trois plages horaires ci-dessous totalisent toujours cette durée.

0%

Progression des quiz

0 sur 0 classes tentées

2 premières classes gratuites avec un parrainage 14 de plus avec l'inscription180 min par classeThéorie 72mPratique 36mTravail personnel 72m
1

Pourquoi l'apprentissage par renforcement compte pour les agents IA modernes

GratuitTH2PR1PNW2

Un gestionnaire d'intégration d'IA qui comprend le RL peut expliquer comment les LLM d'aujourd'hui ont été alignés avec la rétroaction humaine — c'est le fondement de la GenAI sûre.

Théorie72m
  • Bases du RL : agents, actions, récompenses, environnements
  • Comment le RLHF a façonné les LLM modernes pour qu'ils soient utiles et sûrs
  • Où le RL apparaît dans l'IA agentique : optimisation, alignement, évaluation
Pratique36m
  • Associez un comportement d'agent à un signal de récompense (que maximise-t-on ?)
  • Identifiez où le RLHF a vraisemblablement influencé un produit GenAI que vous utilisez
Travail personnel72m
  • Rédigez une courte note sur un concept de RL qui explique un comportement GenAI
  • Micro-tâche : remettre votre note
2

La boucle de RL — comment les agents apprennent des conséquences

VerrouilléTH2PR1PNW2

Aperçu de classe verrouillée

Un analyste de données ou d'affaires qui cadre les décisions comme des boucles comprend les agents — chaque action met à jour le monde et le prochain choix

Inscrivez-vous pour déverrouiller chaque classe de ce cours — le déroulé complet, le tuteur IA et le quiz.

Parler aux admissions
3

L'hypothèse de la récompense — concevoir des signaux pour le comportement d'agent

VerrouilléTH2PR1PNW2

Aperçu de classe verrouillée

Un gestionnaire de projet qui traduit « fais mieux » en un nombre comprend le RL — chaque but d'agent devient un signal de récompense

Inscrivez-vous pour déverrouiller chaque classe de ce cours — le déroulé complet, le tuteur IA et le quiz.

Parler aux admissions
4

Exploration vs exploitation — le compromis fondamental de l'agent

VerrouilléTH2PR1PNW2

Aperçu de classe verrouillée

Une stratège en marketing numérique qui équilibre nouveaux auditoires vs auditoires éprouvés affronte le dilemme explorer/exploiter — ce sont les mêmes maths que les agents utilisent

Inscrivez-vous pour déverrouiller chaque classe de ce cours — le déroulé complet, le tuteur IA et le quiz.

Parler aux admissions
5

RLHF — apprentissage par renforcement à partir de la rétroaction humaine

VerrouilléTH2PR1PNW2

Aperçu de classe verrouillée

Un gestionnaire d'intégration d'IA qui sait expliquer le RLHF démystifie comment les LLM sont devenus des assistants utiles — c'est la technique d'alignement fondamentale

Inscrivez-vous pour déverrouiller chaque classe de ce cours — le déroulé complet, le tuteur IA et le quiz.

Parler aux admissions
6

RLAIF — la rétroaction par IA comme alternative évolutif

VerrouilléTH2PR1PNW2

Aperçu de classe verrouillée

Un analyste de données ou d'affaires qui connaît le RLAIF comprend comment la rétroaction générée par IA met l'alignement à l'échelle quand les étiquettes humaines sont coûteuses

Inscrivez-vous pour déverrouiller chaque classe de ce cours — le déroulé complet, le tuteur IA et le quiz.

Parler aux admissions
7

Modélisation de récompense — apprendre ce que les humains préfèrent

VerrouilléTH2PR1PNW2

Aperçu de classe verrouillée

Un gestionnaire de projet qui comprend les modèles de récompense sait que la qualité de l'alignement dépend de la capacité du modèle à capturer les préférences humaines

Inscrivez-vous pour déverrouiller chaque classe de ce cours — le déroulé complet, le tuteur IA et le quiz.

Parler aux admissions
8

Optimisation de politique — comment le modèle s'améliore vraiment

VerrouilléTH2PR1PNW2

Aperçu de classe verrouillée

Un gestionnaire d'intégration d'IA qui évoque l'optimisation de politique parle le langage de la façon dont les LLM sont ajustés vers un meilleur comportement

Inscrivez-vous pour déverrouiller chaque classe de ce cours — le déroulé complet, le tuteur IA et le quiz.

Parler aux admissions
9

Optimisation d'agent multi-étapes — récompenses sur une tâche entière

VerrouilléTH2PR1PNW2

Aperçu de classe verrouillée

Un analyste de données ou d'affaires qui récompense un agent pour le succès de bout en bout (pas juste une étape) obtient des agents qui résolvent de vrais problèmes

Inscrivez-vous pour déverrouiller chaque classe de ce cours — le déroulé complet, le tuteur IA et le quiz.

Parler aux admissions
10

Boucles de rétroaction pour les agents à appel d'outils

VerrouilléTH2PR1PNW2

Aperçu de classe verrouillée

Un gestionnaire de projet qui intègre des boucles de rétroaction dans les agents à appel d'outils leur permet d'améliorer quels outils ils choisissent et comment ils les utilisent

Inscrivez-vous pour déverrouiller chaque classe de ce cours — le déroulé complet, le tuteur IA et le quiz.

Parler aux admissions
11

Évaluer le comportement d'agent autonome — au-delà de l'exactitude

VerrouilléTH2PR1PNW2

Aperçu de classe verrouillée

Un gestionnaire d'intégration d'IA qui évalue les agents sur la sécurité, le coût et le succès de tâche — pas juste l'exactitude — livre des agents en qui les gens peuvent avoir confiance

Inscrivez-vous pour déverrouiller chaque classe de ce cours — le déroulé complet, le tuteur IA et le quiz.

Parler aux admissions
12

Sécurité et alignement — prévenir les comportements d'agent nuisibles

VerrouilléTH2PR1PNW2

Aperçu de classe verrouillée

Un analyste de données ou d'affaires qui comprend les risques d'alignement sait pourquoi le RL non contraint sur les agents peut produire un comportement dangereux

Inscrivez-vous pour déverrouiller chaque classe de ce cours — le déroulé complet, le tuteur IA et le quiz.

Parler aux admissions
13

Mini-projet — concevoir une récompense et une évaluation pour un agent

VerrouilléTH2PR1PNW2

Aperçu de classe verrouillée

Cette répétition de projet de fin prouve qu'un analyste de données ou d'affaires peut concevoir le signal de récompense et l'évaluation qui aligneraient un vrai agent

Inscrivez-vous pour déverrouiller chaque classe de ce cours — le déroulé complet, le tuteur IA et le quiz.

Parler aux admissions
14

RL inverse et apprentissage de préférences — inférer ce que veulent les utilisateurs

VerrouilléTH2PR1PNW2

Aperçu de classe verrouillée

Une stratège en marketing numérique qui infère les préférences utilisateur depuis le comportement comprend le RL inverse — il apprend la récompense à partir de ce que les gens choisissent réellement

Inscrivez-vous pour déverrouiller chaque classe de ce cours — le déroulé complet, le tuteur IA et le quiz.

Parler aux admissions
15

Présenter et réfléchir — RL pour l'IA agentique

VerrouilléTH2PR1PNW2

Aperçu de classe verrouillée

Un gestionnaire d'intégration d'IA qui présente une conception RL-pour-agents prouve qu'il comprend comment l'IA moderne est alignée et optimisée

Inscrivez-vous pour déverrouiller chaque classe de ce cours — le déroulé complet, le tuteur IA et le quiz.

Parler aux admissions

Déverrouiller les 15 classes

Obtenez le déroulé complet, le tuteur IA et le quiz pour chaque classe de 3.5 · Algorithmes d'apprentissage par renforcement.

S'inscrire via les admissions

Le paiement en ligne n'est pas encore en service — contactez les admissions pour vous inscrire.