Comparez les méthodes fondées sur la valeur et sur la politique pour les décisions séquentielles.
Ce parcours va des processus décisionnels de Markov et des objectifs d’apprentissage aux méthodes de valeur et de politique, puis à l’itération de valeur ajustée et aux gradients de politique déterministes. Reliez les méthodes aux espaces d’action, à la collecte de données et à la stabilité, sans confondre idée algorithmique et garantie de réussite. Les vidéos sont en anglais ; les notes et travaux originaux ne reproduisent pas leur transcription.
Représenter un problème de décision séquentielle par ses états, actions, récompenses, transitions et politique. Comparer estimation de la valeur et optimisation directe d’une politique, et expliquer quand des actions continues motivent les gradients déterministes. Concevoir une évaluation qui distingue progrès d’apprentissage et performance fiable, avec des références pertinentes.
Une connaissance préalable des réseaux de neurones, des probabilités et de l’apprentissage supervisé est recommandée. Les fonctions, objectifs d’optimisation et notions de Python ou de pseudocode sont utiles ; aucun cadre logiciel particulier n’est requis.
Aux apprenants expérimentés souhaitant approfondir et appliquer des compétences avancées en IA
Aux personnes qui apprennent mieux avec des exemples, des leçons guidées et de la pratique
Aux professionnels, créateurs et développeurs indépendants recherchant une méthode reproductible
La leçon 1 est gratuite
4 leçons · Avancé · Cours complet.
Ce cours utilise du contenu sous licence CC BY attribué à son fournisseur ou à la personne qui l’a mis en ligne. La lecture des leçons est disponible uniquement après authentification et validation des contrôles de publication et de licence.