Reinforcement learning: waardemethoden en policy gradients

Vergelijk waardegestuurde en beleidsgerichte methoden voor opeenvolgende beslissingen.

Op zoek naar stapsgewijze tutorials voor afzonderlijke AI-tools?

Cursusoverzicht

Van Markov-beslissingsprocessen en leerdoelen via waarde- en beleidsmethoden naar fitted value iteration en deterministische policy gradients. Je koppelt methoden aan actieruimten, gegevensverzameling en stabiliteit, en onderscheidt algoritmische ideeën van garanties voor succesvolle besturing. De video's zijn Engelstalig; deze oorspronkelijke studienotities en opdrachten zijn geen transcripties.

Beschrijf een opeenvolgend beslissingsprobleem met toestanden, acties, beloningen, overgangen en een beleid. Vergelijk waardeschatting met directe beleidsoptimalisatie en benoem wanneer continue acties deterministische policy gradients motiveren. Ontwerp een evaluatie die leerprogressie onderscheidt van betrouwbare taakprestaties en passende baselines vermeldt.

Kennis van neurale netwerken, kansrekening en begeleid leren is aanbevolen. Ervaring met functies, optimalisatiedoelen en eenvoudige Python of pseudocode helpt; een specifiek framework is niet nodig.

Ervaren cursisten die geavanceerde AI-vaardigheden willen verdiepen en toepassen

Mensen die het beste leren met voorbeelden, begeleide lessen en praktische oefeningen

Professionals, makers en zelfstandige bouwers die een herhaalbare werkwijze zoeken

Les 1 is gratis

4 lessen · Gevorderd · Volledige cursus.

Cursusinhoud met open licentie · CC BY-gelicentieerd · licentie geverifieerd

Deze cursus gebruikt CC BY-gelicentieerd materiaal met naamsvermelding van de inhoudsprovider of uploader. Lesvideo’s zijn alleen na aanmelding beschikbaar wanneer de publicatie- en licentiecontroles zijn geslaagd.