Vergelijk waardegestuurde en beleidsgerichte methoden voor opeenvolgende beslissingen.
Van Markov-beslissingsprocessen en leerdoelen via waarde- en beleidsmethoden naar fitted value iteration en deterministische policy gradients. Je koppelt methoden aan actieruimten, gegevensverzameling en stabiliteit, en onderscheidt algoritmische ideeën van garanties voor succesvolle besturing. De video's zijn Engelstalig; deze oorspronkelijke studienotities en opdrachten zijn geen transcripties.
Beschrijf een opeenvolgend beslissingsprobleem met toestanden, acties, beloningen, overgangen en een beleid. Vergelijk waardeschatting met directe beleidsoptimalisatie en benoem wanneer continue acties deterministische policy gradients motiveren. Ontwerp een evaluatie die leerprogressie onderscheidt van betrouwbare taakprestaties en passende baselines vermeldt.
Kennis van neurale netwerken, kansrekening en begeleid leren is aanbevolen. Ervaring met functies, optimalisatiedoelen en eenvoudige Python of pseudocode helpt; een specifiek framework is niet nodig.
Ervaren cursisten die geavanceerde AI-vaardigheden willen verdiepen en toepassen
Mensen die het beste leren met voorbeelden, begeleide lessen en praktische oefeningen
Professionals, makers en zelfstandige bouwers die een herhaalbare werkwijze zoeken
Les 1 is gratis
4 lessen · Gevorderd · Volledige cursus.
Deze cursus gebruikt CC BY-gelicentieerd materiaal met naamsvermelding van de inhoudsprovider of uploader. Lesvideo’s zijn alleen na aanmelding beschikbaar wanneer de publicatie- en licentiecontroles zijn geslaagd.