Vergleichen Sie wertbasierte und policybasierte Verfahren für aufeinanderfolgende Entscheidungen.
Der Lernpfad führt von Markov-Entscheidungsprozessen und Lernzielen über Wert- und Policy-Verfahren zu Fitted Value Iteration und deterministischen Policy Gradients. Sie setzen Methoden mit Aktionsräumen, Datenerhebung und Stabilität in Beziehung und unterscheiden algorithmische Ideen von Erfolgsgarantien. Die Videos sind englischsprachig; die originären Lernnotizen und Aufgaben sind keine Transkripte.
Ein sequenzielles Entscheidungsproblem mit Zuständen, Aktionen, Belohnungen, Übergängen und einer Policy darstellen. Wertschätzung und direkte Policy-Optimierung vergleichen und erklären, wann kontinuierliche Aktionen deterministische Policy Gradients nahelegen. Eine Evaluation entwerfen, die Lernfortschritt von zuverlässiger Aufgabenleistung trennt und passende Baselines nennt.
Vorkenntnisse zu neuronalen Netzen, Wahrscheinlichkeit und überwachtem Lernen sind empfehlenswert. Erfahrung mit Funktionen, Optimierungszielen und einfachem Python oder Pseudocode ist hilfreich; ein bestimmtes Framework ist nicht erforderlich.
Erfahrene Lernende, die fortgeschrittene KI-Kenntnisse vertiefen und anwenden möchten
Menschen, die am besten mit Beispielen, Anleitung und praktischen Übungen lernen
Fachleute, Kreative und unabhängige Entwickler, die wiederholbare Abläufe suchen
Lektion 1 ist kostenlos
4 lektionen · Fortgeschritten · Vollständiger Kurs.
Dieser Kurs verwendet CC BY-lizenziertes Material mit Namensnennung des Inhaltsanbieters oder Uploaders. Die Wiedergabe der Lektionen ist erst nach Anmeldung und bestandener Veröffentlichungs- und Lizenzprüfung verfügbar.