Aprendizaje por refuerzo: métodos de valor y gradientes de política

Compara métodos basados en valores y políticas para tomar decisiones secuenciales.

¿Buscas tutoriales paso a paso sobre herramientas de IA concretas?

Descripción del curso

Recorrido desde los procesos de decisión de Markov y los objetivos de aprendizaje hasta los métodos de valor y política, la iteración de valor ajustada y los gradientes deterministas de política. Relaciona los métodos con espacios de acción, recopilación de datos y estabilidad, sin confundir una idea algorítmica con una garantía de éxito. Los vídeos son en inglés; las notas y actividades originales no reproducen sus transcripciones.

Representar un problema secuencial mediante estados, acciones, recompensas, transiciones y una política. Comparar la estimación de valores con la optimización directa de políticas e indicar cuándo las acciones continuas motivan gradientes deterministas. Diseñar una evaluación que separe el progreso de aprendizaje del rendimiento fiable e incluya referencias pertinentes.

Se recomienda conocer redes neuronales, probabilidad y aprendizaje supervisado. Ayuda tener nociones de funciones, objetivos de optimización y Python básico o pseudocódigo; no se requiere un marco específico.

Personas con experiencia que quieren profundizar y aplicar habilidades avanzadas de IA

Quienes aprenden mejor con ejemplos, lecciones guiadas y práctica

Profesionales, creadores y desarrolladores independientes que buscan un flujo de trabajo repetible

La lección 1 es gratis

4 lecciones · Avanzado · Curso completo.

Contenido de curso con licencia abierta · licencia CC BY · licencia verificada

Este curso utiliza material con licencia CC BY atribuido a su proveedor de contenido o a quien lo publicó. La reproducción de las lecciones solo está disponible tras iniciar sesión y superar las comprobaciones de publicación y licencia.