Compara métodos basados en valores y políticas para tomar decisiones secuenciales.
Recorrido desde los procesos de decisión de Markov y los objetivos de aprendizaje hasta los métodos de valor y política, la iteración de valor ajustada y los gradientes deterministas de política. Relaciona los métodos con espacios de acción, recopilación de datos y estabilidad, sin confundir una idea algorítmica con una garantía de éxito. Los vídeos son en inglés; las notas y actividades originales no reproducen sus transcripciones.
Representar un problema secuencial mediante estados, acciones, recompensas, transiciones y una política. Comparar la estimación de valores con la optimización directa de políticas e indicar cuándo las acciones continuas motivan gradientes deterministas. Diseñar una evaluación que separe el progreso de aprendizaje del rendimiento fiable e incluya referencias pertinentes.
Se recomienda conocer redes neuronales, probabilidad y aprendizaje supervisado. Ayuda tener nociones de funciones, objetivos de optimización y Python básico o pseudocódigo; no se requiere un marco específico.
Personas con experiencia que quieren profundizar y aplicar habilidades avanzadas de IA
Quienes aprenden mejor con ejemplos, lecciones guiadas y práctica
Profesionales, creadores y desarrolladores independientes que buscan un flujo de trabajo repetible
La lección 1 es gratis
4 lecciones · Avanzado · Curso completo.
Este curso utiliza material con licencia CC BY atribuido a su proveedor de contenido o a quien lo publicó. La reproducción de las lecciones solo está disponible tras iniciar sesión y superar las comprobaciones de publicación y licencia.