Contacta con nosotros

Temario del curso

1. Introducción al Aprendizaje por Refuerzo Profundo

  • ¿Qué es el Aprendizaje por Refuerzo?
  • Diferencias entre Aprendizaje Supervisado, No supervisado y por Refuerzo
  • Aplicaciones del DRL en 2025 (robótica, atención médica, finanzas, logística)
  • Comprensión del ciclo de interacción entre agente y entorno

2. Fundamentos del Aprendizaje por Refuerzo

  • Procesos de Decisión de Markov (MDP)
  • Funciones de estado, acción, recompensa, política y valor
  • Compromiso entre exploración y explotación
  • Métodos Monte Carlo y aprendizaje por diferencia temporal (TD)

3. Implementación de algoritmos básicos de RL

  • Métodos tabulares: Programación dinámica, evaluación y iteración de políticas
  • Q-Learning y SARSA
  • Exploración epsilon-greedy y estrategias de decrecimiento
  • Implementación de entornos RL con OpenAI Gymnasium

4. Transición al Aprendizaje por Refuerzo Profundo

  • Limitaciones de los métodos tabulares
  • Uso de redes neuronales para aproximación de funciones
  • Arquitectura y flujo de trabajo de la Red Neuronal Q Profunda (DQN)
  • Rejilla de experiencias y redes objetivo

5. Algoritmos avanzados de DRL

  • Double DQN, Dueling DQN y Rejilla de Experiencias Priorizada
  • Métodos de Gradiente de Política: algoritmo REINFORCE
  • Arquitecturas Actor-Crítico (A2C, A3C)
  • Optimización por Política Proxima (PPO)
  • Actor-Crítico Suave (SAC)

6. Trabajo con espacios de acción continuos

  • Desafíos en el control continuo
  • Uso de DDPG (Gradiente de Política Determinista Profunda)
  • DDPG Gemelo Retrasado (TD3)

7. Herramientas y marcos de trabajo prácticos

  • Uso de Stable-Baselines3 y Ray RLlib
  • Registro y monitoreo con TensorBoard
  • Ajuste de hiperparámetros para modelos DRL

8. Ingeniería de recompensas y diseño del entorno

  • Moldeado de recompensas y balanceo de penalizaciones
  • Conceptos de aprendizaje por transferencia de simulación a la realidad
  • Creación de entornos personalizados en Gymnasium

9. Entornos parcialmente observables y generalización

  • Manejo de información incompleta del estado (POMDP)
  • Enfoques basados en memoria utilizando LSTMs y RNNs
  • Mejora de la robustez y generalización del agente

10. Teoría de juegos y Aprendizaje por Refuerzo Multiagente

  • Introducción a entornos multiagente
  • Cooperación vs. competencia
  • Aplicaciones en entrenamiento adversarial y optimización de estrategias

11. Estudios de caso y aplicaciones del mundo real

  • Simulaciones de conducción autónoma
  • Precios dinámicos y estrategias de trading financiero
  • Robótica y automatización industrial

12. Diagnóstico y optimización

  • Diagnóstico de entrenamiento inestable
  • Gestión de la escasez de recompensas y sobreajuste
  • Escalado de modelos DRL en GPUs y sistemas distribuidos

13. Resumen y próximos pasos

  • Recapitulación de la arquitectura DRL y algoritmos clave
  • Tendencias industriales y direcciones de investigación (por ejemplo, RLHF, modelos híbridos)
  • Recursos adicionales y material de lectura

Requerimientos

  • Proficiencia en programación con Python
  • Comprensión de Cálculo y Álgebra Lineal
  • Conocimientos básicos de Probabilidad y Estadística
  • Experiencia construyendo modelos de aprendizaje automático utilizando Python y NumPy o TensorFlow/PyTorch

Público objetivo

  • Desarrolladores interesados en IA y sistemas inteligentes
  • Científicos de datos que exploran marcos de trabajo de aprendizaje por refuerzo
  • Ingenieros de Aprendizaje Automático trabajando con sistemas autónomos
 21 Horas

Número de participantes


Precio por participante

Reseñas (3)

Próximos cursos

Categorías Relacionadas