Contacta con nosotros

Temario del curso

Introducción al aprendizaje por refuerzo a partir de retroalimentación humana (RLHF)

  • Qué es RLHF y por qué importa.
  • Comparación con métodos de ajuste fino supervisado.
  • Aplicaciones de RLHF en sistemas modernos de inteligencia artificial.

Modelado de recompensas con retroalimentación humana

  • Recopilación y estructuración de la retroalimentación humana.
  • Construcción y entrenamiento de modelos de recompensa.
  • Evaluación de la efectividad de los modelos de recompensa.

Entrenamiento con Optimización de Política Cercana (PPO)

  • Vista general de los algoritmos PPO para RLHF.
  • Implementación de PPO con modelos de recompensa.
  • Ajuste fino iterativo y seguro de los modelos.

Ajuste fino práctico de modelos de lenguaje

  • Preparación de conjuntos de datos para flujos de trabajo de RLHF.
  • Ajuste fino práctico de un modelo de lenguaje pequeño (LLM) utilizando RLHF.
  • Desafíos y estrategias de mitigación.

Escalar RLHF a sistemas de producción

  • Consideraciones sobre infraestructura y capacidad de cómputo.
  • Aseguramiento de la calidad y bucles de retroalimentación continua.
  • Mejores prácticas para el despliegue y el mantenimiento.

Consideraciones éticas y mitigación del sesgo

  • Abordaje de los riesgos éticos en la retroalimentación humana.
  • Estrategias de detección y corrección de sesgos.
  • Garantía de alineación y salidas seguras.

Casos de estudio y ejemplos del mundo real

  • Caso de estudio: Ajuste fino de ChatGPT con RLHF.
  • Otros despliegues exitosos de RLHF.
  • Lecciones aprendidas e perspectivas de la industria.

Resumen y siguientes pasos

Requerimientos

  • Comprensión de los fundamentos del aprendizaje supervisado y del aprendizaje por refuerzo.
  • Experiencia con el ajuste fino de modelos y arquitecturas de redes neuronales.
  • Conocimiento de la programación en Python y de frameworks de aprendizaje profundo (por ejemplo, TensorFlow, PyTorch).

Público objetivo

  • Ingenieros de aprendizaje automático.
  • Investigadores de inteligencia artificial.
 14 Horas

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas