Ponte en Contacto

Temario del curso

Introducción al AIOps predictivo

  • Visión general de la analítica predictiva en las operaciones de TI.
  • Fuentes de datos para la predicción (registros, métricas, eventos).
  • Conceptos clave en el pronóstico de series temporales y patrones de anomalías.

Diseño de modelos de predicción de incidentes

  • Etiquetado de incidentes históricos y comportamiento del sistema.
  • Selección y entrenamiento de modelos (p. ej., LSTM, Random Forest, AutoML).
  • Evaluación del rendimiento del modelo y manejo de falsos positivos.

Recolección de datos e ingeniería de características

  • Ingesta y alineación de datos de registros y métricas como entrada para el modelo.
  • Extracción de características a partir de datos estructurados y no estructurados.
  • Manejo de ruido y datos faltantes en pipelines operativos.

Automatización del análisis de causa raíz (RCA)

  • Correlación basada en grafos de servicios e infraestructura.
  • Uso de ML para inferir causas raíz probables a partir de cadenas de eventos.
  • Visualización del RCA con tableros conscientes de la topología.

Remediación y automatización de flujos de trabajo

  • Integración con plataformas de automatización (p. ej., Ansible, Rundeck).
  • Activación de reversiones, reinicios o redirección de tráfico.
  • Auditoría y documentación de intervenciones automatizadas.

Escalado de pipelines de AIOps inteligentes

  • MLOps para observabilidad: reentrenamiento y versionado de modelos.
  • Ejecución de predicciones en tiempo real en nodos distribuidos.
  • Mejores prácticas para el despliegue de AIOps en entornos de producción.

Estudios de casos y aplicaciones prácticas

  • Análisis de datos de incidentes reales utilizando modelos de AIOps predictivos.
  • Despliegue de pipelines de RCA con datos sintéticos y de producción.
  • Revisión de casos de uso en la industria: cortes de servicio en la nube, inestabilidad de microservicios, degradación de red.

Resumen y próximos pasos

Requerimientos

  • Experiencia con sistemas de monitoreo como Prometheus o ELK.
  • Conocimiento práctico de Python y principios básicos de aprendizaje automático.
  • Familiaridad con los flujos de trabajo de gestión de incidentes.

Público objetivo

  • Ingenieros senior de confiabilidad de sitios (SRE).
  • Arquitectos de automatización de TI.
  • Líderes de plataformas DevOps y de observabilidad.
 14 Horas

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas