Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Introducción al AIOps predictivo
- Visión general de la analítica predictiva en las operaciones de TI.
- Fuentes de datos para la predicción (registros, métricas, eventos).
- Conceptos clave en el pronóstico de series temporales y patrones de anomalías.
Diseño de modelos de predicción de incidentes
- Etiquetado de incidentes históricos y comportamiento del sistema.
- Selección y entrenamiento de modelos (p. ej., LSTM, Random Forest, AutoML).
- Evaluación del rendimiento del modelo y manejo de falsos positivos.
Recolección de datos e ingeniería de características
- Ingesta y alineación de datos de registros y métricas como entrada para el modelo.
- Extracción de características a partir de datos estructurados y no estructurados.
- Manejo de ruido y datos faltantes en pipelines operativos.
Automatización del análisis de causa raíz (RCA)
- Correlación basada en grafos de servicios e infraestructura.
- Uso de ML para inferir causas raíz probables a partir de cadenas de eventos.
- Visualización del RCA con tableros conscientes de la topología.
Remediación y automatización de flujos de trabajo
- Integración con plataformas de automatización (p. ej., Ansible, Rundeck).
- Activación de reversiones, reinicios o redirección de tráfico.
- Auditoría y documentación de intervenciones automatizadas.
Escalado de pipelines de AIOps inteligentes
- MLOps para observabilidad: reentrenamiento y versionado de modelos.
- Ejecución de predicciones en tiempo real en nodos distribuidos.
- Mejores prácticas para el despliegue de AIOps en entornos de producción.
Estudios de casos y aplicaciones prácticas
- Análisis de datos de incidentes reales utilizando modelos de AIOps predictivos.
- Despliegue de pipelines de RCA con datos sintéticos y de producción.
- Revisión de casos de uso en la industria: cortes de servicio en la nube, inestabilidad de microservicios, degradación de red.
Resumen y próximos pasos
Requerimientos
- Experiencia con sistemas de monitoreo como Prometheus o ELK.
- Conocimiento práctico de Python y principios básicos de aprendizaje automático.
- Familiaridad con los flujos de trabajo de gestión de incidentes.
Público objetivo
- Ingenieros senior de confiabilidad de sitios (SRE).
- Arquitectos de automatización de TI.
- Líderes de plataformas DevOps y de observabilidad.
14 Horas