Ponte en Contacto

Temario del curso

El panorama de la observabilidad con IA

  • De los paneles de control a las conversaciones: el cambio hacia una observabilidad aumentada por IA
  • Capacidades de LLM relevantes para la observabilidad: resumen, razonamiento y coincidencia de patrones
  • Patrones de arquitectura: integración de IA en pilas de observabilidad existentes

Consulta de telemetría con lenguaje natural

  • De texto a PromQL: traducción de lenguaje natural a consultas de monitoreo
  • Consultas en lenguaje natural para almacenes de registros de Elasticsearch, OpenSearch y Loki
  • Generación de SQL a partir de lenguaje natural para telemetría estructurada
  • Construcción de un agente asistente de consultas con uso de herramientas y conciencia contextual

Análisis de registros potenciado por LLM

  • Análisis y estructuración automática de registros con LLM
  • Detección de anomalías en flujos de registros mediante similitud de incrustaciones (embeddings)
  • Agrupación de registros y descubrimiento de patrones a gran escala
  • Generación de explicaciones legibles por humanos a partir de secuencias de registros en bruto

Alertas inteligentes y enriquecimiento de incidentes

  • Correlación y deduplicación de alertas con comprensión semántica
  • Recolección automatizada de contexto de incidentes a partir de manuales de operación, incidentes anteriores y documentación
  • Enrutamiento inteligente de alertas basado en la comprensión del contenido y la experiencia del equipo
  • Reducción de la fatiga de alertas mediante la reducción de ruido impulsada por IA

Análisis de causa raíz asistido por IA

  • Generación de hipótesis a partir de la correlación de telemetría multi-fuente
  • Cadena de evidencias: conexión de síntomas entre métricas, registros y trazas
  • Troubleshooting guiado con sesiones interactivas de diagnóstico por IA
  • Construcción de un agente de análisis de causa raíz con investigación progresiva

Respuesta automática a incidentes y comunicación

  • Generación de resúmenes de incidentes y actualizaciones de estado a partir de telemetría
  • Redacción automatizada de post-mortem con reconstrucción de línea de tiempo
  • Comunicación con partes interesadas adaptada a audiencias técnicas y ejecutivas
  • Sugerencias de manuales de operación y recomendaciones de remediación automática

Machine Learning para observabilidad

  • Pronóstico de series temporales para la planificación de capacidad y predicción de anomalías
  • Modelos fundamentales para la detección de anomalías sin entrenamiento previo (zero-shot) en métricas
  • Mapeo de dependencias de servicios y descubrimiento de topología basados en incrustaciones (embeddings)
  • Entrenamiento y despliegue de modelos ligeros de ML junto a los pipelines de observabilidad

Despliegue en producción y ética

  • Consideraciones de latencia y costos para la observabilidad en tiempo real con IA
  • Privacidad de datos: asegurar que los LLM no filtren telemetría sensible
  • Supervisión humana: cuándo el diagnóstico por IA requiere validación por un operador
  • Medición del impacto: métricas de MTTD, MTTR y experiencia de guardia (on-call)

Requerimientos

  • Experiencia con herramientas de observabilidad como Prometheus, Grafana, Datadog u OpenTelemetry.
  • Familiaridad con conceptos de gestión de registros y métricas.
  • Conocimientos básicos de scripting en Python para procesamiento de datos.

Audiencia objetivo

  • Ingenieros de SRE y observabilidad que adoptan herramientas mejoradas con IA.
  • Ingenieros de plataforma que construyen pipelines de monitoreo de próxima generación.
  • Líderes de DevOps que evalúan la integración de LLM en flujos de trabajo de incidentes.
 14 Horas

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas