Contacta con nosotros

Temario del curso

Infraestructura como Código para EXO

  • Visión general de los patrones de despliegue de EXO: clústeres de nodo único, multi-nodo y RDMA
  • Automatización de la instalación de dependencias (Xcode, uv, Node.js, Rust) mediante gestión de configuraciones
  • Uso de flakes de Nix para generar entornos de desarrollo y compilaciones reproducibles de EXO
  • Escritura de playbooks de Ansible o scripts de shell para el aprovisionamiento no supervisado del clúster

Compilaciones Reproducibles e Integración con CI

  • Fijar dependencias y compilar el panel de control en las tuberías (pipelines) de CI
  • Ejecutar pruebas básicas de EXO en ejecutores de GitHub Actions o GitLab CI
  • Crear imágenes base estándar y flujos de trabajo de retroceso basados en instantáneas para máquinas virtuales macOS y Linux
  • Versionar tarjetas de modelos personalizados junto con el código de la aplicación

Descubrimiento de Clústeres y Automatización de Redes

  • Configuración de mDNS y DNS estático para un descubrimiento fiable de nodos libp2p
  • Automatizar la creación de perfiles de red y la gestión de puentes Thunderbolt en macOS
  • Uso de espacios de nombres personalizados (EXO_LIBP2P_NAMESPACE) para separar clústeres de desarrollo, staging y producción
  • Reglas de cortafuegos y segmentación de red para entornos multiinquilino

Gestión del Ciclo de Vida de Almacenamiento y Modelos

  • Diseño de estrategias para EXO_MODELS_DIRS y EXO_MODELS_READ_ONLY_DIRS
  • Montaje de comparticiones NFS o SAN como repositorios de modelos de solo lectura para un aprovisionamiento rápido
  • Colección de basura de cachés desactualizadas y políticas de retención de pesos versionados
  • Automatizar la descarga previa de modelos y las comprobaciones de estado antes de actualizaciones en cascada (rolling updates)

Monitorización y Alertas

  • Envío de logs de EXO a un registro centralizado (ELK, Loki o Splunk)
  • Construcción de paneles de control en Grafana a partir de la salida EXO_TRACING_ENABLED
  • Alertas sobre cambios en la membresía del clúster, eventos OOM (Out of Memory) y picos de latencia de inferencia
  • Correlacionar telemetría de hardware macmon con regresiones en el rendimiento del modelo

Actualización, Retroceso y Recuperación ante Desastres

  • Pruebas de actualizaciones de binarios EXO en un nodo canario antes del despliegue generalizado a toda la flota
  • Retroceso a nivel de modelo: cambio entre versiones cuantificadas sin necesidad de descargar nuevamente
  • Respaldo y restauración del estado del clúster, espacios de nombres personalizados y pesos en caché
  • Documentación de libros de procedimientos para la recuperación ante escenarios de reconstrucción total del clúster

Endurecimiento de Seguridad y Cumplimiento Normativo

  • Aplicación de TLS en la capa de proxy inverso (nginx, traefik) para el panel de control y la API
  • Implementación de limitación de velocidad de API y listas blancas de IPs para los extremos de EXO
  • Aislamiento de clústeres mediante VLANs y políticas de red de confianza cero (zero-trust)
  • Auditoría de accesos y mantenimiento de un inventario de modelos implementados y sus versiones

Requerimientos

  • Experiencia con prácticas DevOps (CI/CD, IaC, orquestación de contenedores)
  • Familiaridad con la administración de sistemas y gestión de paquetes en macOS o Linux
  • Comprensión de conceptos de redes, DNS y almacenamiento

Público Objetivo

  • Ingenieros DevOps
  • Arquitectos de infraestructura
  • Especialistas en SRE responsables de cargas de trabajo de IA on-premise
 21 Horas

Número de participantes


Precio por participante

Reseñas (2)

Próximos cursos

Categorías Relacionadas