Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Duración 21 horas
Temario del curso
Introducción a la escala de Ollama
- Arquitectura de Ollama y consideraciones para su escalado
- Cuellos de botella comunes en despliegues de múltiples usuarios
- Mejores prácticas para la preparación de la infraestructura
Asignación de recursos y optimización de GPU
- Estrategias para la utilización eficiente de CPU/GPU
- Consideraciones de memoria y ancho de banda
- Restricciones de recursos a nivel de contenedor
Despliegue con contenedores y Kubernetes
- Contenerización de Ollama con Docker
- Ejecución de Ollama en clústeres de Kubernetes
- Equilibrio de carga (load balancing) y descubrimiento de servicios
Escala automática y agrupación por lotes
- Diseño de políticas de escala automática para Ollama
- Técnicas de inferencia por lotes para optimizar el rendimiento
- Compromisos entre latencia y rendimiento
Optimización de la latencia
- Perfiles de rendimiento de la inferencia
- Estrategias de almacenamiento en caché (caching) y calentamiento del modelo
- Reducción de la sobrecarga de E/S y comunicación
Monitoreo y observabilidad
- Integración de Prometheus para métricas
- Creación de paneles con Grafana
- Alertas y respuesta ante incidentes para la infraestructura de Ollama
Gestión de costos y estrategias de escalado
- Asignación de GPU consciente de los costos
- Consideraciones de despliegue en la nube frente a local (on-prem)
- Estrategias para un escalado sostenible
Resumen y próximos pasos
Requerimientos
- Experiencia en administración de sistemas Linux
- Comprensión de la contenerización y orquestación
- Conocimiento sobre el despliegue de modelos de aprendizaje automático
Público objetivo
- Ingenieros de DevOps
- Equipos de infraestructura de ML
- Ingenieros de confiabilidad del sitio (SRE)