Ponte en Contacto
 Duración 21 horas

Temario del curso

Introducción a la escala de Ollama

  • Arquitectura de Ollama y consideraciones para su escalado
  • Cuellos de botella comunes en despliegues de múltiples usuarios
  • Mejores prácticas para la preparación de la infraestructura

Asignación de recursos y optimización de GPU

  • Estrategias para la utilización eficiente de CPU/GPU
  • Consideraciones de memoria y ancho de banda
  • Restricciones de recursos a nivel de contenedor

Despliegue con contenedores y Kubernetes

  • Contenerización de Ollama con Docker
  • Ejecución de Ollama en clústeres de Kubernetes
  • Equilibrio de carga (load balancing) y descubrimiento de servicios

Escala automática y agrupación por lotes

  • Diseño de políticas de escala automática para Ollama
  • Técnicas de inferencia por lotes para optimizar el rendimiento
  • Compromisos entre latencia y rendimiento

Optimización de la latencia

  • Perfiles de rendimiento de la inferencia
  • Estrategias de almacenamiento en caché (caching) y calentamiento del modelo
  • Reducción de la sobrecarga de E/S y comunicación

Monitoreo y observabilidad

  • Integración de Prometheus para métricas
  • Creación de paneles con Grafana
  • Alertas y respuesta ante incidentes para la infraestructura de Ollama

Gestión de costos y estrategias de escalado

  • Asignación de GPU consciente de los costos
  • Consideraciones de despliegue en la nube frente a local (on-prem)
  • Estrategias para un escalado sostenible

Resumen y próximos pasos

Requerimientos

  • Experiencia en administración de sistemas Linux
  • Comprensión de la contenerización y orquestación
  • Conocimiento sobre el despliegue de modelos de aprendizaje automático

Público objetivo

  • Ingenieros de DevOps
  • Equipos de infraestructura de ML
  • Ingenieros de confiabilidad del sitio (SRE)

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas