Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Soberanía de la IA y despliegue local de LLM
- Riesgos de los LLMs en la nube: retención de datos, entrenamiento con entradas, jurisdicción extranjera.
- Arquitectura de Ollama: servidor de modelos, registro y API compatible con OpenAI.
- Comparación con vLLM, llama.cpp y Text Generation Inference.
- Licencias de modelos: términos de Llama, Mistral, Qwen y Gemma.
Instalación y configuración del hardware
- Instalación de Ollama en Linux con soporte CUDA y ROCm.
- Respaldos solo para CPU y optimización AVX/AVX2.
- Despliegue con Docker y mapeo de volúmenes persistentes.
- Configuración multi-GPU y estrategias de asignación de VRAM.
Gestión de modelos
- Obtención de modelos desde el registro de Ollama: ollama pull llama3.
- Importación de modelos GGUF desde HuggingFace y TheBloke.
- Compensaciones entre niveles de cuantización: Q4_K_M, Q5_K_M, Q8_0.
- Límites de cambio de modelo y carga simultánea de modelos.
Modelfiles personalizados
- Sintaxis de escritura de Modelfile: FROM, PARAMETER, SYSTEM, TEMPLATE.
- Ajuste de temperatura, top_p y penalización por repetición.
- Ingeniería de indicaciones del sistema para comportamientos específicos de rol.
- Creación y publicación de modelos personalizados en el registro local.
Integración de API
- Endpoint /v1/chat/completions compatible con OpenAI.
- Respuestas en streaming y modo JSON.
- Integración con LangChain, LlamaIndex y aplicaciones personalizadas.
- Autenticación y limitación de tasa con proxy inverso.
Optimización del rendimiento
- Tamaño de la ventana de contexto y gestión del caché KV.
- Inferencia por lotes y manejo paralelo de solicitudes.
- Asignación de hilos de CPU y conciencia de NUMA.
- Monitoreo de utilización de GPU y presión de memoria.
Seguridad y cumplimiento
- Aislamiento de red para puntos finales de servicio de modelos.
- Pipelines de filtrado de entradas y moderación de salidas.
- Registro de auditoría de indicaciones y completados.
- Procedencia de modelos y verificación de hash.
Requerimientos
- Administración intermedia de Linux y contenedores.
- Comprensión de alto nivel de modelos de aprendizaje automático y transformadores.
- Familiaridad con APIs REST y JSON.
Público objetivo
- Ingenieros de IA y desarrolladores que reemplazan APIs de LLM en la nube.
- Organizaciones con sensibilidad de datos que impiden el uso de modelos en la nube.
- Equipos gubernamentales y de defensa que requieren modelos de lenguaje completamente aislados (air-gapped).
14 Horas