Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Duración 21 horas
Temario del curso
Introducción a la IA multimodal y Ollama
- Visión general del aprendizaje multimodal
- Principales desafíos en la integración de visión y lenguaje
- Capacidades y arquitectura de Ollama
Configuración del entorno de Ollama
- Instalación y configuración de Ollama
- Trabajo con el despliegue de modelos locales
- Integración de Ollama con Python y Jupyter
Trabajo con entradas multimodales
- Integración de texto e imagen
- Incorporación de audio y datos estructurados
- Diseño de pipelines de preprocesamiento
Aplicaciones de comprensión documental
- Extracción de información estructurada de PDF e imágenes
- Combinación de OCR con modelos de lenguaje
- Construcción de flujos de trabajo inteligentes para el análisis de documentos
Respuesta a preguntas visuales (VQA)
- Configuración de conjuntos de datos y benchmarks de VQA
- Entrenamiento y evaluación de modelos multimodales
- Desarrollo de aplicaciones interactivas de VQA
Diseño de agentes multimodales
- Principios de diseño de agentes con razonamiento multimodal
- Combinación de percepción, lenguaje y acción
- Despliegue de agentes para casos de uso del mundo real
Integración avanzada y optimización
- Ajuste fino de modelos multimodales con Ollama
- Optimización del rendimiento de inferencia
- Consideraciones sobre escalabilidad y despliegue
Resumen y próximos pasos
Requerimientos
- Sólido conocimiento de los conceptos de aprendizaje automático.
- Experiencia con frameworks de aprendizaje profundo como PyTorch o TensorFlow.
- Conocimiento del procesamiento del lenguaje natural y la visión por computador.
Público objetivo
- Ingenieros de aprendizaje automático.
- Investigadores de IA.
- Desarrolladores de productos que integren flujos de trabajo de visión y texto.