Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Introducción a los modelos multimodales Mistral
- Descripción general de Mistral Medium y sus capacidades multimodales.
- Modelos de OCR/documento y casos de uso.
- Integración con ecosistemas de código abierto.
Pipelines de OCR y visión
- Fundamentos de OCR con modelos Mistral.
- Preprocesamiento de imágenes y documentos escaneados.
- Extracción de texto estructurado a partir de imágenes.
Comprensión de documentos
- Diseño de pipelines de PLN para documentos.
- Reconocimiento de entidades, resumen y clasificación.
- Vinculación multimodal entre datos de texto e imagen.
Búsquedas y aplicaciones de conocimiento
- Sistemas de búsqueda texto-imagen.
- Construcción de búsquedas semánticas con salidas de OCR.
- Repositorios empresariales de documentos.
Aplicaciones asistenciales e interactivas
- Diseño de interfaz para asistentes multimodales.
- Aplicaciones de accesibilidad (p. ej., de imagen a texto).
- Herramientas de productividad del mundo real.
Rendimiento y optimización
- Escalado de pipelines multimodales.
- Tunear el rendimiento de inferencia.
- Evaluar los compromisos entre precisión e eficiencia.
Casos de estudio y perspectivas futuras
- Aplicaciones industriales de la IA multimodal.
- Tendencias de investigación en OCR e IA de documentos.
- Consideraciones de IA responsable en tareas texto-imagen.
Resumen y siguientes pasos
Requerimientos
- Comprensión de los conceptos de procesamiento del lenguaje natural.
- Experiencia con Python y frameworks de ML.
- Conocimiento básico de visión por computadora.
Público objetivo
- Equipos de producto.
- Investigadores de ML.
- Ingenieros de ML aplicados.
14 Horas