Contacta con nosotros

Temario del curso

Introducción a los modelos multimodales Mistral

  • Descripción general de Mistral Medium y sus capacidades multimodales.
  • Modelos de OCR/documento y casos de uso.
  • Integración con ecosistemas de código abierto.

Pipelines de OCR y visión

  • Fundamentos de OCR con modelos Mistral.
  • Preprocesamiento de imágenes y documentos escaneados.
  • Extracción de texto estructurado a partir de imágenes.

Comprensión de documentos

  • Diseño de pipelines de PLN para documentos.
  • Reconocimiento de entidades, resumen y clasificación.
  • Vinculación multimodal entre datos de texto e imagen.

Búsquedas y aplicaciones de conocimiento

  • Sistemas de búsqueda texto-imagen.
  • Construcción de búsquedas semánticas con salidas de OCR.
  • Repositorios empresariales de documentos.

Aplicaciones asistenciales e interactivas

  • Diseño de interfaz para asistentes multimodales.
  • Aplicaciones de accesibilidad (p. ej., de imagen a texto).
  • Herramientas de productividad del mundo real.

Rendimiento y optimización

  • Escalado de pipelines multimodales.
  • Tunear el rendimiento de inferencia.
  • Evaluar los compromisos entre precisión e eficiencia.

Casos de estudio y perspectivas futuras

  • Aplicaciones industriales de la IA multimodal.
  • Tendencias de investigación en OCR e IA de documentos.
  • Consideraciones de IA responsable en tareas texto-imagen.

Resumen y siguientes pasos

Requerimientos

  • Comprensión de los conceptos de procesamiento del lenguaje natural.
  • Experiencia con Python y frameworks de ML.
  • Conocimiento básico de visión por computadora.

Público objetivo

  • Equipos de producto.
  • Investigadores de ML.
  • Ingenieros de ML aplicados.
 14 Horas

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas