Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Introducción a los Modelos Multimodales Mistral
- Descripción general de Mistral Medium y capacidades multimodales.
- Modelos OCR/documento y casos de uso.
- Integración con ecosistemas de código abierto.
Canalizaciones de OCR y Visión
- Fundamentos del OCR con modelos Mistral.
- Procesamiento previo de imágenes y documentos escaneados.
- Extracción de texto estructurado de imágenes.
Comprensión de Documentos
- Diseño de canalizaciones de PLN para documentos.
- Reconocimiento de entidades, resumen y clasificación.
- Vinculación transversal de datos de texto y visión.
Aplicaciones de Búsqueda y Conocimiento
- Sistemas de búsqueda de visión y texto.
- Construcción de búsqueda semántica con salidas de OCR.
- Repositorios empresariales de documentos.
Aplicaciones Asistencia e Interactivas
- Diseño UI para asistentes multimodales.
- Aplicaciones de accesibilidad (por ejemplo, conversión de visión a texto).
- Herramientas de productividad del mundo real.
Rendimiento y Optimización
- Escalado de canalizaciones multimodales.
- Ajuste del rendimiento de inferencia.
- Evaluación de compensaciones entre precisión y eficiencia.
Casos de Estudio y Direcciones Futuras
- Aplicaciones industriales de IA multimodal.
- Tendencias de investigación en OCR e IA documental.
- Consideraciones de IA responsable en tareas de visión y texto.
Resumen y Próximos Pasos
Requerimientos
- Comprensión de los conceptos de procesamiento de lenguaje natural (PLN).
- Experiencia con Python y marcos de aprendizaje automático (ML).
- Familiaridad con los fundamentos de la visión por computadora.
Público objetivo
- Equipos de producto.
- Investigadores de ML.
- Ingenieros aplicados de ML.
14 Horas