Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Introducción a la IA multimodal y Ollama
- Resumen del aprendizaje multimodal
- Principales desafíos en la integración visión-lenguaje
- Capacidades y arquitectura de Ollama
Configuración del entorno de Ollama
- Instalación y configuración de Ollama
- Trabajo con despliegue local de modelos
- Integración de Ollama con Python y Jupyter
Trabajo con entradas multimodales
- Integración de texto e imagen
- Incorporación de audio y datos estructurados
- Diseño de pipelines de preprocesamiento
Aplicaciones de comprensión de documentos
- Extracción de información estructurada de PDFs e imágenes
- Combinación de OCR con modelos de lenguaje
- Construcción de flujos de trabajo de análisis inteligente de documentos
Respuesta a Preguntas Visuales (VQA)
- Configuración de conjuntos de datos y benchmarks de VQA
- Entrenamiento y evaluación de modelos multimodales
- Construcción de aplicaciones VQA interactivas
Diseño de agentes multimodales
- Principios del diseño de agentes con razonamiento multimodal
- Combinación de percepción, lenguaje y acción
- Despliegue de agentes para casos de uso reales
Integración y optimización avanzadas
- Afinamiento de modelos multimodales con Ollama
- Optimización del rendimiento de inferencia
- Consideraciones de escalabilidad y despliegue
Resumen y próximos pasos
Requerimientos
- Sólida comprensión de conceptos de aprendizaje automático
- Experiencia con frameworks de aprendizaje profundo como PyTorch o TensorFlow
- Familiaridad con el procesamiento del lenguaje natural y la visión por computadora
Audiencia
- Ingenieros de aprendizaje automático
- Investigadores en IA
- Desarrolladores de productos que integren flujos de trabajo de visión y texto
21 Horas